Qué pasó
- Privatemode publicó el 24 de septiembre una prueba en que convierte GLM-5.3-Flash, un modelo de lenguaje de propósito general, en un sistema de decisiones tipadas con probabilidad por cada opción, en una sola pasada.
- El método no requiere ajuste fino del modelo. Numera las opciones, prefija el formato de respuesta y lee la distribución de probabilidad que el modelo asigna a cada número.
- Sobre 28 conjuntos de datos de texto, el resultado empata con Jev, un clasificador especializado: cada uno gana en 10 conjuntos y la diferencia mediana de 0,7 puntos porcentuales a favor de Jev no alcanza significancia estadística (p = 0,64).
- Los costos no empatan: 62 euros por millón de decisiones contra 16 euros del especializado. La latencia depende del origen de la petición: 180 ms contra 264 ms desde Alemania, 299 ms contra 164 ms desde Estados Unidos.
- El modelo genérico agrega algo que el especializado no hace: procesa imágenes, con 70,2% de exactitud clasificando documentos escaneados en 16 categorías sobre 1.600 muestras.
Por qué importa
- Para equipos que hoy mantienen un clasificador propio, la pregunta deja de ser de exactitud y pasa a ser de operación: cuánto cuesta el modelo entrenado más el ciclo de reentrenamiento, contra cuatro veces el costo de inferencia y cero mantenimiento de modelo.
- La diferencia de latencia según geografía es el dato que la publicación no subraya y que decide el caso en la región. Medida desde Estados Unidos, la ventaja se invierte; medida desde Sudamérica nadie la ha medido, y ahí es donde corre el tráfico local.
- El procesamiento de imágenes cambia el alcance: clasificar facturas o formularios escaneados con el mismo componente que clasifica texto elimina una integración entera del diagrama.
El dato
0,7 puntos porcentuales de diferencia mediana entre el modelo genérico y el clasificador especializado.
Contexto
Los modelos livianos de proveedores chinos llevan meses compitiendo por precio de inferencia más que por capacidad de frontera. Esta prueba mueve la discusión un paso: no compara dos modelos de lenguaje entre sí, sino un modelo de lenguaje contra la categoría de herramientas que se suponía que no debía tocar.
Qué viene
- Privatemode liberó la biblioteca en Python, un entorno interactivo de prueba y la metodología reproducible sobre 29 conjuntos de datos. Sin plazos anunciados para una segunda ronda de mediciones.
Cierre
El argumento habitual para mantener un clasificador propio era la exactitud. Esta medición lo deja en costo por decisión y latencia según dónde esté el servidor, que son dos problemas de ingeniería con respuesta conocida.
Fuentes
- Privatemode, «System One from GLM Flash»
- Nuestra cobertura previa: el precio por horario de DeepSeek Flash, los pesos abiertos de MiMo de Xiaomi y el plan gratuito de Mistral y el entrenamiento con datos de usuarios.
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


