Qué pasó
- Perceptron publicó el 25 de septiembre Mk1.5, un modelo para controlar agentes que operan sobre objetos físicos, según el anuncio en su propio blog. Recibe texto, imágenes, video y audio, y devuelve texto, puntos, cajas, polígonos, recortes y trayectorias de objetos.
- La compañía lo entrenó para emitir la trayectoria como geometría con marca de tiempo, en lugar de una detección suelta por fotograma. Con eso dice liderar tres de las cuatro pruebas de segmentación de objetos en video que midió: Molmo2-Track, Ref-DAVIS17 y ReasonVOS. En MeViS quedó adelante MolmoPoint-8B.
- En video en primera persona, el anuncio sostiene que Mk1.5 localiza manos 50% mejor que el modelo Gemini más fuerte que midieron.
- Está disponible desde ya por la plataforma de la empresa con 32.000 tokens de contexto multimodal y tarifa de US$ 0,15 por millón de tokens de entrada y US$ 1,50 por millón de salida. La propia empresa declara haberlo desplegado en drones, perros robot, gafas y teléfonos.
Por qué importa
- El caso de uso que la compañía nombra primero no es robótica industrial: es inventario en tienda y seguimiento de jugadores en una transmisión deportiva. Para un retail o una marca que patrocina deporte en Chile, eso baja el costo de medir qué se movió de la góndola o cuánto tiempo estuvo un logo en cámara.
- La promesa operativa concreta es la eliminación de la cadena de reidentificación que hoy va detrás de cualquier detector. Menos piezas propias que mantener significa menos desarrollo, y también menos control sobre el criterio con que el sistema decide que dos imágenes son el mismo objeto.
- Las cifras son de la propia empresa, medidas por la propia empresa. No hay verificación independiente, y el comparativo elige qué modelos entran a la tabla.
El dato
US$ 0,15 por millón de tokens de entrada, con 32.000 tokens de contexto multimodal.
Contexto
La capa de control para cuerpos físicos se está poblando rápido: NVIDIA ya convirtió los agentes en habilidades reutilizables dentro del robot y Alphabet liberó su base de robótica con licencia Apache. Lo que cambia acá es el precio de la percepción, no el del movimiento.
Qué viene
- Sin plazos anunciados. El modelo ya está publicado y la empresa no comprometió fechas para versiones siguientes ni para despliegue en infraestructura propia.
Cierre
Un modelo que sigue objetos por US$ 0,15 el millón vuelve barata la pregunta que antes no se hacía por costo: qué está pasando frente a la cámara que ya está instalada.
Fuentes
- Introducing Perceptron Mk1.5, blog de Perceptron, 25 de septiembre de 2026.
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.
%2022.41.55.s5Pwg7YZ_1SFzdB.webp)

