¿La IA está abandonando la era del chat «por turnos»?
En este momento, todos los que usamos modelos de IA regularmente para el trabajo o en nuestra vida personal sabemos que el modo de interacción básico entre texto, imágenes, audio y video sigue siendo el mismo: el usuario humano proporciona una entrada, espera entre milisegundos y minutos (o en algunos casos, para consultas particularmente difíciles, horas y días), y el modelo de IA proporciona un resultado.
Pero para que la IA realmente asuma la carga de trabajos que requieren interacción natural, necesitará hacer más que proporcionar este tipo de interactividad «por turnos»: en última instancia, necesitará responder de manera más fluida y natural a las acciones humanas, incluso respondiendo mientras procesa. el próximo entrada humana, ya sea texto u otro formato.
Ésa al menos parece ser la afirmación de Máquinas pensantesel startup de IA bien financiada fundada el año pasado por la ex directora de tecnología de OpenAI, Mira Murati, y el ex investigador y cofundador de OpenAI, John Schulman, entre otros.
Hoy, la firma anunció una vista previa de la investigación de lo que considera «modelos de interacción», una nueva clase de sistemas multimodales nativos que tratan la interactividad como un ciudadano de primera clase de la arquitectura del modelo en lugar de un «arnés» de software externo, obteniendo como resultado algunas ganancias impresionantes en puntos de referencia de terceros y como resultado una latencia reducida.
Sin embargo, los modelos aún no están disponibles para el público en general ni siquiera para las empresas, dice la compañía en su publicación de blog de anuncio: «En los próximos meses, abriremos una vista previa de investigación limitada para recopilar comentarios, con un lanzamiento más amplio a finales de este año».
Procesamiento simultáneo de entrada/salida ‘full duplex’
En el centro de este anuncio se encuentra un cambio fundamental en la forma en que la IA percibe el tiempo y la presencia. Los modelos de frontera actuales suelen experimentar la realidad en un solo hilo; esperan a que un usuario termine una entrada antes de comenzar a procesar y su percepción se congela mientras generan una respuesta.
En su publicación de blog, los investigadores de Thinking Machines describieron el status quo como una limitación que obliga a los humanos a «contorsionarse» ante las interfaces de IA, formulando preguntas como correos electrónicos y agrupando sus pensamientos.
Para resolver este «cuello de botella de colaboración», Thinking Machines se ha alejado de la secuencia estándar de fichas alternas.
En su lugar, utilizan un diseño de microgiro de flujo múltiple que procesa fragmentos de entrada y salida de 200 ms simultáneamente.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Esta arquitectura «full-duplex» permite que el modelo escuche, hable y vea en tiempo real, lo que le permite retroceder mientras un usuario habla o intervenir cuando nota una señal visual, como un usuario que escribe un error en un fragmento de código o un amigo ingresa a un cuadro de video. Técnicamente, el modelo utiliza fusión temprana sin codificador.
En lugar de depender de codificadores independientes masivos como Whisper para el audio, el sistema toma señales de audio sin procesar como dMel y parches de imagen (40×40) a través de una capa de incrustación liviana, coentrenando todos los componentes desde cero dentro del transformador.
Sistema de modelo dual
El avance de la investigación presenta TML-Interacción-Pequeñoa Mezcla de expertos (MoE) de 276 mil millones de parámetros modelo con 12 mil millones de parámetros activos. Debido a que la interacción en tiempo real requiere tiempos de respuesta casi instantáneos que a menudo entran en conflicto con el razonamiento profundo, la empresa ha diseñado un sistema de dos partes:
-
El modelo de interacción: Se mantiene en constante intercambio con el usuario, manejando la gestión del diálogo, la presencia y el seguimiento inmediato.
-
El modelo de fondo: Un agente asincrónico que maneja el razonamiento sostenido, la navegación web o llamadas a herramientas complejas, transmitiendo los resultados al modelo de interacción para que se integren naturalmente en la conversación.
Esta configuración permite a la IA realizar tareas como traducción en vivo o generar un gráfico de interfaz de usuario mientras continúa escuchando los comentarios de los usuarios, una capacidad demostrada en el video del anuncio donde el modelo proporcionó tiempos de reacción humanos típicos para varias señales mientras generaba simultáneamente un gráfico de barras.
Rendimiento impresionante en los principales puntos de referencia frente a los modelos de interacción rápida de otros laboratorios de IA líderes
Para demostrar la eficacia de este enfoque, el laboratorio utilizó banco FDun punto de referencia diseñado específicamente para medir la calidad de la interacción en lugar de solo la inteligencia bruta. Los resultados muestran que TML-Interaction-Small supera significativamente a los sistemas en tiempo real existentes:
-
Sensibilidad: Logró una latencia de turno de 0,40 segundosen comparación con los 0,57 segundos de Gemini-3.1-flash-live y los 1,18 segundos de GPT-realtime-2.0 (mínimo).
-
Calidad de interacción: En FD-bench V1.5 obtuvo una puntuación 77,8casi duplicando las puntuaciones de sus principales competidores (GPT-realtime-2.0 mínimo obtuvo una puntuación de 46,8).
-
Proactividad visual: En pruebas especializadas como RepCount-A (contando repeticiones físicas en vídeo) y Control de calidad de vídeo proactivoel modelo de Thinking Machines interactuó con éxito con el mundo visual, mientras que otros modelos fronterizos permanecieron en silencio o proporcionaron respuestas incorrectas.
|
Métrico |
TML-Interacción-Pequeño |
GPT-tiempo real-2.0 (min) |
Gemini-3.1-flash-en vivo (min) |
|
Latencias de turnos |
0,40 |
1.18 |
0,57 |
|
Calidad de interacción (promedio) |
77,8 |
46,8 |
54.3 |
|
IFEval (banco de voz) |
82.1 |
81,7 |
67,6 |
|
Harmbench (% de rechazo) |
99.0 |
99,5 |
99.0 |
Una ayuda potencialmente enorme para las empresas, una vez que los modelos estén disponibles
Si se pusieran a disposición del sector empresarial, los modelos de interacción de Thinking Machines representarían un cambio fundamental en la forma en que las empresas integran la IA en sus flujos de trabajo operativos.
Un modelo de interacción nativo como TML-Interaction-Small permite varias capacidades empresariales que actualmente son imposibles o muy frágiles con los modelos multimodales estándar:
La IA empresarial actual requiere que se complete un «turno» antes de poder analizar datos. En un entorno de fabricación o laboratorio, un modelo de interacción nativo puede monitorear una transmisión de video e intervenir de manera proactiva en el momento en que detecta una violación de seguridad o una desviación de un protocolo, sin esperar a que el trabajador solicite comentarios.
El éxito del modelo en puntos de referencia visuales como RepCount-A (recuento preciso de repeticiones) y ProactiveVideoQA (responder preguntas a medida que aparece evidencia visual) sugiere que podría servir como un auditor en tiempo real para tareas físicas de alto riesgo.
La principal fricción en el servicio al cliente basado en voz es el retraso de «procesamiento» de 1 a 2 segundos común en las API estándar de 2026. El modelo de Thinking Machines logra una latencia de turno de 0,40 segundos, aproximadamente la velocidad de una conversación humana natural.
Debido a que maneja el habla simultánea de forma nativa, un robot de soporte empresarial podría escuchar la frustración de un cliente, proporcionar señales de «canal secundario» (como «ya veo» o «mm-hmm») sin interrumpir al usuario y ofrecer traducción en vivo que se siente como una conversación natural en lugar de una serie de grabaciones inconexas.
Los LLM estándar carecen de reloj interno; «saben» la hora sólo si se les proporciona en un mensaje de texto. Los modelos de interacción tienen en cuenta el tiempo de forma nativa, lo que les permite gestionar procesos urgentes como «Recuérdame comprobar la temperatura cada 4 minutos» o «Avísame si este proceso tarda más que el último». Esto es fundamental para el mantenimiento industrial y la investigación farmacéutica, donde el tiempo es una variable esencial.
Antecedentes de las máquinas pensantes
Este lanzamiento marca el segundo hito importante para Thinking Machines después del Lanzamiento de Tinker en octubre de 2025una API administrada para ajustar modelos de lenguaje que permite a investigadores y desarrolladores controlar sus datos y métodos de capacitación mientras Thinking Machines maneja la carga de infraestructura de la capacitación distribuida.
La compañía dijo que Tinker admite modelos abiertos tanto pequeños como grandes, incluidos modelos de combinación de expertos, y los primeros usuarios incluyeron grupos de Princeton, Stanford, Berkeley y Redwood Research.
En su lanzamiento a principios de 2025, Thinking Machines se presentó como una empresa de investigación y productos de IA que intentaba hacer que los sistemas avanzados de IA fueran «más ampliamente comprendidos, personalizables y, en general, más capaces».
En julio de 2025, Thinking Machines dijo que había recaudado alrededor de 2 mil millones de dólares en un Valoración de 12 mil millones de dólares en una ronda liderada por Andreessen Horowitz, con la participación de Nvidia, Accel, ServiceNow, Cisco, AMD y Jane Street, descrita por CABLEADO como la ronda de financiación inicial más grande de la historia.
El diario de Wall Street informó en agosto de 2025 que el director ejecutivo de tecnología rival, Mark Zuckerberg, se acercó a Murati para adquirir Thinking Machines Lab y, después de que ella se negó, Meta buscó a más de una docena de los aproximadamente 50 empleados de la startup.
En marzo y abril de 2026, la empresa también se hizo conocida por sus ambiciones informáticas: anunció un Asociación Nvidia implementar al menos un gigavatio de sistemas Vera Rubin de próxima generación, luego amplió su relación con Google Cloud para utilizar la infraestructura de hipercomputadora AI de Google con sistemas Nvidia GB300 para investigación de modelos, cargas de trabajo de aprendizaje por refuerzo, entrenamiento de modelos de frontera y Tinker.
Para abril de 2026, Business Insider informó que Meta había contratado a siete miembros fundadores de Thinking Machines, incluidos Mark Jen y Yinghai Lu, mientras que otro investigador de Thinking Machines, Tianyi Zhang, también se mudó a Meta. El mismo informe decía que Joshua Gross, quien ayudó a construir el producto estrella de ajuste de Thinking Machines, Tinker, se había unido a Meta Superintelligence Labs y que la compañía había crecido a unos 130 empleados a pesar de las salidas.
Sin embargo, Thinking Machines no estaba simplemente perdiendo gente: también contrató al veterano de Meta Soumith Chintala, creador de PyTorch, como CTO, y agregó otros talentos técnicos de alto perfil como Neal Wu. TechCrunch informó por separado en abril de 2026 que Weiyao Wang, un veterano de ocho años en Meta que trabajó en sistemas de percepción multimodal, se había unido a Thinking Machines, subrayando que el flujo de talento no era unidireccional.
Thinking Machines declaró anteriormente que estaba comprometido con «importantes componentes de código abierto» en sus lanzamientos para empoderar a la comunidad de investigación. No está claro si estos nuevos modelos de interacción se regirán por los mismos valores y términos de lanzamiento.
Pero una cosa es segura: al hacer que la interactividad sea nativa del modelo, Thinking Machines cree que escalar un modelo ahora lo convertirá en un colaborador más inteligente y eficaz.















































































