Los agentes de voz son costosos de operar y difíciles de orquestar, no porque los modelos no puedan manejar conversaciones, sino porque los límites de contexto obligan a las empresas a crear capas de restablecimiento de sesión, compresión de estado y reconstrucción en cada implementación. Los tres nuevos modelos de voz de OpenAI están diseñados para reducir esta sobrecarga y cambiar la forma en que los ingenieros pueden pensar en integrar la voz en una pila de agentes más grande.
GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper integran audio en tiempo real en la pila de gestión de modelos como primitivas de orquestación discretas, separando el razonamiento conversacional, la traducción y la transcripción en componentes especializados en lugar de agruparlos en un solo producto de voz.
La compañía dijo en una publicación de blog que Realtime-2 es su primer modelo de voz «con razonamiento de clase GPT-5» y puede manejar solicitudes difíciles y mantener las conversaciones fluyendo de forma natural. Realtime-Translate entiende más de 70 idiomas y los traduce a 13 más al ritmo del hablante, y Realtime-Whisper es su nuevo modelo de transcripción de voz a texto.
Estas tres acciones ya no están en una sola pila o plantilla. GPT-Realtime-2 podría técnicamente manejar la transcripción, pero OpenAI enruta tareas separadas a modelos especializados: Realtime-Translate para voz multilingüe y Realtime-Whisper para transcripción. Las empresas pueden asignar cada tarea a la plantilla adecuada en lugar de enrutar todo a través de un único sistema de voz global.
Los nuevos modelos OpenAI compiten con los modelos Voxtral de Mistral, que también separan la transcripción y se dirigen a casos de uso empresarial.
¿Qué deberían hacer las empresas?
Cada vez más empresas se están dando cuenta del valor de los agentes de voz ahora que más personas se sienten cómodas conversando con un agente de IA y también debido a la gran cantidad de datos que provienen de las interacciones de voz con los clientes.
Las organizaciones que evalúen estos modelos deberán considerar su arquitectura de orquestación, no solo la calidad del modelo; en particular, si su pila puede enrutar tareas de voz discretas a modelos especializados y administrar el estado en una ventana emergente de 128.000 tokens.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































