IA de Microsoft lanzó dos nuevos modelos internos en vista previa pública el miércoles: MAYO-Imagen-2.5-Prosu generador de imágenes de mayor fidelidad hasta la fecha, y MAI-Voice-2-Flashun modelo de voz creado para cargas de trabajo empresariales de gran volumen, al tiempo que publica datos de producción que representan el argumento más agresivo de la empresa hasta el momento de que puede impulsar sus propios productos sin depender de los modelos de frontera de OpenAI.
El anuncio, realizado por Equipo de superinteligencia de Microsoft AIllega aproximadamente un año después de que la compañía se comprometiera a construir internamente modelos especialmente diseñados, y llega con un nivel inusual de especificidad sobre dónde se ejecutan ahora esos modelos: Bing, PowerPoint, OneDrive, Dinámica 365, Sobresalir, Copiloto de GitHuby Azur. El mensaje a los compradores empresariales (e, implícitamente, a OpenAI) es que los modelos locales de Microsoft ya no son proyectos de investigación. Son infraestructuras de producción que sirven a millones de usuarios.
«Cada una de estas mejoras es un paso hacia el mismo objetivo: productos de Microsoft, impulsados por modelos de Microsoft», escribió la compañía en su blog de anuncios.
Cómo MAI-Image-2.5-Pro y MAI-Voice-2-Flash marcan los extremos opuestos de la curva de costos de la IA
Los dos nuevos lanzamientos ocupan extremos opuestos de lo que Microsoft llama la curva calidad-velocidad-costo, y el posicionamiento es deliberado. MAYO-Imagen-2.5-Pro apunta al nivel premium: imágenes destacadas, edición detallada y representación precisa de texto en la imagen, la última de las cuales ha sido durante mucho tiempo un notorio punto débil para los modelos de generación de imágenes. Microsoft fijó el precio del modelo en 5 dólares por millón de tokens de entrada de texto, 8 dólares por millón de tokens de entrada de imágenes y 106 dólares por millón de tokens de salida de imágenes. la base MAI-Imagen-2.5 modelo lanzado recientemente en No. 2 para edición de imágenes en Arenala tabla de clasificación comunitaria que se ha convertido en un marcador de facto para los medios generativos.
La industria creativa parece estar tomando nota. Rob Reilly, director creativo global del gigante publicitario WPP, calificó el modelo Pro como «un gran salto adelante para las herramientas GenMedia» en una declaración incluida en el anuncio de Microsoft, y agregó que «Microsoft se ha establecido firmemente entre los líderes en IA generativa».
MAI-Voice-2-Flash va en la otra dirección. Vista previa por primera vez en Microsoft Construir conferenciaFlash funciona dos veces más rápido que MAI-Voice-2 y cuesta un 32% menos, con un precio de 15 dólares por millón de caracteres. Está diseñado para el poco glamoroso pero enorme mercado de voz de alto volumen: centros de llamadas, agentes de voz y aplicaciones de voz en tiempo real donde la latencia y el costo por llamada importan más que las ganancias marginales en expresividad. Juntos, los dos modelos reflejan una estrategia de construir familias de modelos en lugar de un solo buque insignia, porque, como dijo la compañía, un estudio creativo que busca la máxima fidelidad tiene necesidades muy diferentes a las de una operación de servicio al cliente que maneja millones de llamadas al día.
Las métricas de producción de Microsoft muestran que los modelos internos reducen los costos de GPU hasta en un 89%
Podría decirse que los lanzamientos de modelos son menos dignos de mención que las métricas de implementación que Microsoft les atribuyó: números que se leen como un caso sistemático para intercambiar modelos fronterizos de terceros en toda su cartera de productos.
Creador de imágenes de Bing ahora funciona completamente MAI-Imagen-2.5de principio a fin, lo que marca la primera vez que la herramienta de imagen del consumidor es totalmente interna. En PowerPoint, Microsoft dice que MAI-Image-2.5 reduce los costos de GPU hasta en un 84% en comparación con GPT-Image-2, el modelo de imagen de OpenAI. En OneDrive, donde MAI-Image-2.5 es ahora el valor predeterminado para escenarios clave de edición de imágenes, la compañía informa un aumento del 26 % en las tasas de ahorro, aproximadamente un 25 % menos de latencia P95 y una eficiencia 2,5 veces mayor bajo cargas de trabajo de producción de utilización media.
Del lado de la voz, MAI-Voice-2-Flash ahora impulsa Dynamics 365 Contact Center, la plataforma utilizada por clientes como T-Mobile y EasyJet, donde Microsoft afirma reducir los costos de GPU de hasta un 89%. El modelo también está integrado en Azure Voice Live para desarrolladores que crean agentes de voz a voz.
Quizás el despliegue más importante sea el de la atención sanitaria. Microsoft Copiloto Dragónutilizado por 170.000 proveedores médicos y responsable de procesar 28 millones de consultas de pacientes el último trimestre, ahora se ejecuta en MAI-Transcribe-1.5 para su flujo de trabajo multilingüe en 58 idiomas. Microsoft dice que las evaluaciones internas muestran una reducción relativa del 50% en las tasas de error de transcripción y de identificación del idioma en la mayoría de los idiomas, una afirmación significativa en un dominio donde los errores de transcripción pueden propagarse directamente a las notas clínicas.
Dentro de la estrategia de ‘escalada de colinas’ que permite a los modelos pequeños vencer a GPT-5.6 en Excel
En una publicación complementaria publicada el mismo día, Microsoft detalló la metodología detrás de estos resultados, lo que llama su «maquina para escalar colinas«, un volante integrado de datos, modelos y el «arnés» de productos que los rodea.
El ejemplo más claro es MAI-Código-1-Flashel modelo de codificación liviano lanzado en GitHub Copilot en junio. Microsoft dice que el modelo logra una tasa de aceptación de código aproximadamente un 10% más alta que GPT-5.4 Mini y Claude Haiku 4.5 en VS Code, mientras utiliza un 10% menos de tokens medianos. La retención de desarrolladores cuenta una historia similar: los usuarios tenían un 6% más de probabilidades de regresar durante varios días que con GPT-5.4 Mini, y un 11% más de probabilidades que con Claude Haiku 4.5.
Luego Microsoft hizo algo más interesante. Fue necesario el punto de control MAI-Code-1-Flash y más lo entrenó dentro de un entorno de aprendizaje reforzado de Excelenseñando a un modelo de codificación las herramientas y flujos de trabajo del trabajo del conocimiento de la hoja de cálculo. El resultado, según los comentarios de los usuarios de producción, es un modelo a la par con GPT-5.6 para las tareas más comunes de Excel, y al mismo tiempo es lo suficientemente pequeño como para ejecutarse en las antiguas GPU H100 e incluso A100 de Nvidia en lugar de requerir aceleradores de última generación.
Ese detalle del hardware merece énfasis. Todas las principales empresas de inteligencia artificial están luchando por la asignación de chips de última generación, y un modelo que ofrece calidad adyacente a la frontera en silicio de dos generaciones cambia fundamentalmente la economía de implementación. También libera el hardware más nuevo, incluido el clúster GB200, ahora operativo, de Microsoft, para capacitación en lugar de servicio.
El manifiesto de ‘difusión fronteriza’ de Satya Nadella rediseña la relación OpenAI
El director ejecutivo de Microsoft, Satya Nadella, enmarcó los anuncios en una extensa publicación en X titulada «Difusión y control de fronteras«Ahora podemos tomar capacidades de frontera saturadas y entregarlas a escala y a menor costo a través de modelos optimizados para productos de alto uso, mientras continuamos usando modelos de frontera para necesidades de frontera», escribió Nadella, agregando que Microsoft está «comenzando a dirigir el tráfico a través de nuestras superficies propias a MAI siempre que nuestros modelos coincidan o superen a las alternativas de frontera».
Traducido de la prosa ejecutiva: capacidades que hace un año eran lo último en tecnología ahora están en juego, y Microsoft cree que puede replicarlas a bajo costo para las tareas específicas y repetitivas que dominan el uso real del producto. ¿Por qué pagar precios de frontera por un modelo de frontera cuando un usuario sólo quiere reformatear una columna de una hoja de cálculo?
Nadella tuvo cuidado de señalar que «los modelos de frontera de OpenAI y Anthropic son parte del sistema de orquestación junto con MAI», pero también articuló un principio claro de independencia del modelo, argumentando que las evaluaciones de una empresa «deberían seguir subiendo incluso cuando se haya eliminado cualquier modelo».
«Mantener el control, la memoria, el contexto y las habilidades fuera del modelo, argumentó, es lo que le da control a Microsoft. Es difícil pasar por alto el subtexto. Reuters informó en abril que Microsoft Licencia exclusiva para la tecnología OpenAI. había sido revisado en un acuerdo no exclusivo, y The Information informó en septiembre pasado que Microsoft había comenzó a incorporar modelos antrópicos en algunos productos. El anuncio del miércoles completa el triángulo: Microsoft como orquestador, con los modelos de frontera de sus socios como componentes intercambiables y sus propios modelos absorbiendo una porción cada vez mayor del tráfico de rutina”.
Los desarrolladores aplauden los modelos más baratos para tareas específicas mientras los escépticos cuestionan el historial de Microsoft
La respuesta en línea captó tanto el atractivo como el escepticismo que rodea a la estrategia. «Me encanta cuando la gente usa modelos pequeños para tareas específicas», escribió un usuario de X, @mavihskrespondiendo a la publicación de Nadella. «¿Por qué tengo que utilizar el modelo omnisciente sólo para cambiar mi campo en Excel?» Otro usuario, @nabu_linesresumió claramente el discurso: «tanto el costo como el rendimiento mejoran cuando se deja de abusar del modelo más grande».
Otros fueron menos caritativos respecto del historial de ejecución de Microsoft. «Microsoft es el peor cuando se trata de escuchar los comentarios de los usuarios», escribió el diseñador. @diseñadobyabinargumentando que la empresa «perderá la carrera de la IA porque repetidamente no entendieron las necesidades de los usuarios». Y un usuario, @tokenoverflowofreció una crítica más seca del argumento de la independencia del modelo: «Quiero que siga subiendo la colina después de eliminar Microsoft».
Los escépticos plantean un argumento justo. Las métricas autoinformadas por Microsoft (tasas de aceptación, tasas de ahorro, ahorros de GPU) provienen de sus propias evaluaciones internas, no de puntos de referencia independientes, y la compañía elige qué comparaciones publicar.
Pero la lógica de la estrategia no depende de un solo número. El encuadre de Nadella de que el software ahora tiene «coste marginal real por primera vez» explica por qué Microsoft está obsesionado con los tokens, las GPU y los costos de servicio: cuando las características de IA se ejecutan en cada pulsación de tecla en una cartera de productos de mil millones de usuarios, una reducción del 84% en el costo de la GPU no es una optimización. Es la diferencia entre un negocio viable y un pozo de dinero.
Por qué Microsoft está convirtiendo su manual interno de IA en un producto de Azure
La última pieza de la estrategia es que Microsoft está vendiendo el manual, no sólo los modelos. Nadella posicionó explícitamente el enfoque de escalada como «una plantilla para cualquier otra empresa nativa de IA, SaaS o empresarial», y Microsoft está empaquetando la cadena de herramientas a través de Foundry y lo que llama Frontier Tuning, permitiendo a las empresas entrenar modelos especializados contra sus propias evaluaciones patentadas y entornos de aprendizaje de refuerzo. Eso convierte el ejercicio interno de reducción de costos de Microsoft en un producto de Azure, y les da a los clientes empresariales una razón para ejecutar sus cargas de trabajo de IA en la nube de Microsoft, incluso si los modelos mismos provienen de otros lugares.
El énfasis de la empresa en modelos entrenados «con datos limpios, rastreables y de nivel empresarial, sin destilación de modelos de terceros» tiene el mismo fin comercial. En una industria que enfrenta un escrutinio cada vez mayor sobre la procedencia de los datos de capacitación, Microsoft apuesta a que a los compradores empresariales (y a los tribunales) les importará de dónde provienen las capacidades del modelo. Microsoft dice que ahora está ampliando el enfoque de escalada a Chat de copiloto, Perspectivay PowerPointy ambos modelos nuevos están disponibles en vista previa pública a través de Fundición de Microsoft y el Patio de juegos AMI. «Nada de esto es un punto final», escribió la compañía. «Apenas estamos comenzando».
Hace siete años, Microsoft apostó más de 13 mil millones de dólares que OpenAI construiría el futuro de la IA. El anuncio del miércoles sugiere que desde entonces la compañía ha aprendido una lección más barata: el futuro de la IA puede pertenecer a quien construya la frontera, pero las ganancias pertenecen a quien la convierta en algo común.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































