La industria de la IA ha entrado de lleno en la «era de los agentes», un paradigma en el que los modelos de IA hacen mucho más que generar texto: ahora planifican, ejecutan y corrigen activamente tareas complejas en días en lugar de segundos.
Por lo tanto, tal vez no sea sorprendente ver al famoso equipo Qwen de investigadores de IA del gigante chino del comercio electrónico Alibaba lanzar un modelo capaz de realizar trabajo autónomo de IA agente durante varios días: ese modelo ha llegado en forma de Qwen3.7-Max, que informes de la empresa en una publicación de blog logró «~35 horas de ejecución autónoma continua», aunque en un formato propietario, no de código abierto, como lo eran los lanzamientos anteriores de Qwen Team.
Esto también es de esperarse: es lo que temían muchos analistas y expertos de la industria en los últimos años. tras la partida de varios líderes clave del Equipo Qwen a principios de este año. Pero financieramente tiene sentido para Alibaba, al menos en el corto plazo: entrenar modelos de IA, especialmente aquellos tan poderosos como Qwen3.7-Max, es costoso, y regalarlos esencialmente de forma gratuita, como lo son los modelos de código abierto, no ayuda inmediatamente a recuperar ningún costo.
En ese sentido, Alibaba simplemente está alineando sus esfuerzos con los gigantes estadounidenses de la IA como OpenAI y Google al ofrecer los mejores y más recientes modelos sólo a través de API pagas y paquetes de suscripción o planes web pagos, y modelos ligeramente menos eficientes a través de código abierto.
Aún así, la llegada de Qwen3.7-Max ofrece más opciones a empresas y usuarios individuales, y más competencia para los laboratorios de IA estadounidenses, lo que rara vez es algo malo para los consumidores de todos los niveles de presupuesto. Sin embargo, el hecho de que solo se pueda acceder al modelo desde puntos finales con sede en China significa que su atractivo puede ser limitado para las empresas estadounidenses y europeas que buscan maximizar el cumplimiento y la postura de seguridad al cumplir contratos gubernamentales, o incluso simplemente intentar cumplir con todas las regulaciones estatales, locales y nacionales relevantes sobre soberanía de datos.
La era maratónica de la IA
Para entender por qué Qwen3.7-Max se aleja de los modelos anteriores, hay que observar cómo fue entrenado y cómo funciona en la práctica.
Los modelos lingüísticos suelen degradarse cuando se ven obligados a mantener una sola línea de pensamiento durante miles de turnos conversacionales; olvidan instrucciones, alucinan variables o simplemente se quedan atrapados en bucles lógicos. Qwen3.7-Max fue diseñado específicamente como una «base de agente versátil» capaz de «razonamiento a largo plazo» para superar este cuello de botella exacto.
La demostración más clara de esta capacidad es una tarea de ingeniería autónoma detallada por el equipo de Qwen. El modelo recibió acceso a un servidor aislado equipado con una PPU T-Head ZW-M890, una arquitectura de hardware que el modelo nunca había encontrado durante su entrenamiento. Su tarea era optimizar un núcleo de atención.
En el transcurso de 35 horas seguidas, Qwen3.7-Max funcionó de forma totalmente autónoma. Ejecutó 1158 llamadas a herramientas distintas, realizó 432 evaluaciones del kernel, diagnosticó fallas de compilación y mejoró iterativamente el código para lograr una aceleración media geométrica de 10,0 veces.
En comparación, los modelos de la competencia china como GLM-5.1 de z.ai y Kimi K2.6 de Moonshot con un límite de aceleración de 7,3x y 5,0x respectivamente, y a menudo terminaban voluntariamente sus sesiones cuando no lograban progresar. Sin embargo, ambos están disponibles de código abierto.
Esta resistencia se logra mediante lo que Alibaba llama «escalado ambiental». Así como los primeros LLM se volvieron más inteligentes al ingerir textos más diversos, Qwen3.7-Max fue entrenado en una amplia gama escalada de entornos agentes dinámicos.
Es capaz de simular el ciclo de vida de un año de una startup en la evaluación «YC-Bench», navegando por cientos de rondas de toma de decisiones que abarcan la gestión de personal y la selección de contratos. En esta simulación, el modelo logró generar 2,08 millones de dólares en ingresos virtuales, casi duplicando el rendimiento de la generación anterior, Qwen3.6-Plus.
Además, el modelo tiene incorporado un autocontrol de piratería de recompensas, que detecta de forma autónoma cuándo intenta engañar a un entorno de entrenamiento y agrega reglas heurísticas para corregir su propio comportamiento.
Un cerebro para cualquier andamio
Desde la perspectiva del producto, Qwen3.7-Max está diseñado para ser el motor cognitivo para el desarrollo de software moderno y la automatización empresarial.
El modelo ofrece una enorme ventana de contexto de 1 millón de tokens y un límite máximo de salida de 64K, lo que proporciona una inmensa sobrecarga para procesar bases de código extensas o documentos técnicos extensos.
Una de sus características más convincentes es «generalización cruzada». En lugar de estar codificado para funcionar mejor dentro de una interfaz propietaria específica, Qwen3.7-Max está diseñado para actuar como una capa de inteligencia directa para diversos marcos de agentes. Él soporta el protocolo API Anthropic de forma nativa, permitiendo a los desarrolladores conéctelo directamente a herramientas existentes como Claude Code u OpenClaw.
Los datos de referencia proporcionados por Alibaba indican que este enfoque generalizado ha dado enormes dividendos.
En el punto de referencia de razonamiento matemático de ApexQwen3.7-Max obtuvo una puntuación de 44,5, eclipsando la puntuación de 34,5 de Claude Opus-4.6 Max y DeepSeek V4-Pro Max 38.3. También publicó puntuaciones dominantes en el último examen de la humanidad (41,4) y el agente de codificación realista MCP-Atlas (76,4).
Esto se traduce en una utilidad tangible para los usuarios finales. A través de integraciones de código abierto Model Context Protocol (MCP), el modelo puede operar como un asistente de oficina autónomo, capaz de leer las especificaciones de formato de la universidad y reformatear automáticamente un documento de Word desordenado a través de herramientas de línea de comandos sin intervención humana.
Manejar este nivel de inteligencia tiene un costo distinto. Los desarrolladores que accedan a la API a través de Alibaba Cloud Model Studio pagarán 2,50 dólares por cada millón de tokens de entrada y 7,50 dólares por cada millón de tokens de salida. La plataforma también incluye creación explícita de caché y precios de lectura, así como una tarifa de $10 por cada 1000 llamadas para búsquedas web integradas, aunque las herramientas de interpretación de códigos siguen siendo gratuitas por un tiempo limitado.
Qwen3.7-Max ocupa un punto medio estratégico en la economía API actual. Si bien exige una prima notable sobre sus rivales nacionales con precios agresivos (que cuestan casi el doble de DeepSeek V4 Pro ($5,22) y el GLM-5.1 de Z.ai ($5,80), socava drásticamente a los gigantes de la frontera occidental con los que habitualmente iguala en los puntos de referencia.
Para el contexto, ejecutar flujos de trabajo de agentes pesados a través de GPT-5.4 de OpenAI o Claude Opus 4.7 de Anthropic costará a los desarrolladores $ 17,50 y $ 30,00 por millón de tokens, respectivamente. Consulte la tabla de precios de VentureBeat a continuación:
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Al posicionar el Qwen3.7-Max justo debajo del Gemini 3.5 Flash de Google ($10.50) pero muy por encima de los modelos de nivel económico, Alibaba está indicando que este no es un lanzamiento comercial; es un motor de razonamiento emblemático con un precio para alejar las cargas de trabajo empresariales de las ofertas más caras de Silicon Valley.
La licencia sigue siendo propietaria por ahora
A pesar de toda su brillantez técnica, el aspecto más controvertido de Qwen3.7-Max es cómo se distribuye. Qwen anuncia el lanzamiento como un «modelo propietario». Es estrictamente solo API.
Históricamente, Qwen de Alibaba ha sido un héroe para el código abierto y comunidades locales de LLM. Las iteraciones anteriores, como Qwen 2.5 y Qwen 3.6, publicaron sus pesos. Los pesos abiertos permiten a los desarrolladores, investigadores y empresas descargar el modelo, ejecutarlo en su propio hardware y ajustarlo para casos de uso muy específicos o sensibles a los datos sin enviar información patentada a un servidor de terceros.
Al bloquear Qwen3.7-Max detrás de una API, Alibaba está recurriendo al manual comercial estándar utilizado por OpenAI (con GPT-4) y Anthropic (con Claude). Para los usuarios empresariales, esto significa que utilizar Qwen3.7-Max requiere confiar en Alibaba Cloud sus flujos de datos y depender completamente de la conectividad a Internet para ejecutar sus flujos de trabajo agentes. Para la comunidad de código abierto, significa perder el acceso a lo que actualmente es uno de los modelos más capaces del planeta.
Las reacciones de la comunidad se dividen entre el asombro y la decepción.
La reacción de la comunidad de desarrolladores ha sido rápida, caracterizada por una mezcla de profundo respeto por los logros de la ingeniería y frustración por el modelo de licencia.
Prominente AL comentarista Sudo en (@sudoingX) capturó el sentimiento predominante en X (anteriormente Twitter). «qwen es irreal», escribieron. «Acaban de bajar 3,7 máximo y está superando el opus 4,6 máximo en la mayoría de los puntos de referencia que ejecutaron».
Las métricas técnicas, particularmente la resistencia del modelo, han dejado atónitos a muchos en el campo. «El número matemático máximo, 44,5 frente al opus 34,5, no es una diferencia pequeña», señaló Sudo su. «Las 35 horas seguidas en una tarea de optimización del kernel con más de 1000 llamadas a herramientas es la parte que sigo releyendo. Eso es lo que realmente sucede en la era del agente, no una diapositiva».
La velocidad de la iteración de Alibaba también está llamando la atención. Con Qwen 3.6 lanzado el mes pasado, el salto a 3.7-Max destaca una cadencia de desarrollo implacable. Como observó Sudo su, «nadie más se mueve así».
Sin embargo, los elogios se ven fuertemente perjudicados por el cambio a un ecosistema cerrado. La pérdida de peso de los modelos se considera un golpe al movimiento de IA localizada, que se basa en modelos abiertos de última generación para ampliar los límites de lo que se puede hacer en hardware de consumo o en clusters de empresas privadas.
«Una cosa, sin embargo, abre el código fuente de este también», suplicó Sudo su en su publicación. «3.6 denso mejoró todo el ecosistema llm local. El nivel máximo de API solo cerraría una puerta que hemos estado manteniendo abierta. Eventualmente, danos los pesos».
Qwen3.7-Max demuestra que la era del agente autónomo ya no es una proyección teórica; es una realidad presente capaz de ejecutar complejas proezas de ingeniería mientras los humanos duermen. La única pregunta ahora es si esta nueva frontera de la IA será un recurso democratizado que podrá descargar a su computadora portátil o una utilidad de inteligencia alquilada estrictamente desde la nube. Por ahora, con Qwen3.7-Max, es innegable que es lo último.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.











































































