Alibaba esta semana lanzó Qwen3.7-Plusel último modelo de lenguaje grande (LLM) de IA de su mundialmente apreciada y cada vez más amplia familia Qwen, que cuenta con más capacidades multimodales y un costo un 60% menor que el modelo anterior Qwen3.7-Max de solo texto lanzado hace apenas unas semanas.
Sin embargo, al igual que su predecesor inmediato, Qwen3.7-Plus sólo está disponible bajo una licencia comercial «cerrada» a través de interfaces de programación de aplicaciones (API) propietarias y Chat Qwen.
Esto marca un gran cambio con respecto a la estrategia de Qwen hasta la fecha, que se centraba principalmente en lanzar modelos de código abierto potentes y casi de última generación. Aquellas empresas y usuarios que confiaron en los modelos Qwen de código abierto, entre ellos, Gigantes estadounidenses como Airbnb – Sin duda se sentirá decepcionado al ver que Alibaba cerrará sus nuevos lanzamientos.
Aún así, vale la pena echarle un vistazo al modelo debido a su bajo costo y alto rendimiento en tareas multimodales como crear imágenes de nivel empresarial o analizar videos, imágenes y capturas de pantalla, lo que Qwen3.7-Max no puede hacer (es solo texto). Se encuentra entre los modelos de IA más baratos y potentes disponibles en la actualidad, con un precio justo por encima del nuevo rival chino. Precio con descuento por tiempo limitado de MiniMax-M3.
Resumen de precios de la API del modelo de IA VentureBeat Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
deepseek-v4-flash |
$0.14 |
$0.28 |
$0.42 |
|
|
deepseek-v4-pro |
$0.435 |
$0.87 |
$1.305 |
|
|
MiniMax-M3 |
$0.30 |
$1.20 |
$1.50 |
|
|
Qwen3.7-Plus |
$0.40 |
$1.60 |
$2.00 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Grok 4.3 contexto bajo |
$1.25 |
$2.50 |
$3.75 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Grok 4.3 alto contexto |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro ≤200K |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro >200K |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Mantener la continuidad durante ciclos complejos de ejecución de herramientas
Para quienes toman decisiones técnicas que implementan agentes autónomos, el principal cuello de botella rara vez ha sido la inteligencia del modelo inicial. En cambio, es decadencia del estado—la tendencia de un marco de agente a perder su trayectoria analítica en tareas de múltiples pasos y de largo horizonte.
Qwen3.7-Plus aborda esta vulnerabilidad arquitectónica mediante un enfoque combinado de gestión del contexto y preservación del estado de razonamiento.
El modelo se envía con un Ventana de contexto de 1 millón de tokens y asigna hasta 256.000 tokens específicamente para el procesamiento interno de la cadena de pensamiento. Para contextualizar esta capacidad, imagine un agente automatizado de migración a la nube: puede ingerir una base de código completa, mapear las dependencias y gastar miles de tokens evaluando silenciosamente casos extremos antes de ejecutar una sola línea de script bash.
Fundamentalmente, la API expone un parámetro llamado ‘preserve_thinking.’ En todo el ecosistema de Alibaba, la capacidad sirve como un puente arquitectónico estandarizado en lugar de un beneficio escalonado. Alibaba introdujo la función durante la generación anterior Qwen 3.6, integrándola tanto en el modelo abierto Qwen3.6-27B y los modelos patentados Max.
En esencia, el parámetro opera a nivel de API y plantilla para retener información interna. bloques a través de turnos conversacionales continuos.
Esta continuidad estructural resuelve un cuello de botella crítico para los desarrolladores que diseñan tareas a largo plazo. Al mantener intactos estos bucles lógicos internos, la característica evita que el modelo abandone su contexto o vuelva a calcular innecesariamente su historial almacenado en caché a mitad de una operación.
Cuando un modelo ejecuta asignaciones de codificación agente complejas de varios pasos, esta retención permite que el sistema se aferre a su línea de pensamiento original sin perder la trama ni olvidar la lógica subyacente de sus acciones anteriores.
Alibaba no es el único que reconoce esta necesidad técnica, ya que el concepto subyacente ahora dicta la arquitectura de casi todos los principales laboratorios de inteligencia artificial.
Anthropic implementa exactamente esta capacidad bajo el nombre de «Pensamiento extendido» para sus modelos avanzados, incluido su último Claude Opus 4.8. Este marco requiere que los desarrolladores introduzcan bloques de pensamiento no modificados directamente en la API en turnos posteriores para mantener una cadena de razonamiento ininterrumpida.
OpenAI aborda el mismo desafío a través de un mecanismo de retorno de razonamiento cifrado para modelos como GPT-5.5. Dentro del ecosistema OpenAI, los desarrolladores deben devolver elementos de razonamiento específicos generados junto con llamadas a funciones anteriores, asegurando que el modelo recuerde explícitamente el fundamento detrás de la ejecución de sus herramientas.
Al final, preserve_thinking simplemente representa la terminología de Alibaba para lo que rápidamente se ha convertido en la apuesta indiscutible del razonamiento moderno de múltiples turnos.
Los puntos de referencia muestran un modelo competitivo, aunque submoderno
En cuanto a las métricas de capacidad brutas, esta arquitectura de pensamiento profundo se traduce en ganancias estructurales en puntos de referencia multimodales y agentes. Sin embargo, todavía está por debajo de muchas de las generaciones anteriores y líderes de modelos propietarios de EE. UU., como Claude Opus 4.6 de Anthropic y GPT-5.4 de OpenAI.
En Terminal Banco 2.0-Terminusque mide la capacidad de un modelo para ejecutar código real a nivel de terminal de forma segura e iterativa, obtuvo Qwen3.7-Plus 70.3superando a DeepSeek-V4-Pro Max (67,9) y Gemini-3.1 Pro (63,5).
En los puntos de referencia de visión por computadora que exigen una comprensión de la interfaz localizada, como ScreenSpotProel modelo golpeó 79.0superando significativamente a los destacados de la industria heredados como GPT-5.4 (xhigh) con 67,4 y Claude-Opus-4.6 con 49,5. Métricas de evaluación de agentes (puntos de referencia seleccionados)
¿Para qué deberían considerar las empresas Qwen3.7-Plus?
Para un arquitecto empresarial, la pregunta clave al analizar Qwen3.7-Plus es clara: ¿Qué reemplaza esto en nuestra pila tecnológica actual?
El modelo está diseñado para reemplazar directamente los modelos de vanguardia de primer nivel (como los modelos GPT-5-tier o Claude-Max-tier) dentro de los flujos de trabajo de desarrolladores de alta frecuencia, la automatización de procesos robóticos (RPA) y los procesos de ingeniería de datos.
En lugar de implementar un modelo insignia costoso y de uso general para manejar operaciones repetitivas del sistema, los equipos técnicos pueden dirigir estas tareas a Qwen3.7-Plus. Maneja la interpretación de la interfaz visual, la ejecución de comandos y la generación de código simultáneamente.
Alibaba ha estructurado su entrega de API para alinearse con los marcos empresariales propietarios y de código abierto existentes. Los puntos finales son totalmente compatibles con OpenAI, lo que significa que cambiar las dependencias existentes requiere un ajuste mínimo de la infraestructura. Para los grupos que aprovechan los marcos de terminales autónomos, la integración se admite de forma nativa en múltiples entornos.
Los ingenieros pueden ejecutar Qwen3.7-Plus directamente a través de la configuración de su terminal local alterando los objetivos del entorno base.
Desde una perspectiva puramente de costos, ejecutar un marco de agente que haga referencia constantemente a repositorios de código masivos o historiales de diseño visual puede convertirse rápidamente en un costo prohibitivo.
Alibaba aborda esto exponiendo los precios del almacenamiento en caché granular.
El procesamiento de entrada estándar se sitúa en 0,40 dólares por millón de tokens, pero si el agente lee desde un caché creado explícitamente (por ejemplo, un repositorio base masivo o un kit de interfaz de usuario empresarial estándar que permanece estático durante cientos de bucles automatizados), el costo cae drásticamente a 0,04 dólares por 1 millón de tokens para lecturas posteriores.
Este nivel hace que las iteraciones de agentes de múltiples turnos de alta frecuencia sean económicamente prácticas a escala empresarial.
Ninguna licencia de código abierto o pesos abiertos plantea la cuestión del cumplimiento para las empresas
Al evaluar cualquier modelo en el ecosistema Qwen, una preocupación principal para los equipos legales y de seguridad es el marco de licencia y los límites operativos del canal de datos.
Si bien las iteraciones anteriores de la familia Qwen obtuvieron una importante tracción empresarial a través de la disponibilidad de peso de código totalmente abierto bajo Apache 2.0 o licencias personalizadas de uso abierto, Qwen3.7-Plus se entrega estrictamente como una API de nube comercial administrada a través de Alibaba Cloud Model Studio. Para la gestión de riesgos empresariales, esta distinción conlleva implicaciones específicas:
-
Sin despliegue de peso local: Las organizaciones no pueden descargar, proteger ni alojar localmente los pesos de Qwen3.7-Plus dentro de sus centros de datos internos completamente aislados. Todas las llamadas de verificación de datos, procesamiento visual y ejecución deben pasar por los puntos finales internacionales de Alibaba Cloud (por ejemplo, la instancia de Singapur resaltada en la documentación del desarrollador).
-
Cumplimiento y soberanía: Dado que el modelo requiere inferencia basada en la nube, las empresas que operan bajo límites estrictos de datos soberanos (como entidades de atención médica sujetas a restricciones locales de HIPAA/GDPR o contratistas de defensa) deben evaluar explícitamente si el enrutamiento API externo cumple con sus obligaciones específicas de residencia de datos.
-
Mitigación de riesgos gestionados: Por el contrario, una estructura de API administrada elimina la carga de la infraestructura interna que supone aprovisionar, optimizar y mantener clústeres de múltiples GPU (como matrices Nvidia H100 dedicadas) simplemente para alojar una red de agentes interna.
Aún así, Qwen3.7-Plus ofrece alta inteligencia en todas las modalidades a bajo costo.
La recepción inicial por parte de las comunidades de desarrolladores y del capital de riesgo técnico pone de relieve los cambios económicos en el despliegue de agentes.
Destacada voz de la industria y capitalista de riesgo Web3 @Boxmining destacó la ventaja de costos estratégicos, afirmando:
«El hecho de que Qwen 3.7 Plus sea un 40% más barato que Max cambia la conversación. Si la salida es lo suficientemente cercana para la mayoría de la codificación y mucho más potente para los flujos de trabajo visuales, ¿realmente necesitas Max todos los días o solo para los trabajos pesados que solo requieren terminales?»
Esta perspectiva se alinea con la tendencia actual de optimizar los presupuestos operativos empresariales: alejarse de la computación en bruto y sin restricciones hacia la automatización de tareas específicas. Al mismo tiempo, investigadores especializados en lo profundo del ecosistema señalan que esto no es simplemente una optimización incremental de la generación de texto.
Dunjie Lu, Un pasante de investigación en Alibaba Qwen, comentó:
«Muestra claras ganancias sobre Qwen3.6-Plus en capacidades de uso de computadoras, con una mayor generalización más allá de las tareas generales de escritorio hacia flujos de trabajo profesionales como ingeniería de datos e investigación científica».
En última instancia, para los compradores empresariales que deciden cuál será su próxima hoja de ruta de infraestructura, Qwen3.7-Plus presenta una alternativa práctica. Si el objetivo principal de su organización es crear bucles de software autónomos, resistentes y con capacidad visual que interactúen directamente con entornos de desarrollador y consolas en la nube (sin gastar demasiado su presupuesto de inferencia), el modelo proporciona una razón convincente para alejar la ejecución de alternativas fronterizas más costosas.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































