Hace una semana, un modelo misterioso llamado Ox Alpha apareció en OpenRouter – un participante más entre más de 400 modelos, y se lanzan aproximadamente 10 nuevos cada semana. Lo que lo hizo destacar no fue sólo el precio gratuito; fue bastante bueno. Los aficionados y los desarrolladores independientes se dieron cuenta rápidamente, impulsando varios billones de tokens diariamente, con estimaciones de la comunidad para la semana que van desde un solo dígito hasta más de 20 billones.
Los entusiastas de la IA pasaron los siguientes seis días haciendo análisis forenses y especulando quién podría haberla construido y quién podría tener la infraestructura para entregar tantos tokens de forma gratuita. Primero, la suposición era un laboratorio estadounidense: el tan esperado Gemini, o Anthropic enviando un nivel medio suficientemente bueno, o Elon con tanta capacidad que abandonó Ox Alpha (tenga en cuenta el nombre). La gente realizó seguimientos de tokenizadores y análisis de redes. Una auténtica semana de misterio de Sherlock Holmes.
El 26 de agosto Z.ai le puso su nombre. Ox Alpha era GLM-5.3-Flash. Lo habían estado utilizando en el tráfico público a propósito, pero la verdadera sorpresa no fue lo bueno que era el modelo (es realmente bueno). Se sirvió íntegramente con chips e infraestructura chinos. El precio de lista es de 15 centavos/50 centavos por millón de tokens. La promoción de lanzamiento de OpenRouter tiene un 50% de descuento, 7,5 centavos / 25 centavos, hasta el 9 de septiembre. Los pesos están abiertos (MIT) y la inferencia está alojada en Z.ai, así como en GMI Cloud, Cloudflare y otros proveedores de inferencia con sede en EE. UU.
El análisis artificial puso el modelo en su lugar. gráfico de inteligencia versus costo el mismo día. GLM-5.3-Flash aterriza en 57 en el índice por aproximadamente nueve centavos por tarea. Un nivel medio estadounidense como GPT-5.6 Sol (max) cuesta alrededor de 59 a 67 centavos, lo que significa que por dos puntos de inteligencia estás pagando alrededor de 7,4 veces más. Vaya más allá y Grok 4.6 estará en 61 a 94 centavos por tarea, o aproximadamente 10 veces para una ganancia de cuatro puntos. En este punto, la economía simbólica influye mucho en el cálculo del consumo. En el extremo superior la curva se ha aplanado. Si mordemos este anzuelo de peso abierto, ¿qué sucede con las fuertes inversiones circulares en infraestructura que hicimos y que nunca representaron un fuerte contendiente de inferencia chino?
Las empresas estadounidenses ya están sintiendo la presión de los costes. Tome Uber. El CTO Praveen Neppalli Naga le dijo a The Information en abril que iba «volver a la mesa de dibujo porque el presupuesto que pensé que necesitaría ya se ha agotado»: el presupuesto de codificación de la compañía para todo el año 2026 se agotó en cuatro meses, y Naga gastó personalmente 1.200 dólares en una sola demostración de dos horas. En junio, Uber había puesto un Límite de $1,500 por persona y por herramienta en su lugar. Las herramientas fueron útiles, pero utilidad y valor no son lo mismo. El director de operaciones de Uber, Andrew Macdonald, todavía no podía trazar una línea entre esos paneles para «Un 25 % más de funciones útiles para el consumidor».
Encuesta sobre el estado de la IA de 2026 de McKinsey dice que el 80% de las personas dicen que son más rápidos, el 37% de las empresas ven algo de EBIT y el 32% se saltó al menos una compra de software porque podrían desarrollar esa función internamente con agentes de codificación. Las organizaciones quieren reducir la factura. No pueden permitirse el lujo de abandonar la IA. La tarea ahora es optimizar el uso en toda la organización.
No podemos evitar a los fabricantes de modelos chinos como Zhipu, Qwen, DeepSeek y el resto. Una y otra vez han aportado su propio ingenio para desafiar a los laboratorios SOTA y reducir costos. En OpenRouter, los modelos chinos superaron la cuota de tokens de EE. UU. a principios de junio, y la parte superior de ese tablero sigue siendo en su mayoría laboratorios chinos. El mundo de los desarrolladores independientes ya se parece a GLM Flash, DeepSeek Flash, MiniMax, Kimi y, a veces, a Grok o Claude si ya pagaron una suscripción importante. Si ya está suscrito a Grok u OpenAI a través de su empresa, ahora es un costo irrecuperable. Finanzas empezará a preguntarse si esos asientos todavía tienen sentido si el sistema de pago por uso se vuelve tan barato.
Entonces, ¿qué opciones quedan? Considere su trabajo de codificación y agencia en tres grupos, divididos por proporción de tareas y tokens ejecutados en cada nivel, no en dólares, ya que el precio por token mucho más bajo de GLM-5.3-Flash significa que una división uniforme del dólar ya enviaría la mayor parte de su volumen allí. En la parte superior tienes Fable y Opus. Si necesita analizar una estrategia compleja o escribir un plan de ejecución detallado, los puntos extra de inteligencia son importantes y debería gastar mucho dinero, pero sólo en aquellas tareas raras en las que no puede escatimar: probablemente el 5% del volumen de tareas. El nivel medio es Kimi K3, Gemini 3.7 Flash, GPT-5.6 Sol y Grok 4.6, todos con alrededor de 60 en el índice de inteligencia. Kimi es una gran experta en codificación y una de las favoritas de los fanáticos; luego Grok 4.6 le sigue de cerca, aunque su ventana de contexto más pequeña lo frena. Pon alrededor del 50% del volumen aquí. Para el último 45%, consideran firmemente a GLM-5.3-Flash como el caballo de batalla del volumen. Su aprovechamiento, su combinación (codificación, contenido, marketing) y sus evaluaciones trazarán su propia frontera. Los modelos chinos de peso abierto le permitirán ahorrar dinero y deben incluirlos en su cálculo de costos.
Septiembre se perfila como una avalancha de nuevos modelos: se esperan lanzamientos de Google, xAI, Anthropic, OpenAI y DeepSeek. La frontera de Pareto podría volver a moverse. Pero la dirección está marcada: más inteligencia por menos dinero. Los laboratorios que no puedan reducir sus costos de servicio perderán volumen y, con él, la audiencia que ese volumen crea.
Antes de septiembre, algunos deberes:
-
Cuenta tus fichas. ¿Puede atribuir el gasto a una métrica de primera línea como el crecimiento de los ingresos o de los clientes? Si no, ¿al menos velocidad de desarrollo o productividad? Sin objetivos claros, será difícil defender el gasto.
-
Vuelva a construir su presupuesto de IA. Organización por organización, ¿cuál es el gasto previsto en IA? ¿Pueden esos líderes presentar una propuesta y defenderla?
-
Defina su estrategia de modelo por equipo. Escribe los tres niveles. Alto para decisiones y estrategias irreversibles. Mid para el asiento pago y la codificación diaria. Bajo (GLM-5.3-Flash) para volumen.
El mes que viene los modelos vuelven a ser más baratos. Tus equipos tienen más hambre. Las empresas que salgan de esto harán sus apuestas intencionadamente, y no dejarán que esos agentes piensen en Opus o Fable a menos que la tarea realmente valga la pena.
Parvez Syed Mohamed es un ejecutivo de productos que ha creado plataformas de agentes e integración de API en Salesforce (MuleSoft), Oracle y en AgentePaaS.ai. Trabaja en sistemas agentes de producción. Algunas de sus ideas sobre la creación de software con agentes se encuentran aquí: https://github.com/parvezsyed
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































