Hace una semana, apareció en OpenRouter un modelo misterioso llamado Ox Alpha: otro participante entre más de 400 modelos, y se lanzan alrededor de 10 nuevos modelos cada semana. Lo que lo distinguió no fue sólo el precio gratuito; fue bastante bueno. Los aficionados y los desarrolladores independientes se dieron cuenta rápidamente, transfiriendo varios miles de millones de tokens allí diariamente, con estimaciones de la comunidad para la semana que van desde un solo dígito hasta más de 20 billones.
Los entusiastas de la IA pasaron los siguientes seis días haciendo análisis forenses y especulando sobre quién podría haberla construido y quién podría haber tenido la infraestructura para ofrecer tantos tokens de forma gratuita. Primero, se suponía que era un laboratorio estadounidense: el tan esperado Gemini, o Anthropic que ofrecía un nivel medio bastante bueno, o Elon con tal capacidad que abandonó Ox Alpha (tenga en cuenta el nombre). La gente realizó seguimientos de tokenizadores y escaneos de red. Una auténtica semana de misterio de Sherlock Holmes.
El 26 de agosto, Z.ai puso su nombre allí. Ox Alpha era GLM-5.3-Flash. Lo habían hecho expresamente para el tráfico público, pero la verdadera sorpresa no fue la calidad del modelo (es realmente buena). Se sirvió íntegramente con chips e infraestructura chinos. El precio de lista es de 15 centavos/50 centavos por millón de tokens. La promoción de lanzamiento de OpenRouter tiene un 50 % de descuento, o 7,5 centavos/25 centavos, hasta el 9 de septiembre. Los pesos están abiertos (MIT) y la inferencia está alojada en Z.ai, así como en GMI Cloud, Cloudflare y otros proveedores de inferencia con sede en EE. UU.
Artificial Analysis colocó el modelo en su gráfico de inteligencia/costos el mismo día. GLM-5.3-Flash ocupa el puesto 57 en el índice por unos nueve centavos por tarea. Un gama media estadounidense como GPT-5.6 Sol (max) cuesta entre 59 y 67 céntimos, lo que significa que por dos puntos de inteligencia se paga aproximadamente 7,4 veces más. Vaya más allá y Grok 4.6 cuesta entre 61 y 94 centavos por tarea, o aproximadamente 10 veces para una ganancia de cuatro puntos. En esta etapa, la economía simbólica influye fuertemente en el cálculo del consumo. En el extremo superior, la curva se ha aplanado. Si mordemos este anzuelo de peso abierto, ¿qué sucede con las fuertes inversiones en infraestructura circular que hemos realizado y que nunca han representado un fuerte competidor de inferencia chino?
Las empresas estadounidenses ya están sintiendo la presión de los costes. Tome Uber. El CTO Praveen Neppalli Naga dijo a The Information en abril que estaba «volviendo a la mesa de dibujo porque el presupuesto que pensé que necesitaba ya se ha gastado»: el presupuesto de codificación de la compañía para el año 2026 desapareció en cuatro meses, y Naga gastó personalmente 1.200 dólares en una sola demostración de dos horas. En junio, Uber implementó un límite de 1.500 dólares por persona y por herramienta. Las herramientas fueron útiles, pero utilidad y valor no son lo mismo. El director de operaciones de Uber, Andrew Macdonald, todavía no podía trazar una línea entre estos paneles y «un 25% más de funciones útiles para los consumidores».
La encuesta sobre el estado de la IA de 2026 de McKinsey indica que el 80% de las personas dicen que son más rápidas, el 37% de las empresas ven algo de EBIT y el 32% se ha saltado al menos una compra de software porque podrían desarrollar esa funcionalidad internamente con agentes de codificación. Las organizaciones quieren reducir la factura. No pueden permitirse el lujo de abandonar la IA. La tarea ahora es optimizar el uso en toda la organización.
No podemos evitar a los modeladores chinos como Zhipu, Qwen, DeepSeek y otros. Una y otra vez, han demostrado ingenio para desafiar a los laboratorios SOTA y reducir costos. En OpenRouter, los modelos chinos superaron la proporción de tokens estadounidenses a principios de junio, y la cima de esta clasificación sigue estando compuesta principalmente por laboratorios chinos. El mundo de los desarrolladores independientes ya se parece a GLM Flash, DeepSeek Flash, MiniMax, Kimi y, a veces, a Grok o Claude, si ya han pagado una suscripción considerable. Si ya se suscribe a Grok u OpenAI a través de su empresa, ahora esto es un costo irrecuperable. Las finanzas empezarán a preguntarse si estos asientos todavía tienen sentido si el sistema de pago por uso se vuelve tan barato.
Entonces, ¿qué opciones quedan? Considere su trabajo de codificación y agente en tres categorías, divididos por proporción de tareas y tokens ejecutados en cada nivel, no por dólares, ya que el precio mucho más bajo por token de GLM-5.3-Flash significa que una división igual en dólares ya enviaría la mayor parte de su volumen allí. En la parte superior tienes Fable y Opus. Si necesita analizar una estrategia compleja o escribir un plan de ejecución detallado, los puntos de inteligencia adicionales son importantes y debería gastar mucho dinero, pero sólo en tareas raras en las que no puede escatimar (probablemente el 5% del volumen de tareas). El nivel medio es Kimi K3, Gemini 3.7 Flash, GPT-5.6 Sol y Grok 4.6, todos los cuales rondan el 60 en el índice de inteligencia. Kimi es un gran bateador cuando se trata de codificación y un favorito de los fanáticos; Luego, Grok 4.6 le sigue de cerca, aunque su ventana emergente más pequeña lo frena. Pon alrededor del 50% del volumen aquí. Para el 45% restante, consideren firmemente el GLM-5.3-Flash como el caballo de batalla del volumen. Su operación, su combinación (codificación versus contenido versus marketing) y sus evaluaciones trazarán sus propios límites. Los modelos chinos de peso abierto le permitirán ahorrar dinero y deberían incluirse en su cálculo de costes.
Septiembre se perfila como una avalancha de nuevos modelos: Google, xAI, Anthropic, OpenAI y DeepSeek tienen lanzamientos esperados. La frontera de Pareto aún podría moverse. Pero la dirección está marcada: más inteligencia por menos dinero. Los laboratorios que no reduzcan los costos de sus servicios perderán volumen y, con él, la audiencia que ese volumen crea.
Antes de septiembre, algunos deberes:
-
Cuenta tus fichas. ¿Puede atribuir el gasto a una métrica principal como el crecimiento de clientes o ingresos? Si no, ¿al menos la velocidad del desarrollo o la productividad? Sin objetivos claros, será difícil defender el gasto.
-
Reponga su presupuesto de IA. Organización por organización, ¿cuál es el gasto previsto en IA? ¿Pueden estos líderes presentar una propuesta y defenderla?
-
Defina la estrategia del modelo de su equipo. Anota los tres niveles. Alto para decisiones y estrategias irreversibles. Medio para asiento pago y codificación diaria. Bajo (GLM-5.3-Flash) para volumen.
El mes que viene, los modelos volverán a ser más baratos. Sus equipos están cada vez más hambrientos. Las empresas que salgan de esto harán sus apuestas intencionadamente y no dejarán que estos agentes piensen en Opus o Fable a menos que la tarea realmente valga la pena.
Parvez Syed Mohamed es un gerente de producto que ha creado plataformas de integración de agentes y API en Salesforce (MuleSoft), Oracle y AgentePaaS.ai. Trabaja en sistemas de agentes de producción. Algunas de sus ideas sobre la creación de software con agentes están aquí: https://github.com/parvezsyed
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































