V4 Flash de DeepSeek ha encabezado las tablas de clasificación de modelos y ha sido aclamado por los desarrolladores como un «monstruo total» desde su lanzamiento. Pero en pruebas del mundo real, completó solo el 53,8% de un lote de tareas complejas de agentes.
Composio ejecutó el modelo a través de ocho arneses de agentes diferentes.incluidos Claude Code, Codex y OpenCode, en 30 tareas deliberadamente difíciles de varios pasos que abarcan herramientas en vivo como Gmail, GitHub, Slack y Google Sheets. De un total de 240 ejecuciones, 129 aprobaron y solo seis de los 30 flujos de trabajo se completaron con éxito en cada arnés probado.
La brecha ilustra por qué la orquestación, y no la capacidad del modelo en bruto, puede decidir si el modelo tiene éxito en entornos empresariales: el mismo modelo produjo resultados sustancialmente diferentes dependiendo del aprovechamiento, la configuración de la herramienta, el comportamiento de almacenamiento en caché, los reintentos y la pila de proveedores en la que se ejecutó.
DeepSeek dijo que aumentará los precios de V4 Flash y Promodelos que rápidamente se han convertido en los favoritos entre los desarrolladores que crean agentes y asistentes de codificación.
Si bien parece que la medida podría socavar su atractivo (modelos sorprendentemente capaces a precios ultrabajos que los proveedores fronterizos simplemente no pueden igualar), también lleva la historia más allá de la narrativa ahora cliché del «modelo chino barato», a medida que surgen primeros casos de uso y las empresas descubren dónde encajan los diferentes modelos en sus pilas de tecnología y a qué flujos de trabajo deberían dirigirse.
«Números de adopción «increíbles» a medida que DeepSeek cambia la estructura de costos
DeepSeek lanzó V4 Flash en versión beta pública el 31 de julio y V4 Pro estuvo disponible de forma generalizada el 13 de agosto. El Flash de 284 mil millones de parámetros está diseñado para volumen y velocidad, el Pro de 1,6 billones de parámetros para flujos de trabajo más complejos.
Ambos modelos tienen capacidades de razonamiento flexibles (baja, alta, máxima) y «modos de pensamiento» que aplican razonamiento en cadena de pensamiento (CoT) para mejorar la precisión de las respuestas.
Los usuarios quedaron inmediatamente impresionados por las capacidades de Flash. tiene dominó la clasificación de uso de OpenRouter desde su lanzamiento, actualmente es el modelo más utilizado en la plataforma por volumen de tokens semanal.
«Las cifras de adopción del DeepSeek V4 Flash inicial eran una locura», El investigador de ML Nathan Lambert publicado en X, y agregó que la nueva versión «obtuvo la misma puntuación que GLM 5.2», lo que la convierte en un «monstruo total» que se utilizará ampliamente.
El cambio de modelo de costos de DeepSeek agrega una dimensión interesante.
Tarifas API V4 están aumentando hasta en un 1100% según el modelo, el tipo de token y el tiempo de uso. La nueva estructura de precios:
-
Flash será de 22 centavos por millón de tokens de entrada y 66 centavos por millón de tokens de salida fuera de las horas pico; y 44 centavos por millón de tokens de entrada y 1,32 dólares por millón de tokens de salida en su punto máximo. Esto representa un aumento del 57% al 371%.
-
Pro será de 66 centavos por millón de tokens de entrada y $1,98 por millón de tokens de salida fuera de las horas pico; y 1,32 dólares por millón de tokens de entrada y 3,96 dólares por millón de tokens de salida en su punto máximo. Esto muestra un salto del 51% al 355%.
-
Mientras tanto, los aciertos de caché (cuando los modelos reutilizan los mensajes en lugar de empezar desde cero) están aumentando entre un 52% y un 1100%.
DeepSeek dice que ofrecer un 50% menos de uso fuera de las horas pico tiene como objetivo fomentar una «programación de carga de trabajo más flexible». Diecisiete de cada 24 horas permanecen a mitad de precio y, de hecho, la nueva estructura ofrece el precio más alto en el mercado interno de la empresa.
«Esto no es un simple aumento de precios», dijo Sanchit vir Gogia de Greyhound Research. «Es una arquitectura de precios que hace que el momento de la inferencia sea una variable económica».
El trabajo que puede esperar (como la evaluación por lotes, la generación de datos sintéticos y las ejecuciones de desarrollo nocturnas) pasa a las horas económicas; los agentes interactivos y las operaciones en vivo no pueden. Gogia dijo que la irritación entre los desarrolladores y las empresas es genuina y manifiesta, y que los bajos precios anteriores de DeepSeek no lo obligan a seguir siendo barato para siempre.
A primera vista, parece un «movimiento suicida de una plataforma que todavía busca credibilidad frente a proveedores de modelos de IA más establecidos». dijo la analista tecnológica Carmi Levy.. Los aumentos ciertamente afectarán la ventaja de precios de DeepSeek y obligarán a los clientes a sopesar más las preocupaciones sobre los orígenes chinos de la compañía.
Aún así, DeepSeek sigue siendo mucho más barato según todas las medidas de precios en relación con los modelos competidores de OpenAI, Anthropic, Google, Cohere, xAI y otros, dijo.
Entonces, si bien la medida obligará a DeepSeek a enfatizar el rendimiento y la seguridad sobre el costo, difícilmente elimina su ya notable ventaja de precio-rendimiento y aún brinda a los clientes un amplio margen de maniobra para justificar su uso para cargas de trabajo específicas, dijo Levy. Las matemáticas simplemente tendrán que calcularse con más precisión.
«La ventaja probablemente se erosionará con el tiempo a medida que DeepSeek inevitablemente continúe alineando los precios con las realidades del mercado, pero por ahora todavía es fácil presentar argumentos comerciales», dijo Levy.
¿Dónde puede encajar DeepSeek Flash en los entornos empresariales?
La adopción dentro de las empresas sigue siendo una cuestión abierta debido al costo, la capacidad, la confiabilidad, la gobernanza de los datos, la seguridad y otros factores.
Un caso de uso es el procesamiento por lotes, dijo Levy. Este tipo de trabajo suele ser rutinario y repetitivo, en lugar de exigir inteligencia de primer nivel, por lo que tiene sentido utilizar un modelo más económico y eficiente. «Es un motor de inferencia de alto rendimiento que las empresas pueden considerar utilizar para cargas de trabajo de soluciones puntuales en lugar de como un reemplazo total de las ofertas existentes», afirmó Levy.
La adopción parcial probablemente implicará cargas de trabajo aisladas y no sensibles con métricas de éxito claramente definidas, supervisión estricta, controles de permisos y modelos alternativos en caso de fallas, señaló. Una implementación más amplia requerirá que DeepSeek y sus socios de alojamiento demuestren una sólida confiabilidad, seguridad, privacidad, auditabilidad y opciones de implementación. A medida que ajusta las estructuras de precios en función de la demanda, DeepSeek también debe conservar una ventaja de precio-rendimiento lo suficientemente grande como para justificar cualquier riesgo, dijo.
Espere un uso no autorizado y a menor escala en laboratorios internos y entornos de prueba contenidos a medida que los equipos de TI se familiaricen con el nuevo modelo y averigüen cuándo y cómo presentarlo a los altos directivos para la aprobación del presupuesto.
«DeepSeek se ha ganado una reputación bien ganada como disruptor global», dijo, «y está claro que su marcha hacia una adopción empresarial más amplia seguirá cobrando impulso».
Prueba de DeepSeek en flujos de trabajo de múltiples herramientas
Si bien muchos casos de uso aún se encuentran en fases experimentales, el ingeniero de software Meta Naman Ahuja ofrece uno que podría traducirse directamente en entornos empresariales. En un proyecto no relacionado con su empleador, creó un agente de automatización del hogar con DeepSeek V4 Flash para explorar cómo funciona un modelo de menor costo como capa de razonamiento/orquestación para un flujo de trabajo real con múltiples herramientas.
Cuando sale de casa, un agente coordina varias acciones en sistemas que de otro modo estarían separados: como configurar un termostato en «ausente» para reducir el uso innecesario de energía, armar un sistema de seguridad Ring, cerrar y bloquear puertas.
«Lo que me interesaba no era simplemente si el modelo podía entender un comando, sino si podía traducir la intención en una secuencia de acciones a través de múltiples herramientas donde la confiabilidad importa», dijo Ahuja.
La lección más importante fue que una vez que un modelo puede tomar medidas, la confiabilidad importa tanto como la inteligencia. El sistema necesita resultados de herramientas estructurados, verificación de que las acciones realmente tuvieron éxito, manejo de reintentos/fallos y límites claros en torno a lo que el modelo puede hacer.
En el caso de las empresas, “la arquitectura es similar”. Los dispositivos domésticos cambian a sistemas de emisión de tickets, bases de datos, plataformas CRM o API de infraestructura. Los agentes más útiles probablemente orquestarán flujos de trabajo repetitivos en múltiples sistemas, con permisos específicos, auditabilidad, observabilidad y aprobación humana para acciones de mayor riesgo.
«Muchos agentes valiosos de IA no serán chatbots; serán agentes en segundo plano que coordinarán las API, la infraestructura y los sistemas comerciales en respuesta a los eventos», dijo.
Las empresas necesitan casos de uso tangibles
Pero la API de Flash todavía está en versión beta pública, señaló Gogia, y aún no hay evidencia de una adopción empresarial establecida, implementaciones en el mundo real y clientes designados.
«La historia del índice de referencia es más vaga de lo que se vuelve a contar, la historia de la cartera es más nueva de lo que parece y la economía se ha trasladado al sistema en torno al modelo», dijo. La integración de los desarrolladores está demostrada; la estandarización empresarial no lo es. «El modelo es común en el tráfico y aún no ha sido probado por contrato».
La propia guía de integración de DeepSeek es una consideración importante, dijo: su documentación para al menos un entorno de agente popular establece que las entradas V4 integradas no son suficientes para una operación confiable sin anulaciones de compatibilidad.
«Lo cual es un proveedor que le dice al mercado, con precisión, que el desempeño de referencia no es un indicador de la preparación para la producción», dijo Gogia. «Un modelo puede obtener excelentes resultados y aun así comportarse mal una vez que las herramientas, las credenciales y el estado entran en la sala».
La capa de servicio no se comporta de manera diferente: los mismos pesos abiertos ejecutados por diferentes hosts muestran diferencias visibles en el rendimiento y el tiempo de actividad. «Por lo tanto, elegir Flash responde a una pregunta sobre adquisiciones y abre tres más: quién lo sirve, dónde se ejecuta y qué controles lo rodean», dijo Gogia.
Prepárese para un futuro multimodelo
DeepSeek ofrece un caso matizado para un futuro multimodelo. V4 Flash se está implementando como el trabajador de gran volumen dentro de diversos estados, señaló Gogia: maneja la generación, recuperación y automatización de fondo de rutina, mientras que las tareas más difíciles o sensibles se van a otra parte.
«La pregunta es si su rendimiento es suficiente para los flujos de trabajo del mundo real que las empresas realmente ejecutan, no si supera todos los puntos de referencia», dijo. Las empresas deben determinar qué combinación de modelo, arnés y proveedor completa el trabajo de forma segura al menor costo.
Adam Dalloul, director ejecutivo y fundador de EmpirioLabs AI, señaló que más grande no siempre es mejor; Los flujos de trabajo deben depender de la tarea. Por ejemplo, su equipo en EmpirioLabs AI, que aloja más de 100 modelos en una API, incluido DeepSeek V4 Flash, estuvo trabajando recientemente en la traducción de su sitio a diferentes idiomas, y no era necesario un modelo grande como GPT 5.6 Sol u Opus 5 para completar la tarea.
«Aquí es donde los subagentes resultan útiles», afirmó.
Su enfoque recomendado: generar subagentes más baratos y adaptarse por tarea. Por ejemplo, utilice variantes Flash para el trabajo diario y variantes Pro cuando necesite algo más potente. «Depende de la naturaleza de su solicitud».
Muchas empresas están recurriendo a sus propios puntos de referencia internos para encaminar los modelos de forma eficaz, señaló Dalloul. Por ejemplo, su equipo tiene un flujo de trabajo que somete un modelo a través de varias puertas e instrucciones. Esto les ayuda a identificar el modelo con la velocidad y precisión necesarias para la tarea.
En otro ejemplo, uno de sus clientes empresariales quería acceso exclusivo a DeepSeek V4 Flash. Habían probado una variedad de modelos y V4 Flash era el único que cumplía con sus criterios de velocidad, costo y un «umbral de inteligencia apropiado».
Ahuja de Meta estuvo de acuerdo en que los modelos más pequeños y eficientes pueden manejar tareas agentes frecuentes y bien definidas, mientras que los modelos de frontera más caros pueden reservarse para «decisiones ambiguas, difíciles o de mayor riesgo». La métrica relevante se convierte cada vez más en costo por flujo de trabajo completado con éxito en lugar de simplemente costo por token.
La desventaja, sin embargo, es que la inferencia barata no significa automáticamente una automatización barata o segura, afirmó. Una vez que un sistema de IA puede tomar medidas, la confiabilidad, la verificación, los permisos, el manejo de fallas y la seguridad se vuelven mucho más importantes.
«Una respuesta fallida a un mensaje de texto es inconveniente; una acción fallida en un flujo de trabajo operativo puede tener consecuencias reales», dijo Ahuja.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































