El modelo de IA más nuevo de Meta, Muse Spark 1.3, develado ayeres más rápido y tiene mejor rendimiento en pruebas comparativas de terceros que su predecesor, con una salvedad.
«Muse Spark 1.3 se lanza hoy con un rendimiento de vanguardia casi demasiado barato para medirlo», El cofundador y director ejecutivo de Meta, Mark Zuckerberg, escribió en X, llamándolo el «mayor salto» de Meta hasta el momento en codificación y trabajo de agencia.
Hay sustancia detrás de ambas partes de esa afirmación. Muse Spark 1.3 logra avances significativos sobre la versión 1.2 del mes pasadoparticularmente en tareas de agentes de larga duración. La versión a la que los desarrolladores pueden acceder ahora también es una de las ofertas de precio-rendimiento más sólidas cerca de la cima de las clasificaciones de modelos independientes.
Los resultados comparativos más sólidos de Meta Muse Spark 1.3 provienen de su configuración de razonamiento máximo. Meta dice que la versión aún está completando pruebas de seguridad adicionales y llegará “en breve”; la empresa de evaluación comparativa de terceros Análisis artificiales dice que evaluó max en una vista previa limitada para socios y actualmente no incluye ningún proveedor de API para la configuración.
La versión que se lanzará ampliamente esta semana a través de su arnés Muse Code y el API de metamodelo utiliza la configuración de razonamiento previamente disponible de Meta, incluido xhigh.
Eso hace que la pregunta empresarial más relevante no sea si Muse Spark 1.3 puede alcanzar territorio fronterizo, sino qué tan cerca está el modelo que las empresas pueden implementar hoy en día, y a qué costo real.
El modelo de envío es muy bueno, pero no es el líder de referencia.
Meta revela resultados para ambas configuraciones en su informe de evaluación subyacente, por lo que este no es un caso en el que la empresa oculta el modelo implementable. Pero sus materiales de lanzamiento muestran de manera destacada la variante máxima, y algunas de las puntuaciones más altas pertenecen a esa configuración.
Por ejemplo, Meta informa puntuaciones GDPval-AA v2 de 1754 Elo para max frente a 1709 para xhigh, puntuaciones de OSWorld 2.0 de 66,9 frente a 57,2 y puntuaciones de JobBench de 64,9 frente a 61,2.
En algunas pruebas, la distinción es insignificante o invertida: DeepSearchQA está empatado en 89,4, mientras que xhigh obtiene una puntuación de 89,2 en Terminal-Bench 2.1 frente a un máximo de 88,8.
Análisis artificiales obtiene una puntuación de Muse Spark 1.3 max en 62 en su índice de inteligencia y la versión xhigh de envío en 61. Esta última empata con GPT-5.6 Sol max, Grok 4.6 high y Claude Opus 5 high. Pero Anthropic todavía ocupa la cima de la clasificación: Claude Fable 5.1 alcanza 66 en max y 65 en xhigh, mientras que Claude Opus 5 alcanza 63 en max y xhigh.
En otras palabras, Muse Spark 1.3 xhigh está legítimamente en el grupo de frontera, pero no es el modelo que actualmente establece la frontera.
Sigue siendo un cambio sustancial con respecto a Muse Spark 1.2. La cobertura de VentureBeat del lanzamiento del mes pasado encontró a Meta presentando un desafío de codificación creíble que, sin embargo, en general estaba detrás del mejor modelo de Anthropic. Muse Spark 1.2 obtuvo una puntuación del 82,9% en Terminal-Bench 2.1 frente al 86,7% de Opus 5, y también terminó detrás de Opus en las otras comparaciones principales de codificación que Meta presentó.
Con 1.3, Meta ya no aparece simplemente en ese concurso. En varias evaluaciones de codificación y agentes, está intercambiando victorias con OpenAI y Anthropic.
Meta dice que el modelo subyacente también se ha vuelto más fácil de operar. Muse Spark 1.3 está capacitado para mantener múltiples flujos de trabajo en un hilo largo, recopilar contexto con herramientas, detectar brechas en sus propios planes, pedir aclaraciones a los usuarios cuando sea necesario y confirmar antes de acciones importantes. En las comparaciones internas de los ingenieros de Meta, utilizó aproximadamente un 20 % menos de llamadas a herramientas y un 25 % menos de tokens que 1,2 durante el trabajo de codificación.
Para las empresas que pagan por miles o millones de bucles de agentes, esas mejoras de comportamiento podrían importar más que otro punto en la clasificación.
«Casi demasiado barato para medir» no significa que Meta reduzca sus precios
Muse Spark 1.3 no recibió un recorte de precio de API. Meta mantuvo el precio estándar exactamente donde estaba para Muse Spark 1.2: $1,25 por millón de tokens de entrada, $4,25 por millón de tokens de salida y $0,15 por millón de tokens de entrada almacenados en caché.
|
Modelo |
Entrada ($/1 millón) |
Producción ($/1 millón) |
Total ($/1 millón) |
Fuente |
|
Muse Spark 1.2 / 1.3 Colaborador |
$0.10 |
$0.20 |
$0.30 |
|
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
DeepSeek-V4-Flash: temporada baja |
$0.22 |
$0,66 |
$0,88 |
|
|
GPT-5.6 Luna |
$0.20 |
$1.20 |
$1.40 |
|
|
MiniMax-M3 |
$0.30 |
$1.20 |
$1.50 |
|
|
LongCat-2.0: promoción por tiempo limitado |
$0.30 |
$1.20 |
$1.50 |
|
|
DeepSeek-V4-Flash: horas pico |
$0.44 |
$1.32 |
$1.76 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
DeepSeek-V4-Pro: fuera de horas pico |
$0,66 |
$1.98 |
$2.64 |
|
|
LongCat-2.0 — estándar |
$0,75 |
$2.95 |
$3.70 |
|
|
MiMo-V2.5 Pro (≤256K) |
$1.00 |
$3.00 |
$4.00 |
|
|
Gemini 3.7 Flash: hasta el 31 de diciembre de 2026 |
$0,75 |
$3.75 |
$4.50 |
|
|
Gemini 3.8 Flash: hasta el 31 de diciembre de 2026 |
$0,75 |
$3.75 |
$4.50 |
|
|
DeepSeek-V4-Pro: horas pico |
$1.32 |
$3.96 |
$5.28 |
|
|
Musa Chispa 1.1 / 1.2 / 1.3 |
$1.25 |
$4.25 |
$5.50 |
|
|
GLM-5.3 |
$1.40 |
$4.40 |
$5.80 |
|
|
Grok 4.6 — |
$2.00 |
$6.00 |
$8.00 |
|
|
MiMo-V2.5 Pro (>256K) |
$2.00 |
$6.00 |
$8.00 |
|
|
Qwen3.8-Max |
$2.00 |
$6.00 |
$8.00 |
|
|
Gemini 3.7 Flash: a partir del 1 de enero de 2027 |
$1.50 |
$7.50 |
$9.00 |
|
|
Gemini 3.8 Flash: a partir del 1 de enero de 2027 |
$1.50 |
$7.50 |
$9.00 |
|
|
GPT-5.6 Tierra |
$2.00 |
$12.00 |
$14.00 |
|
|
Grok 4.6: ≥200.000 tokens de aviso |
$4.00 |
$12.00 |
$16.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
kimi k3 |
$3.00 |
$15.00 |
$18.00 |
|
|
Cerrar Trabajo 5 |
$5.00 |
$25.00 |
$30.00 |
|
|
Sakana Fugu Ultra (≤272K) |
$5.00 |
$30.00 |
$35.00 |
|
|
GPT-5.6 Sol — Modo estándar |
$5.00 |
$30.00 |
$35.00 |
|
|
Claude Fábula 5 / Claude Mitos 5 |
$10.00 |
$50.00 |
$60.00 |
|
|
Claude Fábula 5.1 / Claude Mitos 5.1 |
$10.00 |
$50.00 |
$60.00 |
|
|
GPT-5.6 Sol — Modo rápido |
$10.00 |
$60.00 |
$70.00 |
Eso hace que la frase de Zuckerberg “casi demasiado barato para medir” sea menos una declaración sobre precios de tokens más bajos que lo que Meta cree que los desarrolladores pueden lograr con esos tokens.
Análisis artificiales ofrece evidencia para ese argumento, pero también una complicación. Mide Muse Spark 1.3 xhigh a 235,2 tokens de salida por segundo y estima un costo de $0,55 por tarea de Índice de Inteligencia.
Con 61 en el Índice de Inteligencia, eso le da la más bajo costo por tarea de cualquier modelo medido actualmente en ese nivel de inteligencia.
Muse Spark 1.2 cuesta sólo $0,40 por tarea de Análisis Artificial, con una puntuación de 57.
A pesar de que el precio por token se mantiene sin cambios, el costo del punto de referencia independiente para completar una tarea promedio, por lo tanto aumentó generación tras generación. El análisis artificial atribuye el aumento principalmente a un mayor consumo de tokens de entrada en las evaluaciones agentes.
Eso no contradice directamente la afirmación de Meta de un 25% menos de uso de tokens: Meta describe comparaciones en sus propios flujos de trabajo de codificación, mientras que Artificial Analysis mide un conjunto más amplio de tareas de razonamiento y agentes.
Pero ilustra por qué lo “barato” se vuelve resbaladizo una vez que los modelos operan como agentes. Las tasas de tokens, el esfuerzo de razonamiento, la cantidad de vueltas, las llamadas a herramientas y los reintentos contribuyen al costo real de terminar el trabajo.
Meta también conserva su nivel de Colaborador inusualmente barato (0,10 dólares por millón de tokens de entrada y 0,20 dólares por millón de tokens de salida) a cambio de permiso para utilizar indicaciones y finalizaciones para la capacitación.
Como señaló VentureBeat con Muse Spark 1.2, esto puede resultar atractivo para la creación de prototipos, pero crea un cálculo de gobernanza de datos materialmente diferente para las empresas que trabajan con código propietario o información interna confidencial.
El ‘Géminis, ¿quién?’ de Wang aterriza en una comparación inusualmente cercana
El director de IA de Meta, Alexandr Wang, estuvo considerablemente menos calificado para celebrar el lanzamiento.
Después de que Artificial Analysis publicara sus resultados de Muse Spark, Wang los volvió a publicar en X, agregando: “Realmente odio decirlo, pero… ¿géminis quién? 😱💨”
La sombra era particularmente puntiaguda porque Google lanzó Gemini 3.8 Flash el mismo día, presentándolo casi exactamente en la misma clase de carga de trabajo: ingeniería de software de largo plazo, agentes autónomos y razonamiento profesional de varios pasos. Google considera que 3.8 es su mejor modelo Flash de razonamiento y codificación hasta el momento y dice que es el tercer lanzamiento Flash de la compañía en seis semanas.
Los números independientes le dan a Wang algo con qué trabajar, aunque no un nocaut.
El análisis artificial le otorga a Muse Spark 1.3 xhigh una puntuación de índice de inteligencia de 61 a $0,55 por tarea, en comparación con 59 y $0,58 para Gemini 3.8 Flash con razonamiento alto. Por lo tanto, Meta supera a Google tanto en inteligencia como en costo de tareas en esas configuraciones particulares.
Google gana decisivamente en términos de rendimiento. El análisis artificial mide el alto de Gemini 3.8 Flash a aproximadamente 305 tokens de salida por segundo, frente a los 235 de Muse Spark, aproximadamente un 30 % más rápido. Gemini también tiene el precio de etiqueta de API bruto más bajo por ahora: Google está cobrando $ 0,75 por millón de tokens de entrada y $ 3,75 por millón de tokens de salida, en comparación con los $ 1,25 y $ 4,25 de Meta.
Ese precio promocional de Google vence el 31 de diciembre, después de lo cual aumenta a 1,50 dólares por millón de tokens de entrada y 7,50 dólares por millón de tokens de salida.
El resultado es una útil instantánea de cuán estricta se ha vuelto la economía basada en modelos de frontera. Meta actualmente gana esta comparación independiente por dos puntos del Índice de Inteligencia y tres centavos por tarea de referencia; Google ofrece un rendimiento de producción sustancialmente mayor y tokens sin procesar más baratos durante su promoción de lanzamiento.
El “géminis ¿quién?” de Wang Es una charla basura ejecutiva divertida. Para un arquitecto empresarial, la respuesta es más cercana a: Gemini es la opción más rápida; Muse es actualmente el agente de alto esfuerzo ligeramente más fuerte según esta medida independiente.
La evolución de la postura de pesos abiertos de Meta
El problema más importante para algunos desarrolladores puede tener poco que ver con la carrera de referencia actual.
Cuando Meta lanzó Muse Code y Muse Spark 1.2 en agosto, VentureBeat señaló cuán dramáticamente se había alejado la compañía de la estrategia de peso abierto que hizo que Llama fuera omnipresente.
Muse Code y Spark 1.2 eran productos propietarios servidos por API, una postura sorprendente para la empresa que había pasado años argumentando que la IA abierta era el camino a seguir.
Cinco días después, Meta volvió a cambiar de rumbo.
El 10 de agosto, publicó el parámetro de 30 mil millones. Muse Glimmer bajo licencia Apache 2.0. Zuckerberg también dijo: «En las próximas semanas, también abriremos los pesos para Muse Spark 1.2». Reuters informó por separado el plan de Meta de lanzar los pesos Spark 1.2.
Ahora, Meta ha enviado Muse Spark 1.3 como otro modelo propietario.
Eso todavía no equivale a una promesa incumplida: las “próximas semanas” pueden describir razonablemente un período superior a tres semanas. Pero el anuncio de hoy hace que la hoja de ruta sea menos clara que más.
La nueva publicación de Meta ya no dice Muse Spark 1.2. Dice que su hoja de ruta incluye “el lanzamiento de pesos abiertos de Muse Spark”, sin identificar una versión, fecha de lanzamiento, tamaño del modelo o licencia. Zuckerberg también dijo en X que los “lanzamientos de pesos abiertos de Muse Spark” llegarán pronto.
Para los equipos que estandarizaron Llama porque los pesos descargables significaban autohospedaje, personalización y control sobre la economía de inferencia, esa ambigüedad puede importar más que si Spark ganó otro punto en un punto de referencia compuesto.
Muse Spark 1.3 muestra que Meta ahora puede iterar modelos de frontera propietarios a una velocidad extraordinaria. La configuración de envío xhigh es rápida, tiene un precio competitivo y está mucho más cerca de la cima de las clasificaciones independientes que sus predecesores. La vista previa máxima muestra que Meta puede impulsar a la familia un poco más cuando se le permite gastar más cálculo de razonamiento.
La próxima prueba es diferente: si Meta puede convertir ese ritmo en una hoja de ruta que las empresas realmente puedan planificar, incluyendo hacer que sus mejores capacidades sean ampliamente implementables y entregar el modelo Spark de peso abierto que ya ha dicho que está por llegar.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.








































































