Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.
Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.
Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.
Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.
Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.
Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.
Cada canal de LangChain que su equipo codifica comienza a romperse en el momento en que cambia la distribución de consultas, y siempre cambia. Ese cuello de botella es lo que Sakana AI se propuso eliminar.
Los investigadores de Sakana AI han presentado el «Conductor RL«, un pequeño modelo de lenguaje entrenado mediante aprendizaje por refuerzo para orquestar automáticamente un grupo diverso de LLM de trabajadores. Conductor analiza dinámicamente las entradas, distribuye el trabajo entre los trabajadores y coordina entre los agentes.
Esta coordinación automatizada logra resultados de última generación en pruebas comparativas de razonamiento y codificación difíciles, superando a los modelos de frontera individuales como GPT-5 y Claude Sonnet 4, así como a costosas canalizaciones de múltiples agentes diseñadas por humanos. Logra este rendimiento a una fracción del costo y con menos llamadas API que la competencia. RL Conductor es la columna vertebral de Fugu, el servicio comercial de orquestación multiagente de Sakana AI.
Las limitaciones de los marcos agentes manuales.
Los modelos de lenguaje grandes tienen fuertes capacidades latentes. Pero aprovechar al máximo estas capacidades es un gran desafío. Obtener este nivel de rendimiento depende en gran medida de flujos de trabajo agentes diseñados manualmente, que sirven como componentes críticos en los productos comerciales de IA.
Sin embargo, estos marcos se quedan cortos porque son inherentemente rígidos y limitados. En comentarios a VentureBeat, Yujin Tang, coautor del artículo, explicó el punto de ruptura exacto de los sistemas actuales: «Si bien el uso de marcos con canales codificados como LangChain y Mixture-of-Agents puede funcionar bien para casos de uso específicos… En producción, surge un cuello de botella inherente cuando se apunta a dominios con grandes bases de usuarios con demandas muy heterogéneas».
Tang señaló que lograr «la generalización del mundo real en aplicaciones tan heterogéneas requiere inherentemente ir más allá de los diseños codificados por humanos».
Otro obstáculo para la construcción de sistemas agentes robustos es que ningún modelo es óptimo para todas las tareas. Se afinan diferentes modelos para especializarse en distintos dominios. Un modelo puede sobresalir en razonamiento científico, mientras que otro es superior en generación de código, lógica matemática o planificación de alto nivel.
Debido a que los modelos tienen estas características variables y habilidades complementarias, predecir y codificar manualmente la combinación ideal de modelos para cada consulta es prácticamente imposible. Un marco agente óptimo debería poder analizar un problema y delegar subtareas al experto más adecuado del grupo.
Dirigiendo una orquesta de agentes
El RL Conductor está diseñado para superar las limitaciones de los marcos rígidos diseñados por humanos. Como su nombre lo indica, dirige una orquesta de agentes dividiendo problemas desafiantes, delegando subtareas específicas y diseñando topologías de comunicación para un conjunto de trabajadores LLM.
En lugar de depender de un código fijo o un enrutamiento estático, Conductor organiza estos modelos generando un flujo de trabajo personalizado. Para cada paso del flujo de trabajo, el modelo genera una instrucción en lenguaje natural para un aspecto específico de la tarea, asigna un agente para llevarla a cabo y define una «lista de acceso» que dicta qué subtareas pasadas y respuestas de otros agentes se incluyen en el contexto de ese agente.
Al definir todo en lenguaje natural, Conductor crea flujos de trabajo flexibles adaptados a cada entrada. Puede construir cadenas secuenciales simples, estructuras de árboles paralelos o incluso bucles recursivos según las demandas del problema.
Es importante destacar que el modelo aprende estas estrategias no mediante diseño humano sino mediante el aprendizaje por refuerzo (RL) y la maximización de recompensas. Durante el entrenamiento, al modelo se le asigna una tarea, un grupo de trabajadores y una señal de recompensa en función de si su respuesta y formato de salida son correctos.
A través de un algoritmo RL simple de prueba y error, el modelo descubre orgánicamente qué combinaciones de instrucciones y estructuras de comunicación generan la mayor recompensa. Como resultado, adopta automáticamente estrategias de orquestación avanzadas, como ingeniería de avisos específicos, refinamiento iterativo y optimización de meta-avisos.
El modelo aprende a ajustar dinámicamente sus estrategias y aprovechar las distintas fortalezas de sus agentes trabajadores sin que ningún desarrollador humano tenga que codificar el proceso.
Director en acción
Para probar RL Conductor en acción, los investigadores ajustaron el parámetro Qwen2.5-7B de 7 mil millones utilizando el marco. Durante la formación, al director se le asignó la tarea de diseñar flujos de trabajo agentes de hasta cinco pasos. Se le dio acceso a un grupo de trabajadores que contenía siete modelos diferentes: tres gigantes de código cerrado (Gemini 2.5 Pro, Claude-Sonnet-4 y GPT-5) y cuatro modelos de código abierto (incluidos DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B y Qwen3-32B).
El equipo evaluó Conductor a través de una variedad de puntos de referencia altamente desafiantes, comparándolo con modelos de frontera individuales que actúan solos, agentes de autorreflexión impulsados iterativamente para mejorar sus propias respuestas y marcos de enrutamiento de múltiples agentes de última generación como MASRouter, Mixture-of-Agents (MoA), RouterDC y Smoothie. El pequeño 7B Conductor estableció nuevos puntos de referencia en todos los ámbitos. Logró una puntuación promedio del 77,27% en todas las tareas, alcanzando el 93,3% en el punto de referencia matemático AIME25, el 87,5% en GPQA-Diamond y el 83,93% en LiveCodeBench, según los investigadores.
Sorprendentemente, logró estas calificaciones sin dejar de ser altamente eficiente. Mientras que los modelos de referencia como MoA consumieron 11.203 tokens por pregunta, Conductor utilizó un promedio de solo 1.820 tokens, tomando un promedio de solo tres pasos por flujo de trabajo.
Una mirada más cercana a los detalles experimentales muestra exactamente por qué el marco es tan efectivo. El director aprendió automáticamente a medir la dificultad de la tarea. Para preguntas simples de recuerdo de hechos, a menudo resolvió el problema en un solo paso o utilizó una configuración básica de dos agentes. Sin embargo, para problemas de codificación complejos, creó flujos de trabajo extensos que involucraban hasta cuatro agentes con fases dedicadas de planificación, implementación y verificación.
El Director también aprendió que los modelos de frontera tienen diferentes puntos fuertes. Para lograr puntuaciones récord en pruebas de codificación, el director asignó con frecuencia Gemini 2.5 Pro y Claude Sonnet 4 para que actuaran como planificadores de alto nivel, y solo trajo GPT-5 al final para escribir el código optimizado final. En una muestra particularmente inteligente de adaptabilidad, el Director a veces abdicaba por completo de su propio papel, entregando todo el proceso de planificación a Gemini 2.5 Pro y permitiéndole dictar las subtareas para el resto del grupo.
Más allá de los puntos de referencia matemáticos y de codificación, Sakana AI ya está poniendo a funcionar la arquitectura subyacente en la utilidad de front-office. «Hemos estado utilizando nuestros modelos Fugu basados en la tecnología Conductor internamente para diversas aplicaciones empresariales prácticas: desarrollo de software, investigación profunda, desarrollo de estrategias e incluso tareas visuales como generación de diapositivas», dijo Tang.
Llevando la orquestación a la empresa: Sakana Fugu
Si bien el modelo 7B descrito en el artículo de investigación fue un modelo exploratorio y no está disponible públicamente, Sakana AI ha convertido el marco Conductor en su producto comercial insignia de IA. Sakana Fugu. Ahora en su fase beta, Fugu sirve como un sistema de orquestación multiagente accesible a través de una API estándar compatible con OpenAI.
Tang señaló que Fugu apunta a «el gran mercado de industrias donde la adopción de la IA aún no ha generado grandes ganancias de productividad debido a las limitaciones de generalización de los actuales procesos codificados, como las finanzas y la defensa».
Para los desarrolladores empresariales, esto permite una integración perfecta en las aplicaciones existentes sin el dolor de cabeza de administrar múltiples claves API o enrutar tareas manualmente entre diferentes proveedores. Detrás de la interfaz API, Fugu automatiza topologías de colaboración complejas y asignaciones de roles en un conjunto de modelos. Para satisfacer las diversas necesidades empresariales, Sakana lanzó dos variantes: Fugu Mini, diseñada para operaciones de baja latencia, y Fugu Ultra, diseñada para ofrecer el máximo rendimiento en cargas de trabajo exigentes.
Al abordar las preocupaciones de gobernanza en torno a los agentes autónomos que generan flujos de trabajo invisibles, Tang señaló que los riesgos de interpretabilidad son funcionalmente similares a los rastros de razonamiento ocultos de las API cerradas de primer nivel actuales, y que el sistema se administra con barreras de seguridad establecidas para minimizar las alucinaciones.
Para los arquitectos empresariales que evalúan cuándo implementar la orquestación RL versus el enrutamiento tradicional, la decisión a menudo se reduce a los recursos de ingeniería. «Creemos que el punto óptimo absoluto llega cuando los usuarios y sus equipos sienten que están dedicando una cantidad desproporcionada de tiempo a guiar a sus agentes subyacentes», dijo Tang. Sin embargo, advirtió que el marco no es necesario para todo, señalando que «es difícil superar la propuesta económica de un modelo local que se ejecuta directamente en la máquina del usuario para consultas simples».
A medida que la diversidad de modelos especializados de IA de código abierto y cerrado continúa creciendo, los canales estáticos codificados inevitablemente se volverán obsoletos. De cara al futuro, esta orquestación dinámica probablemente se extenderá más allá de los entornos de texto y código. «De hecho, existe un gran potencial para llenar este vacío con marcos Conductor multimodales que se conviertan en la base de sistemas físicos de IA más autónomos y autocoordinados», dijo Tang.













































































