Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».
Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».
Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».
Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».
Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».
Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».
Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.
Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.
Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.
Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.
En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.
El desafío de optimizar las habilidades de los agentes
Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.
Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.
Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.
Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.
«El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».
Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».
Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».
Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.
Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.
Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.
Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.
Importar disciplina matemática al texto
SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:
-
SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.
-
Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.
-
Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.
-
En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.
-
La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.
SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.
El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.
Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.
Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.
SkillOpt en acción
Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.
La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.
SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.
Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.
Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.
«Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».
Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.
Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.
Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.
Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.
Estrategias de implementación y la ‘captura’ empresarial
Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.
«El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.
Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.
SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».
De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.
«La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».










































































