El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.
El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.
El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.
El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.
El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.
El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.
El escalamiento del tiempo de prueba (TTS) ha surgido como un método probado para mejorar el rendimiento de grandes modelos de lenguaje en aplicaciones del mundo real dándoles ciclos computacionales adicionales en el tiempo de inferencia. Sin embargo, históricamente las estrategias TTS se han elaborado a mano, confiando en gran medida en la intuición humana para dictar las reglas de razonamiento del modelo.
Para abordar este cuello de botella, investigadores de Meta, Google y varias universidades introdujeron AutoTTS, un marco que descubre automáticamente estrategias óptimas de TTS. Este enfoque automatizado permite a las empresas optimizar dinámicamente la asignación de computación sin ajustar manualmente la heurística.
Al implementar las estrategias óptimas descubiertas por AutoTTS, las organizaciones pueden reducir directamente el uso de tokens y los costos operativos asociados con la implementación de modelos de razonamiento avanzados en entornos de producción. En pruebas experimentales, AutoTTS gestionó eficazmente los presupuestos de inferencia y redujo con éxito el consumo de tokens hasta en un 69,5 % sin sacrificar la precisión.
El cuello de botella manual en las pruebas de escalado de tiempo
La escala del tiempo de prueba mejora los LLM al otorgarles cálculos adicionales al generar respuestas. Este cálculo adicional permite que el modelo genere múltiples rutas de razonamiento o evalúe sus pasos intermedios antes de llegar a una respuesta final.
El principal desafío al diseñar estrategias TTS es determinar cómo asignar de manera óptima este cálculo adicional. Históricamente, los investigadores han diseñado estas estrategias manualmente, basándose en conjeturas para construir heurísticas rígidas. Los ingenieros deben hacer suposiciones sobre las reglas y umbrales en los que un modelo debería ramificarse hacia nuevos caminos de razonamiento, profundizar un camino existente, podar una rama poco prometedora o dejar de razonar por completo.
Como este proceso de ajuste manual está limitado por la intuición humana, un gran número de posibles enfoques siguen sin explorarse. Esto a menudo resulta en compensaciones subóptimas entre la precisión del modelo y los costos computacionales.
Los algoritmos TTS actuales se pueden mapear en un espacio de control ancho-profundidad: “ancho” es el número de ramas del razonamiento exploradas y “profundidad” es el grado en que se expande cada rama. La autoconsistencia (SC) muestra un número fijo de trayectorias y vota por mayoría sobre la respuesta. La coherencia adaptativa (ASC) ahorra cálculo al detenerse antes de tiempo una vez que se alcanza un umbral de confianza. La sonda paralela adopta un enfoque más granular, podando las ramas poco prometedoras mientras profundiza el resto. Los tres están hechos a mano, y esta es la limitación que AutoTTS está diseñado para romper.
Aunque algunos métodos más avanzados utilizan estructuras más ricas, como la búsqueda en árbol o las fichas externas, todos comparten una característica clave: están meticulosamente elaborados a mano. Este enfoque manual restringe el alcance del descubrimiento de estrategias, dejando intacto gran parte del espacio potencial de asignación de recursos.
Automatización del descubrimiento de políticas con AutoTTS
AutoTTS replantea cómo se optimiza la escala del tiempo de prueba. En lugar de tratar el diseño de estrategias como una tarea humana, AutoTTS lo aborda como un problema de búsqueda algorítmica en un entorno controlado.
Este marco redefine los roles del ingeniero humano y el modelo de IA. En lugar de elaborar manualmente reglas específicas sobre cuándo un LLM debe bifurcar, podar o detener el razonamiento, el papel del ingeniero pasa a construir el entorno de descubrimiento. El ser humano define los límites, incluido el espacio de control de estados y acciones, objetivos de optimización que equilibran precisión y costo, y mecanismos de retroalimentación específicos.
Un explorador LLM, como Claude Code, diseña la estrategia. Este explorador actúa como un agente autónomo que propone iterativamente “controladores” TTS. Estos controladores son políticas o algoritmos definidos por código que dictan cómo un modelo de IA asigna su presupuesto computacional durante la inferencia. Explorer prueba y refina estos controladores basándose en la retroalimentación hasta que descubre una política óptima de asignación de recursos.
Para que esta búsqueda automatizada sea computacionalmente asequible, AutoTTS se basa en un «entorno de revisión fuera de línea». Si LLM Explorer tuviera que invocar un modelo de razonamiento básico para generar nuevos tokens cada vez que probara una nueva estrategia, los costos computacionales serían astronómicos. En cambio, se basa en miles de trayectorias de razonamiento recopiladas previamente del LLM básico. Estas trayectorias incluyen “señales de sonda”, que son respuestas intermedias que ayudan al controlador a evaluar el progreso en diferentes ramas del razonamiento.
Durante el ciclo de descubrimiento, el agente explorador sugiere un controlador y lo evalúa con respecto a estos datos fuera de línea. El agente observa los rastros de ejecución del controlador propuesto que muestran el cálculo que se le ha asignado a lo largo del tiempo. Al analizar estos rastros, el agente puede diagnosticar modos de falla específicos, por ejemplo, observando si un controlador ha podado ramas de manera demasiado agresiva en un escenario específico. Esto ofrece una ventaja sobre simplemente visualizar el resultado final. Luego, el agente reescribe su código de forma iterativa para mejorar la relación precisión-costo.
Dentro del controlador diseñado por IA
Debido a que el agente explorador no está limitado por la intuición humana, puede descubrir reglas complejas y altamente coordinadas que un ingeniero humano probablemente nunca codificaría manualmente. Un controlador óptimo descubierto por AutoTTS, llamado Confidence Momentum Controller, explota varios mecanismos no obvios para gestionar la computación:
-
Detener según la tendencia: Las estrategias elaboradas a mano a menudo indican al modelo que deje de razonar una vez que alcanza un cierto umbral de confianza instantáneo. El agente de AutoTTS descubrió que la confianza instantánea puede ser engañosa debido a picos temporales. En cambio, el controlador rastrea una media móvil exponencial de confianza (EMA) y sólo se detiene si el nivel de confianza general es alto y la tendencia no está disminuyendo activamente.
-
Control acoplado ancho-profundidad: Los algoritmos diseñados manualmente normalmente tratan la «ampliación» de nuevos caminos de razonamiento y la «profundización» de los caminos actuales como decisiones separadas. AutoTTS descubrió un circuito cerrado de retroalimentación donde las dos acciones están vinculadas. Si la confianza de las ramas actuales se estanca o retrocede, el controlador activa automáticamente la generación de nuevas ramas.
-
Asignación de profundidad basada en la alineación: En lugar de dar a todas las ramas de razonamiento activas un presupuesto computacional igual, el controlador identifica dinámicamente qué ramas concuerdan con la respuesta principal actual. Luego les da prioridad a estas ramas para “ráfagas” de cálculos adicionales. Esto centra el presupuesto computacional en el consenso emergente para verificar rápidamente si es correcto.
Ahorro de costos y aumento de precisión en pruebas comparativas del mundo real
Para probar si una IA podría descubrir de forma autónoma una mejor estrategia de escalamiento del tiempo de prueba, los investigadores implementaron un marco de evaluación riguroso. Los experimentos principales se llevaron a cabo en modelos Qwen3 con parámetros que van desde 0,6B a 8B. Los investigadores también probaron la capacidad del sistema para generalizar en una versión destilada 8B del modelo DeepSeek-R1.
Inicialmente, al agente explorador de IA se le asignó la tarea de descubrir una estrategia óptima utilizando el punto de referencia de razonamiento matemático AIME24. Esta estrategia descubierta se probó luego en dos pruebas de matemáticas seleccionadas, AIME25 y HMMT25, así como en la prueba de razonamiento general de nivel superior GPQA-Diamond.
El controlador descubierto por AutoTTS se comparó con cuatro algoritmos de escala de tiempo de prueba diseñados manualmente en la industria. Estas líneas de base incluyeron autoconsistencia con 64 caminos de razonamiento paralelos (SC@64), coherencia adaptativa (ASC), sonda paralela y autoconsistencia de parada temprana (ESC). ESC es un enfoque híbrido que genera trayectorias en paralelo y se detiene temprano cuando una respuesta parece estable.
Cuando se configuró en un modo equilibrado y económico, el controlador descubierto por AutoTTS redujo el consumo total de tokens en aproximadamente un 69,5 % en comparación con SC@64. Al mismo tiempo, el controlador mantuvo la misma precisión promedio en los cuatro modelos Qwen. Cuando se aumentó el presupuesto de inferencia, AutoTTS impulsó la máxima precisión más allá de todos los puntos de referencia hechos a mano en cinco de ocho casos de prueba.
Esta eficiencia se tradujo en otras tareas. En el punto de referencia GPQA-Diamond, la variante equilibrada de AutoTTS redujo el costo del token de inferencia de 510.000 tokens a solo 151.000 tokens, al tiempo que mejoró ligeramente la precisión general. En el modelo DeepSeek, AutoTTS logró la precisión general más alta en el punto de referencia HMMT25 y redujo el gasto en tokens casi a la mitad.
Para los profesionales que crean aplicaciones de IA empresarial, estas experiencias destacan dos beneficios operativos importantes:
-
Aumente el rendimiento máximo: AutoTTS no sólo ahorra dinero en el consumo de tokens. Aumenta activamente el rendimiento máximo alcanzable del modelo base. El controlador diseñado por IA es notablemente eficaz a la hora de detectar sobre la marcha ramas de razonamiento ruidosas o improductivas y redirigir continuamente su presupuesto computacional hacia las ramas que generan las señales de razonamiento más útiles.
-
Desarrollo personalizado rentable: Dado que el marco se basa en un entorno de revisión fuera de línea, todo el proceso de descubrimiento costó solo $39,90 y tomó 160 minutos. Para los equipos empresariales, esto significa que las estrategias de razonamiento optimizadas adaptadas a modelos propietarios y tareas internas ahora están al alcance, sin un presupuesto de investigación dedicado.
El marco AutoTTS y Confidence Momentum Controller están disponibles en GitHub; El CMC se puede utilizar como reemplazo de otros controladores TTS.










































































