• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
martes, septiembre 8, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

    Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

    Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

    Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

    Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

    Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

    RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

    RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

    Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

    Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

    SB dispone devolución de 115.7 MM de pesos a 4,968 usuarios que realizaron reclamaciones a través de ProUsuario

    SB dispone devolución de 115.7 MM de pesos a 4,968 usuarios que realizaron reclamaciones a través de ProUsuario

    Presidente Luis Abinader convoca a las iglesias a jornada nacional de oración y acción de gracias por República Dominicana

    Presidente Luis Abinader convoca a las iglesias a jornada nacional de oración y acción de gracias por República Dominicana

    Diputada Patricia Núñez aboga por consenso para aprobar ley que proteja a menores de cigarrillos electrónicos

    Diputada Patricia Núñez aboga por consenso para aprobar ley que proteja a menores de cigarrillos electrónicos

    Precios de los alimentos aumentan con el PRM, asegura Leonel, porque “las importaciones agropecuarias se han duplicado” en perjuicio de productores nacionales

    Precios de los alimentos aumentan con el PRM, asegura Leonel, porque “las importaciones agropecuarias se han duplicado” en perjuicio de productores nacionales

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      La camporista que compró el departamento vecino al de CFK se contradijo en sus declaraciones y reconoció la operación

      La camporista que compró el departamento vecino al de CFK se contradijo en sus declaraciones y reconoció la operación

      Promanzio y Fabián Calle señalaron al Gobierno de Orsi por facilitar la logística británica en Malvinas

      Promanzio y Fabián Calle señalaron al Gobierno de Orsi por facilitar la logística británica en Malvinas

      Revelan los resultados de la tomografía de Mirtha Legrand tras su internación

      Revelan los resultados de la tomografía de Mirtha Legrand tras su internación

      Pablo Aimar apuesta por la tierra y participa en un proyecto de barrio boutique en Río Cuarto

      Pablo Aimar apuesta por la tierra y participa en un proyecto de barrio boutique en Río Cuarto

      TV Globo confirmó la segunda temporada de Avenida Brasil: se estrena en enero de 2027

      TV Globo confirmó la segunda temporada de Avenida Brasil: se estrena en enero de 2027

      La relación entre EEUU y Reino Unido en su peor momento: el gobierno laborista ataca al mismo tiempo a Milei y a Israel

      La relación entre EEUU y Reino Unido en su peor momento: el gobierno laborista ataca al mismo tiempo a Milei y a Israel

      YPF proyecta inversiones por USD 154.100 millones bajo el RIGI hasta 2040

      YPF proyecta inversiones por USD 154.100 millones bajo el RIGI hasta 2040

      BASADO: el parlamento de Liechtenstein aprobó el aborto y el príncipe católico lo vetará

      BASADO: el parlamento de Liechtenstein aprobó el aborto y el príncipe católico lo vetará

      El estrecho de Ormuz y la seguridad energética de América

      El estrecho de Ormuz y la seguridad energética de América

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Abinader inaugura Repica 2026 y presentan a RD como HUB...

        Abinader inaugura Repica 2026 y presentan a RD como HUB…

        Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

        Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

        Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

        Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

        Anadegas afirma terminan los plazos para uso de verifón en sus...

        Anadegas afirma terminan los plazos para uso de verifón en sus…

        Embajadora Ysset Román Maldonado presenta sus Cartas...

        Embajadora Ysset Román Maldonado presenta sus Cartas…

        Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

        Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

        Unesco destaca avances de República Dominicana en acceso, equidad y finalización educativa

        Educación RD avanza en Ciencias, equidad, acceso…

        RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

        RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

        Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

        Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Kelvin Faña asegura Luis Abinader ha salido más inteligente...

          Kelvin Faña asegura Luis Abinader ha salido más inteligente…

          Consulta del PLD avanza con transparencia, imparcialidad...

          Consulta del PLD avanza con transparencia, imparcialidad…

          SAN JUAN: Dirigentes políticos de Las Zanjas abandonan el PRM y se suman a la Fuerza del Pueblo

          SAN JUAN: Dirigentes políticos de Las Zanjas abandonan el PRM y se suman a la Fuerza del Pueblo

          ¡Golpe político al PRM en San Juan! Reconocido cardiólogo y excoordinador de campaña Juan Francisco Acosta se juramenta en la Fuerza del Pueblo

          ¡Golpe político al PRM en San Juan! Reconocido cardiólogo y excoordinador de campaña Juan Francisco Acosta se juramenta en la Fuerza del Pueblo

          (VIDEOS) EN SAN JUAN! Alejandro “Pollo” pide perdón y se juramenta con Leonel Fernández en la Fuerza del Pueblo

          (VIDEOS) EN SAN JUAN! Alejandro “Pollo” pide perdón y se juramenta con Leonel Fernández en la Fuerza del Pueblo

          PRM juramenta a sus nuevas autoridades encabezadas el presidente Luis Abinader

          PRM juramenta a sus nuevas autoridades encabezadas el presidente Luis Abinader

          Leonel Fernández desarrollará amplia agenda este fin de semana en Azua, San Juan y Elías Piña

          Leonel Fernández desarrollará amplia agenda este fin de semana en Azua, San Juan y Elías Piña

          Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

          Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

          ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

          ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                US slaps import ban on Canadian alcohol and other goods

                US slaps import ban on Canadian alcohol and other goods

                Meta continues to run ads promoting child sexual abuse material in India: report

                Meta continues to run ads promoting child sexual abuse material in India: report

                Hegseth shakes up the Pentagon as US wages war - but at what cost?

                Hegseth shakes up the Pentagon as US wages war – but at what cost?

                LIV Golf: Players free to leave after competition files for bankruptcy protection

                LIV Golf: Players free to leave after competition files for bankruptcy protection

                UK announces sanctions on West Bank settlements prompting furious Israeli response

                UK announces sanctions on West Bank settlements prompting furious Israeli response

                Fourteen go on trial over deadliest Channel small boats disaster

                Fourteen go on trial over deadliest Channel small boats disaster

                Rubio anuncia la incorporación de Perú a Escudo de las Américas

                Rubio anuncia la incorporación de Perú a Escudo de las Américas

                British widow faces deportation from Sweden after 22 years

                British widow faces deportation from Sweden after 22 years

                German police arrest suspect over sabotage attacks on power grid

                German police arrest suspect over sabotage attacks on power grid

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  Meta lanza Muse, agente personal de IA, que enfatiza la seguridad y la privacidad

                  Meta lanza Muse, agente personal de IA, que enfatiza la seguridad y la privacidad

                  La china Huawei Technologies se enfrenta a un juicio por extorsión en Nueva York

                  La china Huawei Technologies se enfrenta a un juicio por extorsión en Nueva York

                  Japón protesta mientras China aplica nuevas medidas contra las exportaciones de material clave para la fabricación de chips

                  Japón protesta mientras China aplica nuevas medidas contra las exportaciones de material clave para la fabricación de chips

                  'Divorce-tok' llena las redes sociales a medida que los creadores encuentran audiencia (y apoyo) al compartir su angustia

                  ‘Divorce-tok’ llena las redes sociales a medida que los creadores encuentran audiencia (y apoyo) al compartir su angustia

                  Los vuelos hacia y desde la capital de Indonesia se reanudan después de que la erupción volcánica obligara a un cierre de dos días

                  Los vuelos hacia y desde la capital de Indonesia se reanudan después de que la erupción volcánica obligara a un cierre de dos días

                  El reactor sirio de la era Assad fue configurado para armas nucleares, dice el jefe de la OIEA

                  El reactor sirio de la era Assad fue configurado para armas nucleares, dice el jefe de la OIEA

                  Indonesia mantiene cerrados varios aeropuertos aunque la erupción volcánica está remitiendo

                  Indonesia mantiene cerrados varios aeropuertos aunque la erupción volcánica está remitiendo

                  Qué transmitir: 'The Paper', Bloc Party, '¡Llame a mi agente!' y un juego de 'Halloween'

                  Qué transmitir: ‘The Paper’, Bloc Party, ‘¡Llame a mi agente!’ y un juego de ‘Halloween’

                  El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                  El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                    Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

                      Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

                      Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

                      Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

                      Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

                      Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

                      RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

                      RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

                      Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

                      Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

                      SB dispone devolución de 115.7 MM de pesos a 4,968 usuarios que realizaron reclamaciones a través de ProUsuario

                      SB dispone devolución de 115.7 MM de pesos a 4,968 usuarios que realizaron reclamaciones a través de ProUsuario

                      Presidente Luis Abinader convoca a las iglesias a jornada nacional de oración y acción de gracias por República Dominicana

                      Presidente Luis Abinader convoca a las iglesias a jornada nacional de oración y acción de gracias por República Dominicana

                      Diputada Patricia Núñez aboga por consenso para aprobar ley que proteja a menores de cigarrillos electrónicos

                      Diputada Patricia Núñez aboga por consenso para aprobar ley que proteja a menores de cigarrillos electrónicos

                      Precios de los alimentos aumentan con el PRM, asegura Leonel, porque “las importaciones agropecuarias se han duplicado” en perjuicio de productores nacionales

                      Precios de los alimentos aumentan con el PRM, asegura Leonel, porque “las importaciones agropecuarias se han duplicado” en perjuicio de productores nacionales

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        La camporista que compró el departamento vecino al de CFK se contradijo en sus declaraciones y reconoció la operación

                        La camporista que compró el departamento vecino al de CFK se contradijo en sus declaraciones y reconoció la operación

                        Promanzio y Fabián Calle señalaron al Gobierno de Orsi por facilitar la logística británica en Malvinas

                        Promanzio y Fabián Calle señalaron al Gobierno de Orsi por facilitar la logística británica en Malvinas

                        Revelan los resultados de la tomografía de Mirtha Legrand tras su internación

                        Revelan los resultados de la tomografía de Mirtha Legrand tras su internación

                        Pablo Aimar apuesta por la tierra y participa en un proyecto de barrio boutique en Río Cuarto

                        Pablo Aimar apuesta por la tierra y participa en un proyecto de barrio boutique en Río Cuarto

                        TV Globo confirmó la segunda temporada de Avenida Brasil: se estrena en enero de 2027

                        TV Globo confirmó la segunda temporada de Avenida Brasil: se estrena en enero de 2027

                        La relación entre EEUU y Reino Unido en su peor momento: el gobierno laborista ataca al mismo tiempo a Milei y a Israel

                        La relación entre EEUU y Reino Unido en su peor momento: el gobierno laborista ataca al mismo tiempo a Milei y a Israel

                        YPF proyecta inversiones por USD 154.100 millones bajo el RIGI hasta 2040

                        YPF proyecta inversiones por USD 154.100 millones bajo el RIGI hasta 2040

                        BASADO: el parlamento de Liechtenstein aprobó el aborto y el príncipe católico lo vetará

                        BASADO: el parlamento de Liechtenstein aprobó el aborto y el príncipe católico lo vetará

                        El estrecho de Ormuz y la seguridad energética de América

                        El estrecho de Ormuz y la seguridad energética de América

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Abinader inaugura Repica 2026 y presentan a RD como HUB...

                          Abinader inaugura Repica 2026 y presentan a RD como HUB…

                          Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

                          Otáñez: “El 2028 comienza ahora y se gana desde los barrios”

                          Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

                          Sistema 9-1-1 pone a prueba nuevas tecnologías de alerta y drones de respuesta durante Simulacro Nacional de Terremoto

                          Anadegas afirma terminan los plazos para uso de verifón en sus...

                          Anadegas afirma terminan los plazos para uso de verifón en sus…

                          Embajadora Ysset Román Maldonado presenta sus Cartas...

                          Embajadora Ysset Román Maldonado presenta sus Cartas…

                          Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

                          Pepe Abreu: “RD viviría ingobernabilidad en 2033 por bajas pensiones darían AFP; pide no reintroducir Código”

                          Unesco destaca avances de República Dominicana en acceso, equidad y finalización educativa

                          Educación RD avanza en Ciencias, equidad, acceso…

                          RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

                          RD mejora en ciencias, pero persisten fuertes rezagos en lectura y matemáticas, según PISA 2025

                          Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

                          Gobierno destaca que la tasa de pobreza monetaria bajó 2.9 puntos este año con respecto a 2025

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Kelvin Faña asegura Luis Abinader ha salido más inteligente...

                            Kelvin Faña asegura Luis Abinader ha salido más inteligente…

                            Consulta del PLD avanza con transparencia, imparcialidad...

                            Consulta del PLD avanza con transparencia, imparcialidad…

                            SAN JUAN: Dirigentes políticos de Las Zanjas abandonan el PRM y se suman a la Fuerza del Pueblo

                            SAN JUAN: Dirigentes políticos de Las Zanjas abandonan el PRM y se suman a la Fuerza del Pueblo

                            ¡Golpe político al PRM en San Juan! Reconocido cardiólogo y excoordinador de campaña Juan Francisco Acosta se juramenta en la Fuerza del Pueblo

                            ¡Golpe político al PRM en San Juan! Reconocido cardiólogo y excoordinador de campaña Juan Francisco Acosta se juramenta en la Fuerza del Pueblo

                            (VIDEOS) EN SAN JUAN! Alejandro “Pollo” pide perdón y se juramenta con Leonel Fernández en la Fuerza del Pueblo

                            (VIDEOS) EN SAN JUAN! Alejandro “Pollo” pide perdón y se juramenta con Leonel Fernández en la Fuerza del Pueblo

                            PRM juramenta a sus nuevas autoridades encabezadas el presidente Luis Abinader

                            PRM juramenta a sus nuevas autoridades encabezadas el presidente Luis Abinader

                            Leonel Fernández desarrollará amplia agenda este fin de semana en Azua, San Juan y Elías Piña

                            Leonel Fernández desarrollará amplia agenda este fin de semana en Azua, San Juan y Elías Piña

                            Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

                            Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

                            ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

                            ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  US slaps import ban on Canadian alcohol and other goods

                                  US slaps import ban on Canadian alcohol and other goods

                                  Meta continues to run ads promoting child sexual abuse material in India: report

                                  Meta continues to run ads promoting child sexual abuse material in India: report

                                  Hegseth shakes up the Pentagon as US wages war - but at what cost?

                                  Hegseth shakes up the Pentagon as US wages war – but at what cost?

                                  LIV Golf: Players free to leave after competition files for bankruptcy protection

                                  LIV Golf: Players free to leave after competition files for bankruptcy protection

                                  UK announces sanctions on West Bank settlements prompting furious Israeli response

                                  UK announces sanctions on West Bank settlements prompting furious Israeli response

                                  Fourteen go on trial over deadliest Channel small boats disaster

                                  Fourteen go on trial over deadliest Channel small boats disaster

                                  Rubio anuncia la incorporación de Perú a Escudo de las Américas

                                  Rubio anuncia la incorporación de Perú a Escudo de las Américas

                                  British widow faces deportation from Sweden after 22 years

                                  British widow faces deportation from Sweden after 22 years

                                  German police arrest suspect over sabotage attacks on power grid

                                  German police arrest suspect over sabotage attacks on power grid

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    Meta lanza Muse, agente personal de IA, que enfatiza la seguridad y la privacidad

                                    Meta lanza Muse, agente personal de IA, que enfatiza la seguridad y la privacidad

                                    La china Huawei Technologies se enfrenta a un juicio por extorsión en Nueva York

                                    La china Huawei Technologies se enfrenta a un juicio por extorsión en Nueva York

                                    Japón protesta mientras China aplica nuevas medidas contra las exportaciones de material clave para la fabricación de chips

                                    Japón protesta mientras China aplica nuevas medidas contra las exportaciones de material clave para la fabricación de chips

                                    'Divorce-tok' llena las redes sociales a medida que los creadores encuentran audiencia (y apoyo) al compartir su angustia

                                    ‘Divorce-tok’ llena las redes sociales a medida que los creadores encuentran audiencia (y apoyo) al compartir su angustia

                                    Los vuelos hacia y desde la capital de Indonesia se reanudan después de que la erupción volcánica obligara a un cierre de dos días

                                    Los vuelos hacia y desde la capital de Indonesia se reanudan después de que la erupción volcánica obligara a un cierre de dos días

                                    El reactor sirio de la era Assad fue configurado para armas nucleares, dice el jefe de la OIEA

                                    El reactor sirio de la era Assad fue configurado para armas nucleares, dice el jefe de la OIEA

                                    Indonesia mantiene cerrados varios aeropuertos aunque la erupción volcánica está remitiendo

                                    Indonesia mantiene cerrados varios aeropuertos aunque la erupción volcánica está remitiendo

                                    Qué transmitir: 'The Paper', Bloc Party, '¡Llame a mi agente!' y un juego de 'Halloween'

                                    Qué transmitir: ‘The Paper’, Bloc Party, ‘¡Llame a mi agente!’ y un juego de ‘Halloween’

                                    El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                                    El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      Explicación del escalado de tren a prueba: cómo optimizar su presupuesto de computación de IA de extremo a extremo para la inferencia

                                      by — Redacción Despertar Matinal
                                      17 de abril de 2026
                                      in Tecnología
                                      0
                                      Explicación del escalado de tren a prueba: cómo optimizar su presupuesto de computación de IA de extremo a extremo para la inferencia
                                      0
                                      SHARES
                                      11
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Las pautas estándar para crear modelos de lenguaje grandes (LLM) optimizan solo los costos de capacitación e ignoran los costos de inferencia. Esto plantea un desafío para las aplicaciones del mundo real que utilizan técnicas de escalamiento de tiempo de inferencia para aumentar la precisión de las respuestas del modelo, como extraer múltiples muestras de razonamiento de un modelo en el momento de la implementación.

                                      Para cerrar esta brecha, investigadores de la Universidad de Wisconsin-Madison y la Universidad de Stanford han introducido Tren para probar (t2) leyes de escala, un marco que optimiza conjuntamente el tamaño de los parámetros de un modelo, su volumen de datos de entrenamiento y el número de muestras de inferencia en el momento de la prueba.

                                      En la práctica, su enfoque demuestra que es óptimo desde el punto de vista informático entrenar modelos sustancialmente más pequeños con muchos más datos de los que prescriben las reglas tradicionales, y luego utilizar la sobrecarga computacional ahorrada para generar múltiples muestras repetidas en la inferencia.

                                      Para los desarrolladores de aplicaciones empresariales de IA que están entrenando sus propios modelos, esta investigación proporciona un plan probado para maximizar el retorno de la inversión. Muestra que el razonamiento de la IA no requiere necesariamente gastar grandes cantidades en modelos de frontera. En cambio, los modelos más pequeños pueden generar un rendimiento más sólido en tareas complejas y, al mismo tiempo, mantener los costos de inferencia por consulta manejables dentro de los presupuestos de implementación del mundo real.

                                      Leyes de escala conflictivas

                                      Las leyes de escala son una parte importante del desarrollo de modelos de lenguaje grandes. Las leyes de escalamiento previo al entrenamiento dictan la mejor manera de asignar computación durante la creación del modelo, mientras que leyes de escalamiento en el tiempo de prueba guiar cómo asignar computación durante la implementación, como dejar que el modelo «piense más» o generar múltiples muestras de razonamiento para resolver problemas complejos.

                                      El problema es que estas leyes de escala se han desarrollado de forma completamente independiente unas de otras a pesar de estar fundamentalmente entrelazadas.

                                      El tamaño de los parámetros de un modelo y la duración del entrenamiento dictan directamente tanto la calidad como el costo por consulta de sus muestras de inferencia. Actualmente, el estándar de oro de la industria para la capacitación previa es el regla de chinchillalo que sugiere una proporción óptima de cálculo de aproximadamente 20 tokens de entrenamiento para cada parámetro del modelo.

                                      Sin embargo, los creadores de familias de modelos de IA modernas, como Llama, Gemma y Qwen, infringen regularmente esta regla al sobreentrenar intencionalmente sus modelos más pequeños con cantidades masivas de datos.

                                      Como dijo a VentureBeat Nicholas Roberts, coautor del artículo, el enfoque tradicional falla cuando se construyen flujos de trabajo agentes complejos: «En mi opinión, la pila de inferencia se descompone cuando cada llamada de inferencia individual es costosa. Este es el caso cuando los modelos son grandes y es necesario realizar muchos muestreos repetidos». En lugar de depender de modelos masivos, los desarrolladores pueden utilizar modelos compactos sobreentrenados para ejecutar este muestreo repetido a una fracción del costo.

                                      Pero debido a que las leyes de escalamiento de tiempo de prueba y entrenamiento se examinan de forma aislada, no existe un marco riguroso para calcular cuánto se debe sobreentrenar un modelo en función de cuántas muestras de razonamiento necesitará generar durante la implementación.

                                      En consecuencia, anteriormente no existía ninguna fórmula que optimizara conjuntamente el tamaño del modelo, el volumen de datos de entrenamiento y los presupuestos de inferencia en el momento de la prueba.

                                      La razón por la que este marco es difícil de formular es que el preentrenamiento y el escalamiento en el momento de la prueba hablan dos lenguajes matemáticos diferentes. Durante el entrenamiento previo, el rendimiento de un modelo se mide mediante «pérdida», una métrica continua y fluida que rastrea los errores de predicción a medida que el modelo aprende.

                                      En el momento de la prueba, los desarrolladores utilizan métricas posteriores del mundo real para evaluar las capacidades de razonamiento de un modelo, como pass@k, que mide la probabilidad de que un modelo produzca al menos una respuesta correcta en k intentos repetidos e independientes.

                                      Leyes de escalamiento de tren a prueba

                                      Para resolver la desconexión entre el entrenamiento y la implementación, los investigadores introducen Train-to-Test (T2) leyes de escala. En un nivel alto, este marco predice el rendimiento de razonamiento de un modelo al tratar tres variables como una sola ecuación: el tamaño del modelo (N), el volumen de tokens de entrenamiento de los que aprende (D) y el número de muestras de razonamiento que genera durante la inferencia (k).

                                      «Train-to-test» combina las leyes de escalamiento previo al entrenamiento y al momento de la prueba en un marco unificado (fuente: arXiv)

                                      t2 combina presupuestos de preentrenamiento e inferencia en una fórmula de optimización que representa tanto el costo base para entrenar el modelo (6ND) como el costo compuesto para consultarlo repetidamente en la inferencia (2Nk). Los investigadores probaron diferentes enfoques de modelado: si modelar la pérdida previa al entrenamiento o el rendimiento en el momento de la prueba (pass@k) como funciones de N, D y k.

                                      El primer enfoque toma la conocida ecuación matemática utilizada para el escalamiento de Chinchilla (que calcula el error o pérdida de predicción de un modelo) y la modifica directamente agregando una nueva variable que representa el número de muestras repetidas en el momento de la prueba (k). Esto permite a los desarrolladores ver cómo el aumento del cálculo de inferencia reduce la tasa de error general del modelo.

                                      El segundo enfoque modela directamente la precisión pass@k aguas abajo. Indica a los desarrolladores la probabilidad de que su aplicación resuelva un problema dado un presupuesto informático específico.

                                      Pero, ¿deberían las empresas utilizar este marco para todas las aplicaciones? Roberts aclara que este enfoque es altamente especializado. «Me imagino que no se vería tanto beneficio en aplicaciones con mucho conocimiento, como los modelos de chat», dijo. En cambio, «T2 está diseñado para aplicaciones con mucho razonamiento, como la codificación, donde normalmente se utilizaría muestreo repetido como método de escalamiento en el tiempo de prueba».

                                      Qué significa para los desarrolladores

                                      Para validar la T2 leyes de escala, los investigadores construyeron un extenso banco de pruebas de más de 100 modelos de lenguaje, que van desde 5 millones hasta 901 millones de parámetros. Entrenaron desde cero 21 puntos de control nuevos, muy sobreentrenados, para probar si sus pronósticos matemáticos se cumplían en la realidad. Luego compararon los modelos en ocho tareas diversas, que incluían conjuntos de datos del mundo real como SciQ y OpenBookQA, junto con tareas sintéticas diseñadas para probar la aritmética, el razonamiento espacial y la recuperación de conocimientos.

                                      Ambos modelos matemáticos demostraron que la frontera de cálculo óptimo se aleja drásticamente de la escala estándar de Chinchilla. Para maximizar el rendimiento con un presupuesto fijo, la opción óptima es un modelo que sea significativamente más pequeño y esté entrenado con muchos más datos de los que dicta la regla tradicional de 20 tokens por parámetro.

                                      rendimiento del tren a la prueba

                                      Las leyes de escalamiento del tren a la prueba muestran que los modelos pequeños sobreentrenados superan a los modelos optimizados para Chinchilla en tareas de razonamiento (fuente: arXiv)

                                      En sus experimentos, los modelos pequeños altamente sobreentrenados superaron consistentemente a los modelos más grandes, óptimos de Chinchilla, en las ocho tareas de evaluación cuando se tuvieron en cuenta los costos de muestreo en el momento de la prueba.

                                      Para los desarrolladores que quieran implementar estos hallazgos, la barrera técnica es sorprendentemente baja.

                                      «No se requiere nada sofisticado para realizar una escala de tiempo de prueba con nuestros modelos actuales», dijo Roberts. «En el momento de la implementación, los desarrolladores pueden integrar absolutamente la infraestructura que hace que el proceso de muestreo sea más eficiente (por ejemplo, almacenamiento en caché de KV si se utiliza un transformador)».

                                      almacenamiento en caché de KV ayuda al almacenar el contexto procesado previamente para que el modelo no tenga que volver a leer el mensaje inicial desde cero para cada nueva muestra de razonamiento.

                                      Sin embargo, el sobreentrenamiento extremo conlleva compensaciones prácticas. Si bien los modelos sobreentrenados pueden ser notoriamente tercos y más difíciles de ajustar, Roberts señala que cuando aplicaron un ajuste supervisado, «si bien este efecto estuvo presente, no fue lo suficientemente fuerte como para hacer que el modelo óptimo regresara a Chinchilla». La estrategia de cálculo óptimo sigue estando definitivamente sesgada hacia modelos compactos.

                                      Sin embargo, los equipos que llevan esto al límite absoluto deben tener cuidado de no alcanzar los límites de datos físicos. «Otro ángulo es que si llevas nuestras recomendaciones de sobreentrenamiento al extremo, es posible que te quedes sin datos de entrenamiento», dijo Roberts, refiriéndose al inminente «muro de datos» donde se agotan los datos de Internet de alta calidad.

                                      Estos experimentos confirman que si una aplicación se basa en generar múltiples muestras de razonamiento en el momento de la prueba, sobreentrenar agresivamente un modelo compacto es práctica y matemáticamente la forma más efectiva de gastar un presupuesto de computación de un extremo a otro.

                                      Para ayudar a los desarrolladores a comenzar, el equipo de investigación planea abrir pronto sus puntos de control y código, lo que permitirá a las empresas conectar sus propios datos y probar el comportamiento de escalamiento de inmediato. En última instancia, este marco sirve como fuerza igualadora en la industria de la IA.

                                      Esto es especialmente crucial ya que el alto precio de los modelos de frontera puede convertirse en una barrera a medida que se escalan aplicaciones agentes que dependen de modelos de razonamiento.

                                      «t2 cambia fundamentalmente quién construye modelos de razonamiento sólidos», concluye Roberts. «Es posible que no se necesiten presupuestos informáticos masivos para obtener un razonamiento de última generación. En lugar de ello, necesita buenos datos y una asignación inteligente de su presupuesto de formación e inferencia».

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      — Redacción Despertar Matinal

                                      — Redacción Despertar Matinal

                                      Programa radial que te conecta con la información desde temprano en la mañana.

                                      Next Post
                                      La tarifa de tren de 13 dólares aumenta a 150 dólares para los aficionados del Mundial que asistan a los partidos en Nueva Jersey

                                      La tarifa de tren de 13 dólares aumenta a 150 dólares para los aficionados del Mundial que asistan a los partidos en Nueva Jersey

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • Revelan los resultados de la tomografía de Mirtha Legrand tras su internación

                                        Revelan los resultados de la tomografía de Mirtha Legrand tras su internación

                                        0 shares
                                        Share 0 Tweet 0
                                      • AI cancer cures slowed by chip shortage, says UK’s biggest tech boss

                                        0 shares
                                        Share 0 Tweet 0
                                      • El jugador de baloncesto más alto del mundo, Olivier Rioux, de 7 pies 9 pulgadas, firma con UC Irvine

                                        0 shares
                                        Share 0 Tweet 0
                                      • Proteger a un menor termina protegiendo el delito

                                        0 shares
                                        Share 0 Tweet 0
                                      • Balón de Oro 2026: todos los nominados, la fecha de entrega y los premios

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por