• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
viernes, agosto 21, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

    Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

    Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

    Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

    Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

    Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

    ProCompetencia insta a blindar compras estatales contra la colusión

    ProCompetencia insta a blindar compras estatales contra la colusión

    Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

    Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

    PRD pasa a fase de crecimiento con miras a elecciones del 2028

    PRD pasa a fase de crecimiento con miras a elecciones del 2028

    Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

    Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

    Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

    Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

    Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

    Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      Argentina acumula 27 meses consecutivos de crecimiento tendencial y marca su racha más larga desde 2011

      Argentina acumula 27 meses consecutivos de crecimiento tendencial y marca su racha más larga desde 2011

      Ya totalizan 13 denuncias por presuntos abusos en un jardín de Villa Carlos Paz

      Ya totalizan 13 denuncias por presuntos abusos en un jardín de Villa Carlos Paz

      Pedirán agravar la acusación a la pareja de Claudio Barrelier por el asesinato de Agostina Vega

      Pedirán agravar la acusación a la pareja de Claudio Barrelier por el asesinato de Agostina Vega

      Jalil firmó un acuerdo con el CFI para impulsar el turismo en Catamarca

      Jalil firmó un acuerdo con el CFI para impulsar el turismo en Catamarca

      Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

      Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

      Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

      Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

      Alemania nombró al régimen chino como el principal promotor de la represión transnacional

      Alemania nombró al régimen chino como el principal promotor de la represión transnacional

      El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

      El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

      Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

      Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

        Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

        Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

        Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

        Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

        Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

        INTEC presenta primera infraestructura nacional para centralizar...

        INTEC presenta primera infraestructura nacional para centralizar…

        Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

        Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

        ProCompetencia insta a blindar compras estatales contra la colusión

        ProCompetencia insta a blindar compras estatales contra la colusión

        Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros...

        Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros…

        Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

        Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

        PRD pasa a fase de crecimiento con miras a elecciones del 2028

        PRD pasa a fase de crecimiento con miras a elecciones del 2028

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Entérese quienes se integraron al proyecto presidencial de...

          Entérese quienes se integraron al proyecto presidencial de…

          FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

          FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

          Colombia Alcántara será moderadora del XIX congreso...

          Colombia Alcántara será moderadora del XIX congreso…

          Milton Morrison reafirma alianza con Abinader y anuncia nueva...

          Milton Morrison reafirma alianza con Abinader y anuncia nueva…

          Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

          Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

          PRM en Santo Domingo Norte resalta gestión del presidente...

          PRM en Santo Domingo Norte resalta gestión del presidente…

          ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

          ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

          Estados Unidos no descarta operación militar contra Cuba

          Estados Unidos no descarta operación militar contra Cuba

          Tribunal Constitucional ratifica que País Posible es la 7ma fuerza...

          Tribunal Constitucional ratifica que País Posible es la 7ma fuerza…

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                Ethiopia's Ashenda festival: Tigray cancels event celebrating the Virgin Mary over drone attack fears

                Ethiopia’s Ashenda festival: Tigray cancels event celebrating the Virgin Mary over drone attack fears

                Several injured after sword attack at Swedish school

                Several injured after sword attack at Swedish school

                FP asegura Gobierno pudo evitar arancel 12.5% a exportaciones

                FP asegura Gobierno pudo evitar arancel 12.5% a exportaciones

                Five missing after fire in Alpine town in Switzerland

                Five missing after fire in Alpine town in Switzerland

                Mexicans arrested as big meth lab in South Africa found on remote Limpopo farm

                Mexicans arrested as big meth lab in South Africa found on remote Limpopo farm

                Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                Bodies of two mountaineers discovered after Swiss glacier melts

                Bodies of two mountaineers discovered after Swiss glacier melts

                US debt has hit $40tn – Will that be a wake-up call?

                US debt has hit $40tn – Will that be a wake-up call?

                El Niño set to be 'strongest in living memory', says Met Office

                El Niño set to be ‘strongest in living memory’, says Met Office

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                  Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                  Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                  Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                  Slack wants to drag AI coding out of the terminal and into the group chat

                  Slack wants to drag AI coding out of the terminal and into the group chat

                  Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                  Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                  Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                  Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                  NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                  NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                  A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                  A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                  Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                  Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                  Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                  Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                    El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                    Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                    Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                    El jurado escucha a 'Keffe D' decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                    El jurado escucha a ‘Keffe D’ decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                    Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                    Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                    Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante 'Pulitzer on the Road'

                    Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante ‘Pulitzer on the Road’

                    Después de perder a un amigo y escribir 'Say So', Dan + Shay regresan con la autobiográfica 'Young'

                    Después de perder a un amigo y escribir ‘Say So’, Dan + Shay regresan con la autobiográfica ‘Young’

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    El Centro Kennedy dice a la corte que no intentará restaurar el nombre de Trump en el edificio antes del 8 de septiembre

                    Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane 'Keffe D' Davis

                    Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane ‘Keffe D’ Davis

                    El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                    El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                      Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                      Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                      Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                      Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                      Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                      ProCompetencia insta a blindar compras estatales contra la colusión

                      ProCompetencia insta a blindar compras estatales contra la colusión

                      Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                      Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                      PRD pasa a fase de crecimiento con miras a elecciones del 2028

                      PRD pasa a fase de crecimiento con miras a elecciones del 2028

                      Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

                      Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

                      Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

                      Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

                      Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

                      Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        Argentina acumula 27 meses consecutivos de crecimiento tendencial y marca su racha más larga desde 2011

                        Argentina acumula 27 meses consecutivos de crecimiento tendencial y marca su racha más larga desde 2011

                        Ya totalizan 13 denuncias por presuntos abusos en un jardín de Villa Carlos Paz

                        Ya totalizan 13 denuncias por presuntos abusos en un jardín de Villa Carlos Paz

                        Pedirán agravar la acusación a la pareja de Claudio Barrelier por el asesinato de Agostina Vega

                        Pedirán agravar la acusación a la pareja de Claudio Barrelier por el asesinato de Agostina Vega

                        Jalil firmó un acuerdo con el CFI para impulsar el turismo en Catamarca

                        Jalil firmó un acuerdo con el CFI para impulsar el turismo en Catamarca

                        Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

                        Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

                        Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

                        Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

                        Alemania nombró al régimen chino como el principal promotor de la represión transnacional

                        Alemania nombró al régimen chino como el principal promotor de la represión transnacional

                        El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

                        El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

                        Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

                        Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                          Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                          Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                          Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                          Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

                          Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

                          INTEC presenta primera infraestructura nacional para centralizar...

                          INTEC presenta primera infraestructura nacional para centralizar…

                          Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                          Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                          ProCompetencia insta a blindar compras estatales contra la colusión

                          ProCompetencia insta a blindar compras estatales contra la colusión

                          Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros...

                          Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros…

                          Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                          Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                          PRD pasa a fase de crecimiento con miras a elecciones del 2028

                          PRD pasa a fase de crecimiento con miras a elecciones del 2028

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Entérese quienes se integraron al proyecto presidencial de...

                            Entérese quienes se integraron al proyecto presidencial de…

                            FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

                            FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

                            Colombia Alcántara será moderadora del XIX congreso...

                            Colombia Alcántara será moderadora del XIX congreso…

                            Milton Morrison reafirma alianza con Abinader y anuncia nueva...

                            Milton Morrison reafirma alianza con Abinader y anuncia nueva…

                            Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

                            Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

                            PRM en Santo Domingo Norte resalta gestión del presidente...

                            PRM en Santo Domingo Norte resalta gestión del presidente…

                            ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

                            ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

                            Estados Unidos no descarta operación militar contra Cuba

                            Estados Unidos no descarta operación militar contra Cuba

                            Tribunal Constitucional ratifica que País Posible es la 7ma fuerza...

                            Tribunal Constitucional ratifica que País Posible es la 7ma fuerza…

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  Ethiopia's Ashenda festival: Tigray cancels event celebrating the Virgin Mary over drone attack fears

                                  Ethiopia’s Ashenda festival: Tigray cancels event celebrating the Virgin Mary over drone attack fears

                                  Several injured after sword attack at Swedish school

                                  Several injured after sword attack at Swedish school

                                  FP asegura Gobierno pudo evitar arancel 12.5% a exportaciones

                                  FP asegura Gobierno pudo evitar arancel 12.5% a exportaciones

                                  Five missing after fire in Alpine town in Switzerland

                                  Five missing after fire in Alpine town in Switzerland

                                  Mexicans arrested as big meth lab in South Africa found on remote Limpopo farm

                                  Mexicans arrested as big meth lab in South Africa found on remote Limpopo farm

                                  Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                                  Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                                  Bodies of two mountaineers discovered after Swiss glacier melts

                                  Bodies of two mountaineers discovered after Swiss glacier melts

                                  US debt has hit $40tn – Will that be a wake-up call?

                                  US debt has hit $40tn – Will that be a wake-up call?

                                  El Niño set to be 'strongest in living memory', says Met Office

                                  El Niño set to be ‘strongest in living memory’, says Met Office

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                                    Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                                    Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                                    Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                                    Slack wants to drag AI coding out of the terminal and into the group chat

                                    Slack wants to drag AI coding out of the terminal and into the group chat

                                    Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                                    Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                                    Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                                    Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                                    NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                                    NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                                    A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                                    A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                                    Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                                    Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                                    Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                                    Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                                      El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                                      Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                                      Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                                      El jurado escucha a 'Keffe D' decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                                      El jurado escucha a ‘Keffe D’ decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                                      Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                                      Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                                      Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante 'Pulitzer on the Road'

                                      Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante ‘Pulitzer on the Road’

                                      Después de perder a un amigo y escribir 'Say So', Dan + Shay regresan con la autobiográfica 'Young'

                                      Después de perder a un amigo y escribir ‘Say So’, Dan + Shay regresan con la autobiográfica ‘Young’

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      El Centro Kennedy dice a la corte que no intentará restaurar el nombre de Trump en el edificio antes del 8 de septiembre

                                      Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane 'Keffe D' Davis

                                      Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane ‘Keffe D’ Davis

                                      El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                                      El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                                      by — Redacción Despertar Matinal
                                      21 de agosto de 2026
                                      in Tecnología
                                      0
                                      Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA
                                      0
                                      SHARES
                                      1
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Cuando un sistema de IA agente transfiere una tarea de un modelo pequeño a uno más grande (o retrocede nuevamente), paga un impuesto elevado: el modelo receptor tiene que volver a calcular toda la conversación desde cero, lo que aumenta los costos de computación y la latencia. Este es un obstáculo importante para las empresas que crean flujos de trabajo de múltiples LLM a largo plazo.

                                      Para resolver este desafío, los investigadores de Nvidia han introducido un transferencia de caché KV entre modelos técnica que asigna directamente la caché KV precargada desde un modelo de origen al modelo de destino. Esta técnica se alinea con aplicaciones agentes del mundo real donde se acumulan grandes contextos en muchos turnos.

                                      Para aplicaciones de IA del mundo real, la transferencia de caché KV entre modelos puede reducir los costos de computación y la latencia en flujos de trabajo de larga duración y múltiples LLM, y lo hace con matemáticas lineales simples, no con un costoso modelo de aprendizaje profundo.

                                      Los experimentos muestran que, en pares de modelos compatibles, este proceso de mapeo lineal se ejecuta de 2,7 a 25 veces más rápido que volver a calcular la conversación y, al mismo tiempo, conserva hasta el 98 % de la precisión independiente del modelo objetivo.

                                      Por qué es tan caro cambiar de modelo a mitad de sesión

                                      Examinar cómo los LLM manejan la memoria ayuda a comprender por qué los flujos de trabajo multimodelo chocan con un muro de rendimiento en la producción. Cuando un LLM recibe un mensaje, primero debe ejecutar la etapa de «relleno previo», que es el paso directo inicial que calcula las claves y los valores para todos los tokens de entrada y completa la caché de valores clave (KV).

                                      Después de eso, ingresa a la fase de «decodificación», donde calcula y genera los siguientes tokens de la secuencia. Durante esta fase, el modelo lee de este caché KV para predecir nuevos tokens uno por uno, evitando la necesidad de reevaluar todo el historial de la conversación para cada nuevo token.

                                      En conversaciones de varios turnos o sesiones agentes de largo horizonte, el contexto se vuelve gradualmente más largo. Debido a que el costo computacional de la etapa de prellenado aumenta directamente tanto con el tamaño del modelo como con la longitud de entrada, el procesamiento de estas largas sesiones se vuelve cada vez más costoso e introduce una latencia significativa si se invalida la caché KV.

                                      Esta invalidación ocurre cada vez que el sistema de IA intenta intercambiar modelos a mitad de sesión, como enrutar un paso de razonamiento complejo a un modelo más grande o pasar a un modelo más pequeño para ahorrar costos. Debido a que diferentes LLM tienen diferentes arquitecturas, esperan que sus entradas de caché estén en diferentes formatos.

                                      Como resultado, cualquier cambio de modelo obliga al modelo receptor a pagar todo el costo de precarga desde cero para volver a calcular la caché KV para el contexto acumulado.

                                      Mapeo de memoria entre modelos sin comenzar de nuevo

                                      Los investigadores de Nvidia estudiaron la transferencia de caché KV entre modelos para ver cómo los desarrolladores pueden transformar el caché KV de un modelo al formato esperado de otro sin volver a ejecutar la fase de precarga.

                                      Si se resuelve, la transferencia de caché KV entre modelos tiene beneficios en ambas direcciones. La transferencia de modelos pequeños a grandes mejora la calidad del resultado. Por ejemplo, un modelo pequeño y económico maneja las partes rutinarias de un flujo de trabajo agente, pero tiene problemas con un problema de razonamiento complejo, y usted asigna la caché KV a un modelo más grande y continúa el proceso sin problemas.

                                      Por otro lado, la transferencia de modelos grandes a pequeños reduce los costos informáticos. Se podría utilizar un modelo grande y de gran capacidad para descomprimir un mensaje de sistema complejo y masivo o sintetizar un PDF denso al comienzo de una sesión. Una vez que se realiza el trabajo pesado, la caché KV de la sesión se asigna a un modelo más pequeño y económico para manejar los rápidos giros conversacionales que siguen.

                                      Ha habido esfuerzos previos para resolver el problema de la transferencia de caché KV, pero adolecen de algunas limitaciones clave. Estos incluyen la necesidad de una costosa capacitación basada en gradientes o restricciones arquitectónicas muy estrictas.

                                      Transferencia de caché KV entre modelos (fuente: arXiv)

                                      Para este estudio inicial, los autores restringieron su enfoque a las transferencias dentro de la familia, como la transición entre modelos de diferentes tamaños en las familias Qwen, Llama o Ministral. Estos modelos comparten tokenizadores, ADN de datos de entrenamiento y estilos arquitectónicos centrales, pero difieren en tamaño y profundidad. Sin embargo, este marco deja mucho espacio para experimentos futuros. Los investigadores señalan que la técnica podría eventualmente ampliarse a transferencias entre familias, recuentos de cabezas de KV no coincidentes o arquitecturas híbridas que combinen la atención estándar con otros mecanismos de memoria.

                                      El hallazgo clave del estudio de Nvidia es que la caché KV entre modelos es una estructura significativamente lineal. Esto significa que puede realizar el mapeo con simples trucos de álgebra y sin la necesidad de un entrenamiento intensivo de redes neuronales. Por ejemplo, al experimentar con la transferencia de caché KV desde un modelo Qwen3 de 14 mil millones de parámetros a una versión de 32 mil millones de parámetros, los autores descubrieron que un mapeo de regresión lineal simple de una capa de origen a una capa de destino puede recuperar el 56% de la varianza en las claves del objetivo y el 32% de la varianza en sus valores. Al combinar múltiples capas de origen, esas cifras aumentaron al 79% y 65% ​​respectivamente.

                                      imagen2

                                      La solución de transferencia de caché KV de tres capas de Nvidia (fuente: arXiv)

                                      Para traducir esta relación lineal en un sistema práctico, los investigadores diseñaron un mapeador de crestas por cabeza de forma cerrada con tres componentes clave:

                                      • Regresión de cresta por cabeza: En lugar de utilizar un aprendizaje profundo complejo para entrenar el sistema, ajustaron una regresión lineal simple utilizando un pequeño conjunto de calibración de unos cientos de secuencias de texto. Esta técnica resuelve un problema clásico de línea de mejor ajuste de forma independiente para cada cabeza de atención.

                                      • Selección de fuente entre capas: Debido a que los modelos de origen y de destino tienen diferentes números de capas, el mapeador evalúa y selecciona las capas de origen más predictivas para alimentar cada capa de destino específica. De esta manera, el sistema selecciona sólo las piezas de memoria más útiles del modelo anterior para construir la memoria del nuevo modelo.

                                      • Mapeo de contenido-espacio: Antes de traducir los datos, el mapeador elimina las codificaciones RoPE. RoPE, o incrustación de posición rotativa, es un mecanismo estándar que aplica una rotación matemática dependiente de la posición a los datos para que el modelo comprenda el orden de los tokens en una secuencia. Eliminar los valores de RoPE hace posible que el asignador generalice a secuencias de longitudes mayores que sus datos de entrenamiento.

                                      Poniendo a prueba el mapeador lineal

                                      Para probar si la técnica funciona, los investigadores evaluaron la tubería de transferencia en seis familias de modelos «KV coincidentes». KV coincidente significa que los modelos de origen y de destino comparten el mismo número de cabezas de KV y dimensiones por cabeza, lo cual es típico de modelos de diferentes tamaños dentro de la misma familia.

                                      Las familias de modelos incluyeron Qwen3, Llama 3.1 y Ministral 3, con pruebas de transferencia de caché KV en diferentes tamaños que van desde 3 mil millones a 70 mil millones de parámetros. Sus experimentos incluyeron un salto masivo de parámetros de 8,8x desde Llama 3.1 8B a 70B.

                                      Para cubrir una amplia gama de tareas, evaluaron los modelos en cinco puntos de referencia de precisión básicos (ARC-Challenge, HellaSwag, WinoGrande, MMLU y GSM8K), así como la perplejidad del modelado del lenguaje en WikiText-2 y una tarea de conversación de múltiples turnos llamada CoQA. Para ajustar el mapeador de traducción lineal, utilizaron un pequeño conjunto de datos de calibración de solo 500 secuencias de texto de 1024 tokens cada una.

                                      Los investigadores compararon el marco con la precisión máxima de referencia en la que el modelo objetivo realiza un llenado previo completo y tradicional. También compararon su sistema completo con configuraciones eliminadas, como reducir el número de capas seleccionadas o desactivar diferentes componentes. Además, compararon su método simple con una red neuronal profunda entrenada con retropropagación para ver si un aprendizaje profundo más intenso podía recuperar la precisión en pares en los que el método lineal tenía problemas.

                                      Para cuatro de los seis pares probados, el rápido mapeador de crestas lineal de forma cerrada retuvo del 73 % al 98 % de la precisión de precarga independiente del objetivo, incluido el salto masivo de Llama 3.1 8B a 70B, que retuvo el 72,8 % de la precisión del objetivo.

                                      El mapeador también funciona entre 2,7 y 25 veces más rápido que el rellenado previo. Por ejemplo, al traducir un caché KV de 32,768 tokens de un modelo Qwen3 14B a un modelo 32B, la transferencia tomó solo 278 milisegundos, en comparación con casi 7 segundos para una recarga previa estándar.

                                      El sistema también demostró una alta estabilidad en tareas que abarcan muchos pasos. Cuando se probó en conversaciones de varios turnos, la desviación o pérdida de precisión entre la línea de base del objetivo y el caché transferido permaneció increíblemente pequeña durante 10 turnos, lo que demuestra que no provocará fallas en cascada durante largas sesiones de agente.

                                      Sin embargo, el enfoque lineal sencillo tuvo limitaciones en pares de modelos específicos. Para dos de las configuraciones Ministral, el mapeador lineal se degradó drásticamente porque el ajuste lineal simple no pudo extrapolar los datos de calibración externos. Para solucionar este problema, los investigadores cambiaron el mapeador lineal por un perceptrón multicapa (MLP) no lineal con dos capas ocultas de 1.024 unidades entrenadas con los mismos datos. Esto añadió complejidad y entrenamiento a la configuración, pero recuperó su precisión por encima del 90%.

                                      Un problema industrial mayor que el que un periódico puede resolver

                                      La introducción de la transferencia entre modelos es parte de un impulso más amplio en toda la industria para resolver el cuello de botella de la caché KV, que se ha convertido en uno de los obstáculos clave para escalar la IA empresarial. A medida que los desarrolladores presionan a los LLM para que procesen documentos masivos o bases de código y ejecuten tareas de razonamiento de larga duración, la gestión de esta capa de memoria se está volviendo tan importante como los propios modelos.

                                      Durante el año pasado, los investigadores atacaron este problema de computación y memoria desde múltiples ángulos. Por ejemplo, Nvidia introdujo recientemente dispersión de la memoria dinámica (DMS), una técnica que expulsa de forma inteligente los tokens menos importantes de la caché de KV para reducir los costos de razonamiento hasta 8 veces.

                                      Otros enfoques se centran en una compresión agresiva de datos. Los investigadores del MIT desarrollaron una técnica de compactación algebraica llamada Coincidencia de atención que comprime la caché KV 50 veces sin degradar la calidad. De manera similar, Nvidia presentó Codificación de transformación de caché KV (KVTC), que toma prestados conceptos de compresión de medios para reducir la memoria 20 veces sin alterar los pesos del modelo subyacente.

                                      Más allá de la compresión, los investigadores también están atacando la sobrecarga computacional de la recuperación de memoria. Optimizadores como caché de índice elimine los cálculos de capas redundantes para ofrecer un tiempo de obtención del primer token significativamente más rápido en aplicaciones de contexto prolongado. Y modelos como DeepSeek y la serie GLM están optimizando la caché KV a través de innovaciones arquitectónicas.

                                      A medida que los sistemas de IA asumen tareas con horizontes más amplios y arquitecturas más complejas, la infraestructura de memoria subyacente se está volviendo tan importante como los propios modelos. La transferencia de caché KV entre modelos ofrece a los desarrolladores una herramienta más para mantener bajos los costos de inferencia a medida que escalan sistemas agentes multimodelo.

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      — Redacción Despertar Matinal

                                      — Redacción Despertar Matinal

                                      Programa radial que te conecta con la información desde temprano en la mañana.

                                      Next Post
                                      Argentina acumula 27 meses consecutivos de crecimiento tendencial y marca su racha más larga desde 2011

                                      Argentina acumula 27 meses consecutivos de crecimiento tendencial y marca su racha más larga desde 2011

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • Boca recibió una propuesta por Kevin Lomónaco: la postura de Arruabarrena

                                        Boca recibió una propuesta por Kevin Lomónaco: la postura de Arruabarrena

                                        0 shares
                                        Share 0 Tweet 0
                                      • Bodies of two mountaineers discovered after Swiss glacier melts

                                        0 shares
                                        Share 0 Tweet 0
                                      • Sueldos militares agosto 2026: la escala completa por jerarquía

                                        0 shares
                                        Share 0 Tweet 0
                                      • NTSB busca detalles sobre la evacuación después de que un avión impactara a una persona en Denver

                                        0 shares
                                        Share 0 Tweet 0
                                      • Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por