• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
domingo, agosto 16, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

    Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

    Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

    Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

    Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

    Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

    Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

    Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

    Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

    Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

    Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

    Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

    ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

    ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

    Diputado Wendy Batista: “Código Penal lo satanizaron; Cree en acumulación de penas, en algunos casos

    Diputado Wendy Batista: “Código Penal lo satanizaron; Cree en acumulación de penas, en algunos casos

    “El PLD es el único partido que ha crecido y va a ganar en 2028”, afirma Johnny Pujols

    Johnny Pujols afirma PLD está preparada para disputar el poder al oficialismo en 2028

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      Evangelina Anderson recordó el momento en que les contó a sus hijos sobre su separación: “No estaba preparada”

      Evangelina Anderson recordó el momento en que les contó a sus hijos sobre su separación: “No estaba preparada”

      Abelardo le ordenó por Twitter a una ministra echar a todos los izquierdistas de su ministerio

      Abelardo le ordenó por Twitter a una ministra echar a todos los izquierdistas de su ministerio

      La Guardia Civil confirmó 15 violaciones en Ceuta tras la invasión de inmigrantes ilegales marroquíes

      La Guardia Civil confirmó 15 violaciones en Ceuta tras la invasión de inmigrantes ilegales marroquíes

      El secretario de Asuntos Nucleares de Milei dejó en ridículo al kirchnerista Jorge Taiana

      El secretario de Asuntos Nucleares de Milei dejó en ridículo al kirchnerista Jorge Taiana

      La mentira noble nunca salva a quienes pretende proteger

      La mentira noble nunca salva a quienes pretende proteger

      Claude lanzará una marca de agua invisible para detectar textos generados con IA

      Claude lanzará una marca de agua invisible para detectar textos generados con IA

      Lula postergó la llegada del embajador de EEUU en Brasil hasta después de las elecciones

      Lula postergó la llegada del embajador de EEUU en Brasil hasta después de las elecciones

      Los Increíbles 3: cuándo se estrena y todos los detalles de la película más esperada de Pixar

      Los Increíbles 3: cuándo se estrena y todos los detalles de la película más esperada de Pixar

      El gobierno comunista de Pedro Sánchez refuerza la presencia militar en Ceuta ante amenazas de una nueva invasión

      El gobierno comunista de Pedro Sánchez refuerza la presencia militar en Ceuta ante amenazas de una nueva invasión

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

        Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

        Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

        Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

        Entérese quienes se unen para impulsar el desarrollo...

        Entérese quienes se unen para impulsar el desarrollo…

        Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

        Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

        Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

        Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

        Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

        Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

        Intrant: nuevo sistema de licencias revierte pérdidas y genera...

        Intrant: nuevo sistema de licencias revierte pérdidas y genera…

        Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

        Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

        ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

        ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Estados Unidos no descarta operación militar contra Cuba

          Estados Unidos no descarta operación militar contra Cuba

          Tribunal Constitucional ratifica que País Posible es la 7ma fuerza...

          Tribunal Constitucional ratifica que País Posible es la 7ma fuerza…

          Sismo en Colombia suma 181 fallecidos

          Sismo en Colombia suma 181 fallecidos

          PLD dice Montecristi esta en el abandono; PRM promete obras

          PLD dice Montecristi esta en el abandono; PRM promete obras

          TSE rechaza suspender fondos públicos asignados a partidos en 2026

          TSE rechaza suspender fondos públicos asignados a partidos en 2026

          JCE impulsa debate regional sobre IA y transparencia electoral

          JCE impulsa debate regional sobre IA y transparencia electoral

          Reforma a Seguridad Social quedó fuera de agenda pese a promesa de Abinader – El Nuevo Diario (República Dominicana)

          Reforma a la seguridad social sigue sin llegar al Congreso

          ¡La dejaron pasar! Concluye otra legislatura sin aprobarse una reforma integral para erradicar los feminicidios en RD

          Congreso dominicano deja vencer, otra vez, la reforma urgente contra los feminicidios

          Fuerza del Pueblo participa en Gran Desfile Dominicano del Bronx; llevó amplio contingente de simpatizantes

          Fuerza del Pueblo impresiona con masiva participación en el Desfile Dominicano del Bronx

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                Storm Lala: Hawaii braces for potential first direct hit by a hurricane in 34 years

                Storm Lala: Hawaii braces for potential first direct hit by a hurricane in 34 years

                Rescuers search for survivors of powerful Indonesia earthquake

                Rescuers search for survivors of powerful Indonesia earthquake

                Australian state to begin gun buyback after Bondi Beach attack

                Australian state to begin gun buyback after Bondi Beach attack

                Qatar denies capturing three Iranian pilots after downing fighter jets

                Qatar denies capturing three Iranian pilots after downing fighter jets

                Liechtenstein to allow women to ascend the throne

                Liechtenstein to allow women to ascend the throne

                Morocco detains dozens of migrants trying to cross into Ceuta

                Morocco detains dozens of migrants trying to cross into Ceuta

                Belgian firefighters battle blaze tearing through nature reserve

                Belgian firefighters battle blaze tearing through nature reserve

                Five injured in shooting at Virginia State University

                Five injured in shooting at Virginia State University

                Secondhand book sales are booming. Is it because of AI?

                Secondhand book sales are booming. Is it because of AI?

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  Berkshire Hathaway aumentó su participación en Alphabet y constructoras de viviendas en el segundo trimestre

                  Berkshire Hathaway aumentó su participación en Alphabet y constructoras de viviendas en el segundo trimestre

                  Un equipo de evaluación encontró lo que la revisión cualitativa no pudo: los modelos de IA tienen más confianza cuando están equivocados

                  Un equipo de evaluación encontró lo que la revisión cualitativa no pudo: los modelos de IA tienen más confianza cuando están equivocados

                  El tribunal fiscal de Maryland anula el impuesto a la publicidad digital y ordena reembolsos a Apple, Google y Peacock TV

                  El tribunal fiscal de Maryland anula el impuesto a la publicidad digital y ordena reembolsos a Apple, Google y Peacock TV

                  GLM-5.3 está aquí con capacidades cibernéticas avanzadas y, según se informa, ya encontró una 'vulnerabilidad grave' en Cursor

                  GLM-5.3 está aquí con capacidades cibernéticas avanzadas y, según se informa, ya encontró una ‘vulnerabilidad grave’ en Cursor

                  El foro en línea Reddit se unirá al influyente y seguido de cerca índice S&P 500

                  El foro en línea Reddit se unirá al influyente y seguido de cerca índice S&P 500

                  30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                  ¿Un título de ‘influencer’? Universidades apuestan por especialización en creación de contenidos; Los críticos cuestionan el valor.

                  El terremoto de Colombia es un déjà vu para los venezolanos. La respuesta del gobierno es todo menos

                  El terremoto de Colombia es un déjà vu para los venezolanos. La respuesta del gobierno es todo menos

                  Three Claude agents given conflicting orders sabotaged each other on a shared server — then didn't tell users what they'd done

                  Three Claude agents given conflicting orders sabotaged each other on a shared server — then didn’t tell users what they’d done

                  Google’s Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut

                  Google’s Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Los fanáticos de Bonnie Tyler se alinean en las calles de un pueblo galés mientras traen su ataúd a casa.

                    Los fanáticos de Bonnie Tyler se alinean en las calles de un pueblo galés mientras traen su ataúd a casa.

                    Liechtenstein cambia sus reglas para permitir que las mujeres hereden el trono del principado alpino

                    Liechtenstein cambia sus reglas para permitir que las mujeres hereden el trono del principado alpino

                    Muere Mark Rydell, el director nominado al Oscar por 'En el estanque dorado', a los 97 años

                    Muere Mark Rydell, el director nominado al Oscar por ‘En el estanque dorado’, a los 97 años

                    Ellen Greene vuelve a visitar a Audrey de 'La pequeña tienda de los horrores' para el 40 aniversario de la película

                    Ellen Greene vuelve a visitar a Audrey de ‘La pequeña tienda de los horrores’ para el 40 aniversario de la película

                    La Sra. Lauryn Hill y el compañero de banda de Fugees, Wyclef Jean, encabezarán el Global Citizen Festival

                    La Sra. Lauryn Hill y el compañero de banda de Fugees, Wyclef Jean, encabezarán el Global Citizen Festival

                    Marc Anthony, Chayanne y más darán un concierto benéfico para ayudar en el terremoto de Venezuela y Colombia

                    Marc Anthony, Chayanne y más darán un concierto benéfico para ayudar en el terremoto de Venezuela y Colombia

                    Reseña musical: 'Comes in Waves' de Carly Simon es un viaje a través del amor y la pérdida

                    Reseña musical: ‘Comes in Waves’ de Carly Simon es un viaje a través del amor y la pérdida

                    Reseña de la película: 'El fin de Oak Street' es un buen momento gonzo

                    Reseña de la película: ‘El fin de Oak Street’ es un buen momento gonzo

                    Sir Anthony Hopkins sobre su álbum debut: 'Mi primer amor es la música'

                    Sir Anthony Hopkins sobre su álbum debut: ‘Mi primer amor es la música’

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

                      Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

                      Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

                      Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

                      Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

                      Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

                      Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

                      Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

                      Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

                      Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

                      Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

                      Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

                      ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

                      ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

                      Diputado Wendy Batista: “Código Penal lo satanizaron; Cree en acumulación de penas, en algunos casos

                      Diputado Wendy Batista: “Código Penal lo satanizaron; Cree en acumulación de penas, en algunos casos

                      “El PLD es el único partido que ha crecido y va a ganar en 2028”, afirma Johnny Pujols

                      Johnny Pujols afirma PLD está preparada para disputar el poder al oficialismo en 2028

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        Evangelina Anderson recordó el momento en que les contó a sus hijos sobre su separación: “No estaba preparada”

                        Evangelina Anderson recordó el momento en que les contó a sus hijos sobre su separación: “No estaba preparada”

                        Abelardo le ordenó por Twitter a una ministra echar a todos los izquierdistas de su ministerio

                        Abelardo le ordenó por Twitter a una ministra echar a todos los izquierdistas de su ministerio

                        La Guardia Civil confirmó 15 violaciones en Ceuta tras la invasión de inmigrantes ilegales marroquíes

                        La Guardia Civil confirmó 15 violaciones en Ceuta tras la invasión de inmigrantes ilegales marroquíes

                        El secretario de Asuntos Nucleares de Milei dejó en ridículo al kirchnerista Jorge Taiana

                        El secretario de Asuntos Nucleares de Milei dejó en ridículo al kirchnerista Jorge Taiana

                        La mentira noble nunca salva a quienes pretende proteger

                        La mentira noble nunca salva a quienes pretende proteger

                        Claude lanzará una marca de agua invisible para detectar textos generados con IA

                        Claude lanzará una marca de agua invisible para detectar textos generados con IA

                        Lula postergó la llegada del embajador de EEUU en Brasil hasta después de las elecciones

                        Lula postergó la llegada del embajador de EEUU en Brasil hasta después de las elecciones

                        Los Increíbles 3: cuándo se estrena y todos los detalles de la película más esperada de Pixar

                        Los Increíbles 3: cuándo se estrena y todos los detalles de la película más esperada de Pixar

                        El gobierno comunista de Pedro Sánchez refuerza la presencia militar en Ceuta ante amenazas de una nueva invasión

                        El gobierno comunista de Pedro Sánchez refuerza la presencia militar en Ceuta ante amenazas de una nueva invasión

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

                          Presidente Abinader pide agricultores tecnificarse para eliminar mano de obra extranjera

                          Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

                          Presidente Luis Abinader entrega polideportivo techado en el Centro Educativo Santo Cura de Ars

                          Entérese quienes se unen para impulsar el desarrollo...

                          Entérese quienes se unen para impulsar el desarrollo…

                          Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

                          Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

                          Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

                          Academia de Ciencias y UASD alertan sobre posible privatización de áreas protegidas

                          Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

                          Gobierno entrega RD$85 millones a 400 microempresarios de San Juan

                          Intrant: nuevo sistema de licencias revierte pérdidas y genera...

                          Intrant: nuevo sistema de licencias revierte pérdidas y genera…

                          Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

                          Derechos Humanos y Comisión de la Verdad reiteran reclamo de justicia por explosión de San Cristóbal

                          ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

                          ADOCALZA respalda mecanismos de INABIE y defiende capacidad de fabricantes nacionales

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Estados Unidos no descarta operación militar contra Cuba

                            Estados Unidos no descarta operación militar contra Cuba

                            Tribunal Constitucional ratifica que País Posible es la 7ma fuerza...

                            Tribunal Constitucional ratifica que País Posible es la 7ma fuerza…

                            Sismo en Colombia suma 181 fallecidos

                            Sismo en Colombia suma 181 fallecidos

                            PLD dice Montecristi esta en el abandono; PRM promete obras

                            PLD dice Montecristi esta en el abandono; PRM promete obras

                            TSE rechaza suspender fondos públicos asignados a partidos en 2026

                            TSE rechaza suspender fondos públicos asignados a partidos en 2026

                            JCE impulsa debate regional sobre IA y transparencia electoral

                            JCE impulsa debate regional sobre IA y transparencia electoral

                            Reforma a Seguridad Social quedó fuera de agenda pese a promesa de Abinader – El Nuevo Diario (República Dominicana)

                            Reforma a la seguridad social sigue sin llegar al Congreso

                            ¡La dejaron pasar! Concluye otra legislatura sin aprobarse una reforma integral para erradicar los feminicidios en RD

                            Congreso dominicano deja vencer, otra vez, la reforma urgente contra los feminicidios

                            Fuerza del Pueblo participa en Gran Desfile Dominicano del Bronx; llevó amplio contingente de simpatizantes

                            Fuerza del Pueblo impresiona con masiva participación en el Desfile Dominicano del Bronx

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  Storm Lala: Hawaii braces for potential first direct hit by a hurricane in 34 years

                                  Storm Lala: Hawaii braces for potential first direct hit by a hurricane in 34 years

                                  Rescuers search for survivors of powerful Indonesia earthquake

                                  Rescuers search for survivors of powerful Indonesia earthquake

                                  Australian state to begin gun buyback after Bondi Beach attack

                                  Australian state to begin gun buyback after Bondi Beach attack

                                  Qatar denies capturing three Iranian pilots after downing fighter jets

                                  Qatar denies capturing three Iranian pilots after downing fighter jets

                                  Liechtenstein to allow women to ascend the throne

                                  Liechtenstein to allow women to ascend the throne

                                  Morocco detains dozens of migrants trying to cross into Ceuta

                                  Morocco detains dozens of migrants trying to cross into Ceuta

                                  Belgian firefighters battle blaze tearing through nature reserve

                                  Belgian firefighters battle blaze tearing through nature reserve

                                  Five injured in shooting at Virginia State University

                                  Five injured in shooting at Virginia State University

                                  Secondhand book sales are booming. Is it because of AI?

                                  Secondhand book sales are booming. Is it because of AI?

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    Berkshire Hathaway aumentó su participación en Alphabet y constructoras de viviendas en el segundo trimestre

                                    Berkshire Hathaway aumentó su participación en Alphabet y constructoras de viviendas en el segundo trimestre

                                    Un equipo de evaluación encontró lo que la revisión cualitativa no pudo: los modelos de IA tienen más confianza cuando están equivocados

                                    Un equipo de evaluación encontró lo que la revisión cualitativa no pudo: los modelos de IA tienen más confianza cuando están equivocados

                                    El tribunal fiscal de Maryland anula el impuesto a la publicidad digital y ordena reembolsos a Apple, Google y Peacock TV

                                    El tribunal fiscal de Maryland anula el impuesto a la publicidad digital y ordena reembolsos a Apple, Google y Peacock TV

                                    GLM-5.3 está aquí con capacidades cibernéticas avanzadas y, según se informa, ya encontró una 'vulnerabilidad grave' en Cursor

                                    GLM-5.3 está aquí con capacidades cibernéticas avanzadas y, según se informa, ya encontró una ‘vulnerabilidad grave’ en Cursor

                                    El foro en línea Reddit se unirá al influyente y seguido de cerca índice S&P 500

                                    El foro en línea Reddit se unirá al influyente y seguido de cerca índice S&P 500

                                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                    ¿Un título de ‘influencer’? Universidades apuestan por especialización en creación de contenidos; Los críticos cuestionan el valor.

                                    El terremoto de Colombia es un déjà vu para los venezolanos. La respuesta del gobierno es todo menos

                                    El terremoto de Colombia es un déjà vu para los venezolanos. La respuesta del gobierno es todo menos

                                    Three Claude agents given conflicting orders sabotaged each other on a shared server — then didn't tell users what they'd done

                                    Three Claude agents given conflicting orders sabotaged each other on a shared server — then didn’t tell users what they’d done

                                    Google’s Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut

                                    Google’s Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Los fanáticos de Bonnie Tyler se alinean en las calles de un pueblo galés mientras traen su ataúd a casa.

                                      Los fanáticos de Bonnie Tyler se alinean en las calles de un pueblo galés mientras traen su ataúd a casa.

                                      Liechtenstein cambia sus reglas para permitir que las mujeres hereden el trono del principado alpino

                                      Liechtenstein cambia sus reglas para permitir que las mujeres hereden el trono del principado alpino

                                      Muere Mark Rydell, el director nominado al Oscar por 'En el estanque dorado', a los 97 años

                                      Muere Mark Rydell, el director nominado al Oscar por ‘En el estanque dorado’, a los 97 años

                                      Ellen Greene vuelve a visitar a Audrey de 'La pequeña tienda de los horrores' para el 40 aniversario de la película

                                      Ellen Greene vuelve a visitar a Audrey de ‘La pequeña tienda de los horrores’ para el 40 aniversario de la película

                                      La Sra. Lauryn Hill y el compañero de banda de Fugees, Wyclef Jean, encabezarán el Global Citizen Festival

                                      La Sra. Lauryn Hill y el compañero de banda de Fugees, Wyclef Jean, encabezarán el Global Citizen Festival

                                      Marc Anthony, Chayanne y más darán un concierto benéfico para ayudar en el terremoto de Venezuela y Colombia

                                      Marc Anthony, Chayanne y más darán un concierto benéfico para ayudar en el terremoto de Venezuela y Colombia

                                      Reseña musical: 'Comes in Waves' de Carly Simon es un viaje a través del amor y la pérdida

                                      Reseña musical: ‘Comes in Waves’ de Carly Simon es un viaje a través del amor y la pérdida

                                      Reseña de la película: 'El fin de Oak Street' es un buen momento gonzo

                                      Reseña de la película: ‘El fin de Oak Street’ es un buen momento gonzo

                                      Sir Anthony Hopkins sobre su álbum debut: 'Mi primer amor es la música'

                                      Sir Anthony Hopkins sobre su álbum debut: ‘Mi primer amor es la música’

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      El arnés de IA del escritor reduce el gasto en tokens en casi un 40%, sin sacrificar la precisión

                                      by — Redacción Despertar Matinal
                                      20 de julio de 2026
                                      in Tecnología
                                      0
                                      El arnés de IA del escritor reduce el gasto en tokens en casi un 40%, sin sacrificar la precisión
                                      0
                                      SHARES
                                      4
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La IA empresarial se enfrenta a una paradoja del retorno de la inversión. Si bien aplicar más computación al modelo básico más sólido funciona bien en experimentos de productos, los costos se vuelven insoportables cuando el producto se implementa en producción.

                                      A papel nuevo de los investigadores de Writer proporciona una solución accesible para los equipos de ingeniería. El estudio analiza sistemáticamente la optimización de los diferentes componentes de la capa de orquestación que envuelve el modelo básico, también conocido como el arnés de IA.

                                      Al optimizar el aprovechamiento, los investigadores muestran reducciones dramáticas en tokens por tarea, una caída en el costo por tarea exitosa de hasta un 61% y una calidad que se mantiene estable, todo sin cambiar el modelo básico subyacente.

                                      Debido a que el arnés está totalmente bajo el control del desarrollador y no requiere ningún ajuste del modelo, los equipos de ingeniería pueden aplicar estos hallazgos para crear aplicaciones de IA altamente rentables.

                                      La crisis del ROI del tokenmaxxing

                                      El estado actual de la ingeniería de IA está plagado de «tokenmaxxing«, una tendencia de la industria en la que los desarrolladores dependen de ventanas de contexto masivas y del consumo de tokens de fuerza bruta como sustitutos de un buen diseño del sistema.

                                      En lugar de diseñar flujos de trabajo elegantes, los desarrolladores han importado un reflejo del desarrollo de software tradicional: generar, ejecutar, fallar, devolver el error y más contexto a la ventana y volver a intentarlo.

                                      «Teams tokenmaxx porque es la solución más barata en este momento y porque así es literalmente como trabajan la mayoría de los ingenieros hoy en día», dijo a VentureBeat Waseem AlShikh, CTO y cofundador de Writer. Debido a que este enfoque tiene éxito con bastante frecuencia en tareas de codificación, se ha convertido en el reflejo predeterminado para cualquier otra carga de trabajo de agencia. El peligro es que las caídas de precios por token oculten la ineficiencia subyacente.

                                      «Su factura es tokens por tarea multiplicada por precio por token, y la mayoría de los equipos sólo miran el segundo número», dijo AlShikh. «En las cargas de trabajo agentes, los tokens por tarea se agravan (cada iteración del bucle retransmite el contexto creciente) y se agrava más rápido de lo que caen los precios. El recorte de precios se convierte en un anestésico. Enmascara el hecho de que el bucle en sí está sangrando».

                                      Tokenmaxxing conduce a varios modos de falla empresarial. Los equipos dirigen tareas sencillas a modelos fronterizos premium de forma predeterminada. Utilizan el LLM como un índice de búsqueda diferido, llenando la ventana contextual con documentos sin procesar en lugar de recuperar respuestas exactas. Lo más destructivo es que construyen bucles agentes sin restricciones que se salen de control cuando el modelo encuentra un error. Debido a que los tokens de salida cuestan significativamente más que los tokens de entrada en todos los principales proveedores de modelos, la ejecución ineficiente de tareas actúa como un asesino silencioso del presupuesto.

                                      La industria ha introducido varias técnicas de eficiencia para frenar estos costos, pero en gran medida se quedan cortas porque tratan el modelo de forma aislada:

                                      • Compresión inmediata condensa el texto de entrada para ahorrar espacio, pero ignora cómo el sistema secuencia esas entradas en flujos de trabajo complejos.

                                      • razonamiento presupuestado limita los pasos computacionales que puede tomar un modelo, lo que a menudo degrada la calidad de la salida si el flujo de trabajo no se enruta de manera inteligente.

                                      • codificación concisa obliga a los modelos a generar un código mínimo para guardar tokens de salida, pero no hace nada para resolver las llamadas de herramientas ineficientes.

                                      • Decodificación especulativa utiliza un modelo borrador más pequeño para acelerar la generación de texto de un modelo más grande, optimizando la velocidad de inferencia sin abordar arquitecturas de agentes infladas.

                                      Estos esfuerzos fracasan porque optimizan el motor ignorando la transmisión. No analizan la capa de orquestación, lo que deja sin resolver las ineficiencias arquitectónicas subyacentes.

                                      Desempacando el arnés: las palancas de la eficiencia

                                      El arnés es la capa de orquestación que enruta, formatea y convierte el LLM subyacente en un sistema funcional.

                                      Las palancas principales de la optimización del aprovechamiento incluyen el almacenamiento en caché de avisos del sistema, la compactación del historial de interacciones, la gestión de herramientas, las estrategias de recuperación y la gestión de errores. Estos son los puntos de intervención más accesibles para los equipos de ingeniería que buscan mejorar el rendimiento de la IA.

                                      Crédito de la imagen: VentureBeat con Nano Banana

                                      Como señalan los investigadores de Writer en el estudio: «Si el arnés es la capa que compone las llamadas al trabajo del modelo, también es la capa que fija el precio del trabajo».

                                      Históricamente, los desarrolladores han tratado el arnés como un código adhesivo desechable diseñado simplemente para conectar una API a una interfaz de usuario. El estudio señala que el arnés debe ahora ser tratado como un objeto de primera clase: un artefacto de software primario que requiere sus propias pruebas, control de versiones y diseño riguroso.

                                      Para las empresas, esto reformula la decisión de «propiedad versus alquiler».

                                      «Las empresas pasan meses evaluando modelos y luego alquilan su orquestación, lo que significa que están optimizando la palanca más pequeña y subcontratando la más grande», dijo AlShikh. «Quien sea dueño del arnés es dueño de la economía de su unidad, y un marco abierto adaptado para demostraciones no está adaptado para su factura».

                                      Dentro de los experimentos

                                      Para aislar el impacto de la capa de orquestación, los investigadores realizaron experimentos en seis modelos básicos que abarcaban múltiples proveedores y clases de peso: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 y el propio modelo de Writer, Palmyra X6.

                                      Sus experimentos compararon un bucle de agente de producción convencional congelado con el Writer Agent Harness terminado en las mismas 22 tareas empresariales bloqueadas, que abarcan capacidades como conexión a tierra y recuperación, flujos de trabajo de varios pasos, uso de herramientas y generación de contenido. Al mantener constantes los modelos y las tareas, podrían aislar los efectos de la propia capa de orquestación.

                                      tokenmaxxing vs optimización del arnés

                                      Consumo de tokens de tokenmaxxing versus optimización de arnés (fuente: arXiv)

                                      El arnés optimizado generó una caída significativa en los costos, reduciendo el costo combinado por tarea en un 41 %, de 21 centavos a 12 centavos. Esto se logró en gran medida reduciendo drásticamente el consumo de tokens, y el número de tokens por tarea cayó un 38 %, de 14,2 mil a 8,8 mil.

                                      El arnés está diseñado para delegar tareas como la búsqueda a subagentes especializados. Un subagente recibe solo la herramienta y la consulta específica que necesita, recupera los datos exactos y devuelve un resumen limpio y limitado al agente principal, evitando que la ventana de contexto principal se llene con resultados de búsqueda sin procesar.

                                      Las tasas de éxito de las tareas se mantuvieron estables incluso cuando el uso de tokens disminuyó, pasando del 78% al 81%, una ganancia que los investigadores describen como direccional en lugar de estadísticamente significativa en el tamaño de su muestra, lo que significa que la calidad no se vio afectada incluso cuando los costos disminuyeron.

                                      La latencia de las tareas de un extremo a otro también se redujo significativamente, reduciendo el tiempo medio del reloj de pared en un 44 %, de 48 segundos a 27 segundos, debido al almacenamiento en caché rápido y a la eliminación de bucles de razonamiento sin salida.

                                      aprovechar las ganancias de optimización

                                      Beneficios de la optimización del arnés (fuente: arXiv)

                                      Sin embargo, los investigadores también encontraron límites a la orquestación de múltiples agentes. Los modelos más pequeños como Gemini Flash 3.5 y Qwen 3.6 obtuvieron puntuaciones muy por debajo de un umbral de confiabilidad utilizable en tareas de delegación de subagente (0,45 y 0,42, respectivamente); la capacidad simplemente no es confiable todavía en modelos más livianos.

                                      La orquestación de subagente solo cruzó un umbral de confiabilidad utilizable en los dos modelos más fuertes probados: el Palmyra X6 del escritor (0,86) y Claude Sonnet 4.6 (0,85).

                                      El manual del desarrollador: conclusiones prácticas y compensaciones

                                      Los hallazgos del estudio se traducen en un manual para desarrolladores empresariales que crean flujos de trabajo agentes a escala. El primer paso es implementar lo que AlShikh llama «aviso de dos zonas» y «descarga de contexto».

                                      Estructura para el almacenamiento en caché del mensaje del sistema (el mensaje de dos zonas): Las API LLM modernas ofrecen almacenamiento en caché rápido, pero los desarrolladores deben estructurar sus cargas correctamente para activarlo. Los desarrolladores deben separar la «zona estable» de la «zona volátil». Coloque elementos estáticos e inmutables (p. ej., reglas básicas, esquemas de herramientas grandes y procedimientos operativos estándar) en la parte superior del mensaje. Los elementos dinámicos, como la consulta específica del usuario o el estado reciente de la tarea conversacional, deben agregarse en la parte inferior. Este orden permite que el arnés reutilice el prefijo almacenado en caché en cientos de llamadas. «Esa separación única hace que el almacenamiento en caché rápido realmente funcione y evita que usted vuelva a pagar por las mismas instrucciones en cada uno de los treinta pasos de un agente», dijo AlShikh.

                                      aviso de dos zonas

                                      Aviso de dos zonas (fuente: arXiv)

                                      Administre el contexto con la descarga de contexto: Evite el relleno de contexto, donde cada vuelta de un bucle se agrega a un mensaje monolítico hasta que la ventana alcanza su máximo. En su lugar, mueva el historial y los artefactos intermedios fuera de la ventana a un almacenamiento recuperable y retire solo lo que necesita el paso actual. Si es posible, delega tareas a subagentes de propósito único para evitar la sobrecarga del contexto. Como señala AlShikh, «la partida más importante en el gasto de los agentes no es el razonamiento, sino el reenvío de cosas que el modelo ya ha visto».

                                      Cree bucles resilientes y redefina los KPI: Los bucles de agentes no administrados agotan rápidamente los presupuestos de API. Los equipos deben comenzar a realizar un seguimiento de los tokens de finalización por millón (CPM) para comprender los verdaderos costos de las tareas, pero el arnés en sí debe contener barreras físicas. «El principio fundamental es que nunca se le pide al modelo que controle su propio gasto», dijo AlShikh. «La valla tiene que vivir debajo del modelo, en código, en tu lado de la API». Esto requiere tres controles rigurosos:

                                      • Presupuestos de tokens estrictos por tarea: La ejecución termina cuando se gasta el presupuesto, sin excepciones.

                                      • Cercado de generación: Límites de pasos, llamadas de herramientas y profundidad de recursividad para detener agentes no convergentes.

                                      • Gobernanza del gasto fallido: Limite lo que puede gastar una ejecución después de su primera validación fallida para que una tarea fallida no se convierta en la más costosa.

                                      Evite complejidades innecesarias: La optimización de la capa de orquestación conlleva una sobrecarga de ingeniería. Si se encuentra en la etapa de creación de prototipos y exploración, esa sobrecarga no está justificada: repita rápidamente con un modelo sólido y un arnés liviano. Una vez que esté escalando a millones de solicitudes por día, los ahorros de la optimización del aprovechamiento se vuelven sustanciales.

                                      Sin embargo, los equipos deben ser conscientes del «apalancamiento». Agregar andamiaje estructural requiere que el modelo sostenga y obedezca ese contexto. Si un modelo es demasiado pequeño, gastará su capacidad limitada analizando el andamio en lugar de realizar la tarea, lo que hará que la precisión disminuya y los tokens aumenten. La regla para agregar características de orquestación complejas es estrictamente matemática: «Si una característica agrega más tokens de coordinación de los que elimina tokens de tareas para ese modelo específico, córtela», dijo AlShikh. «Nada en el arnés es gratis».

                                      El futuro del arnés empresarial

                                      La era de tokenmaxxing y de tratar las ventanas contextuales como cubos sin fondo está llegando a su fin. Lanzar más computación a sistemas mal diseñados no es una estrategia viable para las empresas que necesitan demostrar un retorno de sus inversiones en IA.

                                      A medida que los modelos básicos evolucionen para absorber la planificación, la selección de herramientas y el razonamiento de varios pasos de forma nativa en sus pesos, el papel del arnés pasará de compensar la debilidad del modelo a hacer cumplir la política empresarial.

                                      «Lo que nunca entra en el modelo es lo ‘permitido’: presupuestos, permisos, límites de datos, pistas de auditoría, interruptores deterministas», dijo AlShikh. «Dentro de cinco años, el arnés será más delgado pero más importante. Habrá menos andamios y más gobernanza. Por muy capaz que sea el modelo, alguien externo a él todavía tiene que definir lo que puede gastar, ver y tocar. Esa capa pertenece a la empresa y nunca debería alquilarse».

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      — Redacción Despertar Matinal

                                      — Redacción Despertar Matinal

                                      Programa radial que te conecta con la información desde temprano en la mañana.

                                      Next Post
                                      Magín Díaz: La economía de RD responde positivamente pese a la incertidumbre persistente

                                      Magín Díaz exhibe cifras positivas, pero el rumbo del gobierno dominicano sigue sin definirse

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • Delcy Rodríguez anunció que hoy Venezuela liberará a 131 presos políticos

                                        Delcy Rodríguez anunció que hoy Venezuela liberará a 131 presos políticos

                                        0 shares
                                        Share 0 Tweet 0
                                      • Los Filis despiden al manager Rob Thomson y nombran capitán interino a Don Mattingly

                                        0 shares
                                        Share 0 Tweet 0
                                      • Punta Cana será sede de importante cumbre mundial anticorrupción en diciembre

                                        0 shares
                                        Share 0 Tweet 0
                                      • Sir Anthony Hopkins sobre su álbum debut: ‘Mi primer amor es la música’

                                        0 shares
                                        Share 0 Tweet 0
                                      • El gobierno de Javier Milei prepara el envío de ayuda a Colombia tras el grave terremoto

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por