• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
viernes, septiembre 18, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

    Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

    Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

    Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

    Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

    Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

    Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

    Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

    Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

    Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

    Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

    Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

    Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

    Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

    Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

    Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

    Exprocurador general Jean Alain Rodríguez denuncia “manipulación” en informe de Participación Ciudadana

    Suprema Corte ratifica condena a Jean Alain Rodríguez por daños al periodista Marino Zapete

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      Diputados por Córdoba impulsan una ley para regular perros peligrosos

      Diputados por Córdoba impulsan una ley para regular perros peligrosos

      Estudiantes, semifinalista de la Libertadores: las bajas y el problema de la localía

      Estudiantes, semifinalista de la Libertadores: las bajas y el problema de la localía

      Cornejo impulsa una nueva Ley de Hidrocarburos: cambia las regalías y apuesta por Vaca Muerta

      Cornejo impulsa una nueva Ley de Hidrocarburos: cambia las regalías y apuesta por Vaca Muerta

      Eliana Guercio contó por qué dejó 'A la Barbarossa' y apuntó contra Brancatelli

      Eliana Guercio contó por qué dejó ‘A la Barbarossa’ y apuntó contra Brancatelli

      Renunció el primer ministro de Suecia tras una dura derrota frente a la centro-izquierda

      Renunció el primer ministro de Suecia tras una dura derrota frente a la centro-izquierda

      Máximo Kirchner afrontará su primer juicio oral por lavado de dinero junto a su madre

      Máximo Kirchner afrontará su primer juicio oral por lavado de dinero junto a su madre

      El video del allanamiento a Cristina Kirchner: obras de arte y una puerta blindada en su departamento

      El video del allanamiento a Cristina Kirchner: obras de arte y una puerta blindada en su departamento

      El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

      El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

      La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

      La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Indomet pronostica chubascos matutinos y aguaceros la tarde de este viernes

        Indomet pronostica chubascos matutinos y aguaceros la tarde de este viernes

        Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

        Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

        Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

        Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

        Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

        Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

        CTC promueven uso responsable de la inteligencia artificial....

        CTC promueven uso responsable de la inteligencia artificial….

        Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

        Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

        Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

        Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

        Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

        Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

        Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

        Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

          Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

          Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

          Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

          Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

          Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

          ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

          ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

          Fuerza del Pueblo cuestiona resultados del programa social...

          Fuerza del Pueblo cuestiona resultados del programa social…

          Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

          Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

          SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

          SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

          Kelvin Faña asegura Luis Abinader ha salido más inteligente...

          Kelvin Faña asegura Luis Abinader ha salido más inteligente…

          Consulta del PLD avanza con transparencia, imparcialidad...

          Consulta del PLD avanza con transparencia, imparcialidad…

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                Russian hybrid attacks against Europe intensifying, says Macron

                Russian hybrid attacks against Europe intensifying, says Macron

                Police begin operation to move migrants from Ceuta beaches

                Police begin operation to move migrants from Ceuta beaches

                Lindsay Clancy holdout juror had no doubt she deliberately killed her children

                Lindsay Clancy holdout juror had no doubt she deliberately killed her children

                Illegal mining in Niger state: 37 suspects die in Nigerian custody

                Illegal mining in Niger state: 37 suspects die in Nigerian custody

                Philippines: At least one dead and multiple injured in shooting at Banga high school

                Philippines: At least one dead and multiple injured in shooting at Banga high school

                Why US plan to sell F-35 warplanes to Saudi Arabia is controversial

                Why US plan to sell F-35 warplanes to Saudi Arabia is controversial

                Zara Larsson criticises White House for using her song in deportation video

                Zara Larsson criticises White House for using her song in deportation video

                US to allow Iran delegation to attend UN meetings in New York

                US to allow Iran delegation to attend UN meetings in New York

                UN experts say grounds to believe US committed war crimes in Iran strikes

                UN experts say grounds to believe US committed war crimes in Iran strikes

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  El controlador de tráfico aéreo del Reino Unido culpa a una falla de software de milisegundos por las cancelaciones de vuelos

                  El controlador de tráfico aéreo del Reino Unido culpa a una falla de software de milisegundos por las cancelaciones de vuelos

                  Anthropic dice que su modelo Claude está ayudando a construir la próxima versión de sí mismo

                  Anthropic dice que su modelo Claude está ayudando a construir la próxima versión de sí mismo

                  El rey y la IA: el monarca británico Carlos se reúne con líderes de inteligencia artificial mientras aumentan las preocupaciones sobre la seguridad

                  El rey y la IA: el monarca británico Carlos se reúne con líderes de inteligencia artificial mientras aumentan las preocupaciones sobre la seguridad

                  OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                  OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                  Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                  Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                  Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                  Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                  Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                  Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                  El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                  El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                  Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                  Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                    Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

                      Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

                      Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

                      Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

                      Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

                      Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

                      Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                      Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                      Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                      Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                      Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                      Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                      Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

                      Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

                      Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

                      Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

                      Exprocurador general Jean Alain Rodríguez denuncia “manipulación” en informe de Participación Ciudadana

                      Suprema Corte ratifica condena a Jean Alain Rodríguez por daños al periodista Marino Zapete

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        Diputados por Córdoba impulsan una ley para regular perros peligrosos

                        Diputados por Córdoba impulsan una ley para regular perros peligrosos

                        Estudiantes, semifinalista de la Libertadores: las bajas y el problema de la localía

                        Estudiantes, semifinalista de la Libertadores: las bajas y el problema de la localía

                        Cornejo impulsa una nueva Ley de Hidrocarburos: cambia las regalías y apuesta por Vaca Muerta

                        Cornejo impulsa una nueva Ley de Hidrocarburos: cambia las regalías y apuesta por Vaca Muerta

                        Eliana Guercio contó por qué dejó 'A la Barbarossa' y apuntó contra Brancatelli

                        Eliana Guercio contó por qué dejó ‘A la Barbarossa’ y apuntó contra Brancatelli

                        Renunció el primer ministro de Suecia tras una dura derrota frente a la centro-izquierda

                        Renunció el primer ministro de Suecia tras una dura derrota frente a la centro-izquierda

                        Máximo Kirchner afrontará su primer juicio oral por lavado de dinero junto a su madre

                        Máximo Kirchner afrontará su primer juicio oral por lavado de dinero junto a su madre

                        El video del allanamiento a Cristina Kirchner: obras de arte y una puerta blindada en su departamento

                        El video del allanamiento a Cristina Kirchner: obras de arte y una puerta blindada en su departamento

                        El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

                        El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

                        La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

                        La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Indomet pronostica chubascos matutinos y aguaceros la tarde de este viernes

                          Indomet pronostica chubascos matutinos y aguaceros la tarde de este viernes

                          Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

                          Consejo Nacional de la Magistratura informa 52 hombres y 38 mujeres se postulan para jueces de la SCJ

                          Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

                          Más de doce mil graduados de escuelas entrenamiento policiales; actualmente otros 2,396 estudiantes están realizando prácticas supervisadas y/o pasantías

                          Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

                          Consejo de Ministros aprueba Proyecto de Presupuesto General del Estado 2027 enfocado en inversión, desarrollo social y sostenibilidad fiscal

                          CTC promueven uso responsable de la inteligencia artificial....

                          CTC promueven uso responsable de la inteligencia artificial….

                          Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                          Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                          Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

                          Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

                          Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                          Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                          Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                          Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

                            Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

                            Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

                            Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

                            Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

                            Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

                            ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

                            ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

                            Fuerza del Pueblo cuestiona resultados del programa social...

                            Fuerza del Pueblo cuestiona resultados del programa social…

                            Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

                            Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

                            SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

                            SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

                            Kelvin Faña asegura Luis Abinader ha salido más inteligente...

                            Kelvin Faña asegura Luis Abinader ha salido más inteligente…

                            Consulta del PLD avanza con transparencia, imparcialidad...

                            Consulta del PLD avanza con transparencia, imparcialidad…

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  Russian hybrid attacks against Europe intensifying, says Macron

                                  Russian hybrid attacks against Europe intensifying, says Macron

                                  Police begin operation to move migrants from Ceuta beaches

                                  Police begin operation to move migrants from Ceuta beaches

                                  Lindsay Clancy holdout juror had no doubt she deliberately killed her children

                                  Lindsay Clancy holdout juror had no doubt she deliberately killed her children

                                  Illegal mining in Niger state: 37 suspects die in Nigerian custody

                                  Illegal mining in Niger state: 37 suspects die in Nigerian custody

                                  Philippines: At least one dead and multiple injured in shooting at Banga high school

                                  Philippines: At least one dead and multiple injured in shooting at Banga high school

                                  Why US plan to sell F-35 warplanes to Saudi Arabia is controversial

                                  Why US plan to sell F-35 warplanes to Saudi Arabia is controversial

                                  Zara Larsson criticises White House for using her song in deportation video

                                  Zara Larsson criticises White House for using her song in deportation video

                                  US to allow Iran delegation to attend UN meetings in New York

                                  US to allow Iran delegation to attend UN meetings in New York

                                  UN experts say grounds to believe US committed war crimes in Iran strikes

                                  UN experts say grounds to believe US committed war crimes in Iran strikes

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    El controlador de tráfico aéreo del Reino Unido culpa a una falla de software de milisegundos por las cancelaciones de vuelos

                                    El controlador de tráfico aéreo del Reino Unido culpa a una falla de software de milisegundos por las cancelaciones de vuelos

                                    Anthropic dice que su modelo Claude está ayudando a construir la próxima versión de sí mismo

                                    Anthropic dice que su modelo Claude está ayudando a construir la próxima versión de sí mismo

                                    El rey y la IA: el monarca británico Carlos se reúne con líderes de inteligencia artificial mientras aumentan las preocupaciones sobre la seguridad

                                    El rey y la IA: el monarca británico Carlos se reúne con líderes de inteligencia artificial mientras aumentan las preocupaciones sobre la seguridad

                                    OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                                    OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                                    Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                                    Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                                    Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                                    Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                                    Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                                    Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                                    El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                                    El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                                    Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                                    Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      TabFM de Google se salta el entrenamiento por conjunto de datos y aún predice en tablas que nunca se ha visto

                                      by — Redacción Despertar Matinal
                                      10 de julio de 2026
                                      in Tecnología
                                      0
                                      TabFM de Google se salta el entrenamiento por conjunto de datos y aún predice en tablas que nunca se ha visto
                                      0
                                      SHARES
                                      14
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      La gran mayoría de los datos empresariales son tabulares (viven en almacenes de datos, CRM y libros de contabilidad financieros), pero construir un modelo confiable a partir de ellos aún significa entrenar uno nuevo desde cero para cada conjunto de datos, luego mantener ciclos de ajuste de hiperparámetros, ingeniería de funciones y reentrenar los canales para combatir la deriva de datos. Google Research propone una forma de evitarlo: un nuevo modelo básico llamado TabFM que trata la predicción tabular como un problema de aprendizaje en contexto.

                                      Puede generar predicciones para una tabla nueva e invisible en un solo paso hacia adelante. Para los desarrolladores empresariales y los ingenieros de IA, esto reduce el tiempo de producción de semanas de ingeniería de canalización a una única llamada API.

                                      El desafío del ML tradicional

                                      Para extraer predicciones confiables de un árbol impulsado por gradiente, los científicos de datos deben construir y mantener canales de datos complejos. Tienen que limpiar entradas desordenadas, imputar valores faltantes, codificar variables categóricas en formatos numéricos y diseñar cruces de características personalizadas.

                                      Una vez que los datos están listos, deben ejecutar bucles repetitivos de optimización de hiperparámetros, buscando entre tasas de aprendizaje, profundidades de árboles, proporciones de submuestreo y cuadrículas de regularización para encontrar la mejor configuración.

                                      Una vez implementados, estos modelos tradicionales «incurren en una deuda operativa continua a través del monitoreo de la deriva de datos y el reentrenamiento de los canales para mantener la precisión», dijo a VentureBeat Weihao Kong, investigador científico de Google Research.

                                      Mientras tanto, el resto de la industria de la IA ha seguido adelante. Los modelos de IA generativa para texto y visión por computadora han pasado sin problemas a la inferencia de disparo cero, donde un modelo puede realizar una tarea completamente nueva simplemente con solo recibir indicaciones del contexto.

                                      Los modelos de lenguajes grandes (LLM) ya destacan en aprendizaje en contextoEntonces, ¿por qué no podemos simplemente introducir tablas en un LLM disponible en el mercado?

                                      Debido a que los LLM están capacitados en lenguaje natural en lugar de datos estructurados, tienen dificultades para procesar tablas directamente. En primer lugar, sus límites de contexto se agotan rápidamente en tablas de tamaño mediano que contienen sólo unos pocos miles de filas y cientos de columnas. En segundo lugar, los LLM adolecen de ineficiencia en la tokenización, ya que dividen de manera incómoda los valores numéricos y destruyen la precisión matemática. Finalmente, sufren de ceguera estructural. Cuando una tabla 2D se serializa como una cadena de texto 1D, los LLM pierden la pista de qué valor pertenece a qué fila y columna a medida que la tabla crece.

                                      «Es por eso que, hoy en día, es mucho más efectivo usar un LLM para escribir el código que maneja la ingeniería de características y llama a XGBoost que pedirle al LLM que lea la tabla en sí», dijo Kong.

                                      ¿Qué es TabFM?

                                      Para ejecutar inferencia con TabFM, no actualiza ningún peso del modelo. En su lugar, toma sus ejemplos históricos (las filas de entrenamiento con sus etiquetas conocidas) y sus filas de destino (los nuevos datos que desea predecir) y las pasa al modelo como un mensaje único y unificado. El modelo aprende a interpretar las relaciones entre columnas y filas directamente desde este contexto en tiempo de ejecución.

                                      Por ejemplo, considere un analista empresarial que intenta predecir la pérdida de clientes. En lugar de crear una canalización de datos personalizada y entrenar un modelo XGBoost, pueden simplemente pasar una muestra de datos históricos de sesiones de usuario junto con una sesión nueva y activa a TabFM. En un paso hacia adelante, el modelo devuelve una probabilidad de abandono instantáneo.

                                      Arquitectura TabFM (fuente: Google Research)

                                      TabFM supera las limitaciones de los LLM al tratar los datos como una cuadrícula, preservando su integridad estructural sin forzarlos a formar una cadena de texto unidimensional.

                                      Para procesar eficazmente diversas estructuras tabulares y al mismo tiempo permitir una predicción escalable de disparo cero, TabFM sintetiza las fortalezas de arquitecturas experimentales anteriores, TabPFN y TabICL. PestañaPFNdesarrollado por Prior Labs, demostró por primera vez que una arquitectura de transformador podía realizar una clasificación de disparo cero en tablas pequeñas, aunque tuvo dificultades para escalar computacionalmente a conjuntos de datos más grandes.

                                      Más tarde, PestañaICLdesarrollado por el Instituto Nacional de Investigación en Ciencia y Tecnología Digital de Francia, abordó este cuello de botella introduciendo la compresión de filas, lo que permite el aprendizaje en contexto para procesar eficientemente tablas mucho más grandes.

                                      TabFM combina la profunda contextualización de funciones de TabPFN con la compresión eficiente de TabICL en un novedoso diseño híbrido construido sobre tres mecanismos clave:

                                      1. Atención alternada de filas y columnas: La tabla sin formato se procesa primero a través de un módulo de atención multicapa que alterna columnas (características) y filas (ejemplos). Al prestar atención continua a estas dos dimensiones, el modelo captura de forma nativa interacciones de características complejas. Esta contextualización profunda hace el trabajo pesado que normalmente requeriría una tediosa elaboración manual de funciones por parte de científicos de datos.

                                      2. Compresión de filas: Después de esta contextualización, la información cruzada para cada fila se comprime en una representación vectorial única y densa. TabICL fue pionero en esto mediante el uso de tokens CLS para comprimir la rica información de una fila en un vector, «a diferencia de TabPFN v2, v2.5 y v2.6, que atienden la cuadrícula de celdas completa en toda la red», explicó Kong. Esto reduce drásticamente la huella computacional.

                                      3. Aprendizaje en contexto (ICL): Luego, un transformador causal opera en esta secuencia de incrustaciones comprimidas. Este modelo Transformer utiliza el mecanismo de atención de TabICL para atender estos densos vectores de filas, lo que reduce drásticamente el costo de cálculo y permite que el modelo procese grandes conjuntos de datos de manera eficiente.

                                      Un importante punto de venta de TabFM es su receta de preentrenamiento. El modelo se entrenó íntegramente en cientos de millones de conjuntos de datos sintéticos. Estos conjuntos de datos se generaron dinámicamente utilizando modelos causales estructurales (SCM) que incorporan una amplia variedad de funciones aleatorias. Al capacitarse exclusivamente en SCM sintéticos, TabFM aprendió los aspectos matemáticos fundamentales de cómo interactúan las características tabulares sin ingerir archivos CSV confidenciales del mundo real.

                                      TabFM en acción

                                      Para probar las capacidades del modelo, los investigadores de Google compararon TabFM en TabArena, un conjunto de evaluación integral que abarca 51 conjuntos de datos tabulares diversos en 38 tareas de clasificación y 13 de regresión.

                                      En estos puntos de referencia públicos, las predicciones cero de TabFM ya coinciden o superan las líneas de base supervisadas fuertemente ajustadas. Sin embargo, Google tiene cuidado en señalar que esto no significa automáticamente que TabFM destrone universalmente los modelos de producción personalizados e hiperoptimizados en cada carga de trabajo empresarial.

                                      Rendimiento de TabFM

                                      Rendimiento de TabFM en puntos de referencia de la industria (fuente: Google Research)

                                      «En lugar de reemplazar los modelos de producción hiperoptimizados, el verdadero valor comercial práctico que desbloquea para los equipos de ingeniería eficiente es la velocidad», afirmó Kong. «Permite a los analistas de datos y a los ingenieros de backend crear instantáneamente modelos de referencia de alta calidad sin un equipo de ciencia de datos dedicado a gestionar un ciclo de vida complejo».

                                      Para los profesionales avanzados que buscan obtener la máxima precisión, el equipo de investigación también introdujo una configuración «TabFM-Ensemble». Al ejecutar el modelo a través de 32 variaciones distintas y combinar los resultados, TabFM lleva el rendimiento aún más lejos.

                                      Primeros pasos, compensaciones y el futuro de la nube

                                      El cambio al aprendizaje en contexto para tablas introduce una nueva compensación económica que los equipos de ingeniería deben considerar.

                                      Con los algoritmos tradicionales, el entrenamiento es lento y costoso, pero la inferencia es ultrarrápida y barata. TabFM cambia esta dinámica. Mientras que el tiempo de entrenamiento cae a cero, la inferencia se vuelve significativamente más pesada. Debido a que el modelo debe procesar todo el conjunto de datos históricos como contexto durante cada predicción, requiere más computación y memoria en tiempo de ejecución.

                                      En este nuevo paradigma, «la capacitación tradicional en aprendizaje automático se convierte en la fase de ‘prellenado’ (almacenamiento en caché KV) en la ventana de contexto», dijo Kong. Si bien este costo de precompletar es elevado, se paga solo una vez por tabla y el caché se reutiliza en consultas posteriores. «El problema es la latencia de predicción, que ningún almacenamiento en caché elimina», añadió Kong. Cada nueva predicción requiere pasar por un gran transformador. «Cualquier API de producción que requiera tiempos de respuesta de un solo dígito y milisegundos no puede tolerar la sobrecarga de avance de TabFM».

                                      Para los desarrolladores que buscan evaluar el modelo hoy, la barrera de entrada es baja. Google diseñó TabFM como un reemplazo directo de los flujos de trabajo de aprendizaje automático tradicionales, ofreciendo una API compatible con scikit-learn (TabFMClassifier y TabFMRegressor). Maneja de forma nativa columnas numéricas y categóricas mixtas, funciona directamente con pandas DataFrames y no requiere codificadores ordinales manuales ni escaladores numéricos. La biblioteca admite backends JAX y PyTorch.

                                      Sin embargo, los equipos empresariales deben ser conscientes de las limitaciones y restricciones de licencia actuales. La arquitectura del modelo tiene un límite estricto de 10 clases de salida para tareas de clasificación y está optimizada para tablas con hasta 500 características. Más importante aún, mientras Google lanzó el base de código subyacente Bajo la licencia permisiva Apache 2.0, los pesos del modelo previamente entrenado se publican en abrazando la cara bajo una estricta licencia tabfm-non-commercial-v1.0. Los desarrolladores pueden evaluar el modelo internamente, pero aún no se puede implementar en productos comerciales.

                                      De cara al futuro, Google está abordando las fricciones en el despliegue comercial a través de su ecosistema de nube. TabFM se está integrando directamente en Google BigQuery, lo que permite a los analistas ejecutar predicciones cero de forma nativa mediante un comando «AI.PREDICT». Al colocar la inferencia del modelo básico justo al lado del almacén de datos, TabFM pronto podría hacer que el aprendizaje automático tabular complejo sea tan accesible como una consulta básica de base de datos.

                                      En la práctica, TabFM brilla en la creación rápida de prototipos, entornos con mucha deriva de datos y conjuntos de datos pequeños y medianos de menos de 100.000 filas. Por el contrario, los equipos deben ceñirse a los modelos tradicionales para API estrictas de latencia ultrabaja o tablas masivas que superan el millón de filas, que actualmente requieren un muestreo de filas agresivo que degrada la ventaja competitiva del modelo básico.

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      — Redacción Despertar Matinal

                                      — Redacción Despertar Matinal

                                      Programa radial que te conecta con la información desde temprano en la mañana.

                                      Next Post
                                      El actor británico Micheal Ward absuelto por un jurado de Londres de los cargos de violación y agresión sexual

                                      El actor británico Micheal Ward absuelto por un jurado de Londres de los cargos de violación y agresión sexual

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

                                        La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

                                        0 shares
                                        Share 0 Tweet 0
                                      • Why US plan to sell F-35 warplanes to Saudi Arabia is controversial

                                        0 shares
                                        Share 0 Tweet 0
                                      • Las muertes en Francia se disparan mientras el calor extremo bate récords europeos

                                        0 shares
                                        Share 0 Tweet 0
                                      • Arrestan a dos falsos odontólogos: intrusismo y mala práctica dejan secuelas graves en paciente de La Vega

                                        0 shares
                                        Share 0 Tweet 0
                                      • Warm words on Canada’s EU ‘associate membership’ but no guarantees

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por