PROVIDENCIA, Rhode Island — El informático Louis Castricato estaba en su octavo año estudiando grandes modelos de lenguaje (la tecnología de inteligencia artificial detrás de chatbots como ChatGPT y Claude) cuando empezó a sentir que estaba llegando a un callejón sin salida.
«Básicamente, hemos superado el punto de realizar una verdadera investigación fundamental de LLM», dijo Castricato. «Ahora son sólo aplicaciones».
El investigador abandonó sus estudios en la Universidad de Brown y fundó una nueva empresa, llamada Overworld. Su ambición está en su nombre: IA que puede comprender y navegar en un mundo, no solo palabras.
Todavía se puede ganar mucho dinero con los chatbots de IA: los inversores cuentan con ello mientras comprometen billones de dólares con desarrolladores líderes como Anthropic y OpenAI. Pero un número cada vez mayor de emprendedores de IA se están dedicando a lo que consideran la próxima frontera: “modelos mundiales” que enseñan a los sistemas de IA, y a veces a los robots, cómo reaccionar en un entorno físico.
Entre ellos se incluyen algunos de los científicos más destacados del campo, como la “Madrina de la IA” Fei-Fei Li, quien describe el concepto de modelo mundial como “uno de los términos más importantes y sobrecargados de la IA actual”.
En el centro de la investigación de modelos mundiales está la idea de que la IA no puede ser verdaderamente inteligente si sólo puede leer un libro. También necesita leer la habitación.
“Mientras que los modelos lingüísticos aprenden la estructura estadística del texto, los modelos mundiales aprenden la estructura estadística del espacio y el tiempo: cómo cae la luz sobre una superficie, cómo se ve un jardín desde un ángulo que ninguna cámara ha captado, cómo los objetos responden a la fuerza y siguen las leyes de la física”, escribió Li, fundador de la startup World Labs de San Francisco, en un ensayo publicado este mes.
Otro proponente es el pionero de la IA Yann LeCun, quien renunció a su trabajo como científico jefe de IA de Meta el año pasado para iniciar Advanced Machine Intelligence Labs, con sede en París.
“El modelo mundial se está convirtiendo rápidamente en una palabra de moda”, dijo LeCun en un podcast reciente sobre “Aprendizaje no supervisado”. Dijo que lo ve como algo que permite a un agente de IA «predecir las consecuencias de sus propias acciones».
Hay múltiples formas de definir modelos mundiales, a menudo basadas en las tecnologías que alguien espera construir con ellos, ya sean robots o un videojuego más interactivo.
La formación en todos los libros, artículos de noticias y medios visuales de la humanidad, como lo han hecho los modelos de lenguaje de IA, ha dado lugar a asistentes de IA que están cambiando la naturaleza del trabajo de oficina y algunos campos creativos. Pero algunos defensores ven limitaciones en los modelos de IA generativa que funcionan prediciendo repetidamente la siguiente palabra o píxel para producir nuevos diálogos, imágenes o líneas de código.
Los chatbots no pueden tomar una taza de café, señala Martin Hebert, decano de informática de la Universidad Carnegie Mellon.
«Está toda la geometría del mundo, la dinámica de cómo muevo mi mano, la interacción física del contacto con la copa», dijo Hebert. «Esto es mucho más complejo que simplemente predecir la siguiente palabra de una oración».
Para científicos como Hebert, que ha pasado más de cuatro décadas investigando robótica, la aplicación más útil para los modelos mundiales es como un camino más rápido y económico hacia la «IA física», otra palabra de moda en la industria tecnológica.
«Algunas personas pueden tener definiciones diferentes, pero la IA física y encarnada es una especie de evolución de lo que solíamos llamar robótica», dijo Hebert en una entrevista. Algunos de los avances de la IA que han hecho que los chatbots sean tan útiles también pueden aplicarse para crear una IA con un conocimiento lo suficientemente amplio de su entorno como para funcionar como el cerebro de un robot, afirmó.
«En el cuerpo y en la médula espinal tienes un modelo muy general de cómo mantener el equilibrio, cómo caminar, y puedes adaptarte al dolor de rodilla por la mañana, por lo que ahora caminas un poco diferente», dijo. «No necesitas pensar en eso. Tienes un modelo general en algún lugar de tu sistema nervioso y cerebro que permite que tu cuerpo se adapte muy rápidamente».
Los robots más inteligentes no son el único objetivo final de los modelos mundiales. Castricato fundó Overworld el año pasado y la pequeña startup con sede en Rhode Island ahora está construyendo mundos de videojuegos donde una escena, digamos, de un bosque espeluznante, puede adaptarse a medida que un personaje virtual se mueve a través de él e interactúa con los objetos que contiene.
«No existe otro modelo de mundo en el que puedas simplemente atravesar puertas o en el que puedas interactuar con un entorno detallado como este», dijo en una entrevista. «Optimizamos la interacción por encima de cualquier otra cosa».
Si bien las aplicaciones a corto plazo no son tan evidentes como las herramientas de codificación de IA, los creadores de modelos mundiales están atrayendo el interés de capitalistas de riesgo como Steve Jang, cofundador y socio gerente de Kindred Ventures.
La empresa está invirtiendo en Overworld y otras empresas centradas en modelos mundiales, incluida Causal Labs, que construye modelos de inteligencia artificial para la predicción del tiempo, y Extropic, que construye chips de computadora especializados adaptados a los modelos mundiales.
«Creo que el futuro son muchos tipos diferentes de modelos con muchas filosofías y arquitecturas diferentes», dijo Jang. «No creo que sea un modelo grande y denso que los gobierne a todos».
En su reciente ensayo, Li buscó crear una “taxonomía de modelos mundiales” para ayudar a aclarar la confusión sobre las visiones en competencia.
«Un modelo de vídeo que produce llamas magníficas pero físicamente imposibles, un modelo de lenguaje que improvisa un juego jugable y un motor de física que simula fielmente la combustión, todos llevan el mismo nombre», escribió.
Ella dividió los modelos mundiales en tres categorías. Los más viables comercialmente hoy en día son los “renderizadores” que priorizan la fidelidad visual de los mundos virtuales que crean pero no se puede confiar en que enseñen mucho a los robots.
Luego, están los “simuladores” que crean campos de entrenamiento virtuales que representan fielmente la estructura física de un mundo; y “planificadores” que intentan predecir lo que debería hacer un agente o robot de IA en un mundo no estructurado.
«Un robot que puede planificar es un robot que puede trabajar, y toda la industria está compitiendo para ser el primero en llegar allí», escribió.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.















































































