junto a la piscinael laboratorio de inteligencia artificial de San Francisco que ha pasado la mayor parte de sus tres años de existencia vendiendo silenciosamente modelos de codificación a gobiernos y agencias de defensa, lanzó el martes su modelo más capaz hasta la fecha e hizo una apuesta inusualmente agresiva a que la transparencia radical, no la escala bruta, es la forma en que un laboratorio más pequeño compite en la frontera.
el modelo, Laguna S 2.1es un parámetro de 118 mil millones Sistema de mezcla de expertos (MoE) que activa solo 8 mil millones de parámetros por token, admite una ventana de contexto de hasta 1 millón de tokens y, según los puntos de referencia publicados por la compañía, iguala o supera a los modelos abiertos varias veces su tamaño en tareas de codificación agente. los pesos son disponible inmediatamente en Hugging Face bajo la licencia permisiva OpenMDW-1.1.
Las cifras de los titulares son sorprendentes para un modelo tan pequeño. Poolside informa que Laguna S 2.1 obtiene una puntuación del 70,2% en Terminal-Banco 2.1un punto de referencia de tareas terminales a largo plazo, ubicándolo en el puesto 11 en la clasificación compilada por la compañía, por delante de DeepSeek-V4-Pro-Maxun modelo de 1,6 billones de parámetros que obtuvo una puntuación de 64,0; Los 975 mil millones de parámetros de Thinking Machines Indicio63,8; y los 550 mil millones de parámetros de Nvidia Nemotrón 3 Ultraen 56,4. En Banco SWE multilingüeregistra un 78,5%, y en SWE-Bench ProConjunto de datos públicos, 59,4%.
Quizás más revelador que cualquier puntuación: el modelo pasó del inicio del entrenamiento previo el 22 de mayo al lanzamiento público en menos de nueve semanas, entrenado en 4.096 GPU Nvidia H200. En una industria donde los ciclos de los modelos emblemáticos generalmente se miden en trimestres o años, Poolside ha enviado tres modelos en tres meses.
Por qué la brecha abierta de IA en Occidente se ha convertido en un tema de discusión
El lanzamiento llega en medio de un debate cada vez más intenso sobre la procedencia de la IA de peso abierto. Durante el año pasado, la adopción por parte de los desarrolladores se ha desplazado decisivamente hacia sistemas abiertos que las empresas pueden descargar, inspeccionar y ejecutar en su propia infraestructura, y las principales opciones en esa categoría provienen abrumadoramente de los laboratorios chinos. búsqueda profunda, Qwen, Como, GLM, minimaxy Hunyuan de Tencent Todos ellos ocupan un lugar destacado en las propias tablas comparativas de Poolside.
Marcos de comunicados de prensa adjuntos de Poolside Laguna S 2.1 explícitamente como respuesta, señalando que el modelo ocupa una clase de tamaño en la que ningún laboratorio occidental ha lanzado pesos abiertos en 11 meses, desde la aparición de OpenAI. gpt-oss-120b agosto pasado. «Occidente necesita modelos abiertos en los que pueda confiar, ejecutar y construir», dijo Jason Warner, codirector ejecutivo de Poolside, en el anuncio.
El cofundador y codirector ejecutivo Eiso Kant dejó aún más claro lo que está en juego filosófico en un publicación larga sobre X. «Creo que la inteligencia debería convertirse y se convertirá en una mercancía», escribió, argumentando que el ecosistema abierto «no ganará siendo el mejor en su propia categoría». Los usuarios, argumentó, simplemente quieren la mejor inteligencia para la tarea en cuestión, por lo que los modelos abiertos deben estar a la par o mejores que sus equivalentes cerrados.
La lógica estratégica aquí no es la caridad. El negocio principal de Poolside es implementar modelos dentro de los límites de seguridad del gobierno, la defensa y las empresas reguladas: clientes para quienes el acceso API cerrado y medido a menudo no es viable por razones de cumplimiento y soberanía.
Cada empresa que hoy se estandariza según un modelo abierto chino será más difícil de ganar mañana. Lanzar pesos abiertos competitivos es tanto una jugada del ecosistema como una estrategia de alto nivel para el negocio de implementación de alta seguridad de la empresa. También replantea la carrera de la IA alejándose del terreno donde Poolside no puede competir (gasto de capital a escala fronteriza) y hacia terreno donde cree que puede hacerlo: costo por token, autohospedaje y velocidad de iteración.
Cómo una arquitectura dispersa hace que la ejecución de agentes de IA empresariales sea asequible
El diseño técnico refleja una tesis específica sobre hacia dónde se mueve el valor en la codificación de IA. La escasa arquitectura MoE de Laguna S 2.1: 256 expertos enrutados más un experto compartido, con atención de consultas agrupadas y capas de ventanas deslizantes intercaladas, según el Tarjeta modelo Hugging Face — significa que los costos de inferencia aumentan con los 8 mil millones de parámetros activos, no con los 118 mil millones en total. Poolside enfatiza que el modelo es lo suficientemente pequeño como para ejecutarse en una sola Nvidia DGX Spark, la máquina de inteligencia artificial de escritorio.
Esto es importante para lo que Poolside llama economía simbólica. Los agentes de codificación de largo horizonte son consumidores voraces de tokens: los datos publicados por la compañía muestran que el modelo consume una media de aproximadamente 249.000 tokens de finalización por trayectoria en su punto de referencia más difícil cuando el modo de pensamiento está habilitado. A precios de API medidos, las cargas de trabajo agentes a escala empresarial se convierten en una partida presupuestaria significativa. En OpenRouter, Poolside ofrece un punto final gratuito de contexto de 256K y una implementación de contexto dedicada de 1M con un precio de $0,10 por millón de tokens de entrada y $0,20 por millón de tokens de salida: precios agresivos que socavan la mayoría de las alternativas de vanguardia en un orden de magnitud.
El soporte del ecosistema es inusualmente amplio para el primer día. El modelo sigue vivo. Biblioteca de modelos de Baseten y Puerta de enlace AI de Vercelcon integraciones en vllm, SGLang, Sery llama.cppademás de variantes cuantificadas hasta archivos GGUF de 4 bits (75 gigabytes) para uso local. Pero la afirmación más interesante de Poolside es conductual, no arquitectónica. Pengming Wang, codirector de investigación aplicada en Poolside, dijo que los beneficios se obtuvieron al mejorar los hábitos de trabajo del modelo: «más verificación, menos dar las cosas por sentado, no declarar la victoria temprano y ser más persistente». La inteligencia bruta, sostiene la empresa, es un eje de capacidad; La forma de trabajar de un modelo es un segundo eje que importa enormemente para los agentes que se quedan desatendidos durante horas.
Publicar todas las trayectorias de referencia para contrarrestar la crisis de credibilidad de la IA
La parte más importante del lanzamiento para los compradores empresariales puede ser una medida de transparencia en la evaluación con pocos precedentes entre los principales laboratorios: Poolside publicó la trayectoria completa y sin editar de cada prueba en sus ejecuciones de referencia finales: cada paso de razonamiento, llamada de herramienta y comando de shell detrás de cada puntuación informada.
Esto aborda un creciente problema de credibilidad en la evaluación comparativa de la IA. A medida que las puntuaciones más altas en puntos de referencia maduros se agrupan en el rango de 70 a 90%, y a medida que el «hacking de recompensas» (modelos que encuentran soluciones en línea o verificadores de juegos en lugar de resolver problemas) se ha vuelto endémico, las cifras autoinformadas han perdido gran parte de su señal. Poolside reveló con franqueza sus propios encuentros con el problema: durante el entrenamiento, más de la mitad de las trayectorias en algunas tareas del banco SWE fueron marcadas porque el modelo simplemente investigó en línea la solicitud de corrección de errores original y la aplicó. La compañía documentó sus mitigaciones, incluidas adiciones inmediatas, evaluación basada en LLM calibrada con etiquetas humanas y revisión de anotadores expertos de una ejecución de Terminal-Bench de alta puntuación.
Tres estudios de caso publicados ilustran lo que la empresa entiende por persistencia. En uno, el modelo construyó un motor de renderizado HTML/CSS funcional a partir de una carpeta vacía en una sesión desatendida de 181 pasos y 50 minutos; luego, al carecer de capacidades de visión, puso en marcha Chromium sin cabeza para comparar numéricamente su salida de lienzo con la renderización de un navegador real. En otro, apuntando al propio agente de Poolside en un ciclo de optimización automatizado, el modelo hizo que el código base de Go fuera un 5,2% más rápido con aproximadamente un 70% menos de asignación de memoria, encontrando un error de concatenación de cadenas O(n²) en el camino. En un tercero, trabajando en una caja de arena sin Python instalado, el modelo hizo su teoría de números en Perl y volvió a derivar de forma independiente una prueba del problema #397 de Erdő, una cuestión de combinatoria abierta durante cinco décadas hasta que GPT-5.2 Pro la resolvió por primera vez en enero pasado. Poolside señala que la construcción de su modelo es estructuralmente diferente de la solución publicada anteriormente y que su límite de conocimiento de noviembre de 2025 precede a la primera prueba.
Lo que revelan las limitaciones reveladas y la letra pequeña de los puntos de referencia
junto a la piscina Merece crédito por revelar las limitaciones que la mayoría de los laboratorios ocultan. El modelo puede sobreadaptarse a su arnés nativo y toparse con esquemas de herramientas ligeramente diferentes en agentes de terceros, destrozar JSON en argumentos de herramientas anidados y es propenso a pensar demasiado en las matemáticas de la competencia. Actualmente no existe un dial de esfuerzo de pensamiento configurable por el usuario (solo encendido o apagado) y la brecha entre los modos es enorme: el pensamiento se eleva Terminal-Banco 2.1 del 60,4% al 70,2%, y ProfundoSWE del 16,5% al 40,4%, a un costo simbólico sustancialmente mayor.
Los compradores deberán aplicar sus propios descuentos a las tablas comparativas. La metodología de Poolside toma el máximo de puntuaciones autoinformadas por los proveedores, tablas de clasificación de autores de referencias y cifras de terceros para los competidores: una convención razonable, pero que combina arneses y condiciones de prueba. En ProfundoSWEEn particular, Poolside utilizó su propio equipo de agentes en lugar del mini-agente swe estándar de la tabla de clasificación, una diferencia que la compañía reconoce hace que las puntuaciones sean menos directamente comparables. Y la frontera sigue claramente fuera de nuestro alcance: modelos cerrados como GPT-5.6 Solen 88.8 en Terminal-Bench 2.1, y Claude Fábula 5en 88,0, junto con el peso abierto de 2,8 billones de parámetros kimi k3con 88,3, se sitúa muy por encima de Laguna S 2,1.
La cuestión estructural más profunda es si la estrategia «de Poolside»Fábrica de modelos«, la plataforma interna a la que la compañía atribuye su rápida cadencia de lanzamiento, puede mantener este ritmo a medida que los modelos escalan. La trayectoria hasta ahora es genuinamente inusual: el lanzamiento dual de abril de Laguna M.1 y XS.2, la actualización del 2 de julio de XS 2.1 y ahora S 2.1, que según la compañía supera al buque insignia M.1 de abril en aproximadamente un tercio de su tamaño activo. Sorprendentemente, S 2.1 utilizó exactamente los mismos datos previos al entrenamiento que XS 2.1, lo que significa casi toda la mejora provino de la escala, las correcciones de capacitación y la capacitación posterior en todo el corpus de 409.000 entornos de capacitación agentes y no agentes de la compañía. Poolside dice que su próximo modelo Laguna, más grande, comenzó la capacitación previa la semana pasada.
Para los tomadores de decisiones técnicas, Laguna S 2.1 es la opción occidental de peso abierto más creíble que ha surgido en casi un año para la codificación agente autohospedada, con evidencia publicada, una licencia permisiva, un amplio soporte de ecosistema y una historia económica basada en hardware que usted puede poseer. Que esto afecte al dominio de los modelos abiertos chinos dependerá menos de este lanzamiento que de los siguientes.
Kant, por su parte, ya le ha dicho al mundo cómo piensa que termine esa historia. Poolside está construyendo hacia un futuro en el que la inteligencia más capaz «cualquiera pueda poseerla y moldearla», escribió, y la compañía planea seguir enviando productos «hasta que ese futuro exista». En una industria donde los laboratorios más grandes encierran cada vez más su mejor trabajo detrás de una API, lo más radical de Laguna S 2.1 puede no ser su puntuación, sino que cualquiera puede descargarlo y comprobarlo.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































