Poolside, le laboratoire d’IA de San Francisco qui a passé la majeure partie de ses trois années d’existence à vendre discrètement des modèles de codage aux gouvernements et aux agences de défense, a publié mardi son modèle le plus performant à ce jour – et a fait un pari inhabituellement agressif que la transparence radicale, et non l’échelle brute, est la façon dont un petit laboratoire rivalise à la frontière.
Le modèle, Laguna S 2.1, est un système de mélange d’experts (MoE) de 118 milliards de paramètres qui active seulement 8 milliards de paramètres par jeton, prend en charge une fenêtre contextuelle allant jusqu’à 1 million de jetons et, selon les benchmarks publiés par la société, correspond ou bat les modèles ouverts plusieurs fois sa taille sur les tâches de codage agent. Les poids sont disponibles immédiatement sur Hugging Face sous la licence permissive OpenMDW-1.1.
Les chiffres sont frappants pour un modèle aussi petit. Poolside rapporte que Laguna S 2.1 obtient un score de 70,2 % sur Terminal-Bench 2.1, une référence pour les tâches de terminaux à long terme, le plaçant au 11ème rang du classement compilé de l’entreprise – devant DeepSeek-V4-Pro-Max, un modèle de 1,6 billion de paramètres qui a obtenu un score de 64,0 ; Inkling, doté de 975 milliards de paramètres de Thinking Machines, à 63,8 ; et le Nemotron 3 Ultra de 550 milliards de paramètres de Nvidia, à 56,4. Sur SWE-Bench Multilingual, il affiche 78,5 % et sur l’ensemble de données public de SWE-Bench Pro, 59,4 %.
Peut-être plus révélateur que n’importe quel score : le modèle est passé du début de la pré-formation le 22 mai au lancement public en moins de neuf semaines, formé sur 4 096 GPU Nvidia H200. Dans un secteur où les cycles des modèles phares sont généralement mesurés en trimestres ou en années, Poolside a désormais expédié trois modèles en trois mois.
Pourquoi le déficit d’IA en Occident est devenu un problème au sein des conseils d’administration
Cette publication se situe au milieu d’un débat de plus en plus pointu sur l’origine de l’IA à poids ouvert. Au cours de l’année écoulée, l’adoption par les développeurs s’est orientée de manière décisive vers des systèmes ouverts que les entreprises peuvent télécharger, inspecter et exécuter sur leur propre infrastructure – et les principales options dans cette catégorie proviennent en grande majorité de laboratoires chinois. DeepSeek, Qwen, Kimi, GLM, MiniMax et la gamme Hunyuan de Tencent figurent tous en bonne place dans les propres tableaux de comparaison de Poolside.
Le communiqué de presse de Poolside présente explicitement Laguna S 2.1 comme une réponse, notant que le modèle occupe une classe de taille dans laquelle aucun laboratoire occidental n’a publié de poids ouverts en 11 mois – depuis le gpt-oss-120b d’OpenAI en août dernier. «L’Occident a besoin de modèles ouverts auxquels il peut faire confiance, fonctionner et sur lesquels il peut s’appuyer», a déclaré Jason Warner, co-PDG de Poolside, dans l’annonce.
Le co-fondateur et co-PDG Eiso Kant a rendu les enjeux philosophiques encore plus clairs dans un long article sur X. « Je pense que l’intelligence devrait et deviendra une marchandise », a-t-il écrit, affirmant que l’écosystème ouvert « ne gagnera pas en étant le meilleur dans sa propre catégorie ». Les utilisateurs, a-t-il soutenu, veulent simplement la meilleure intelligence pour la tâche à accomplir : les modèles ouverts doivent donc être comparables, voire supérieurs, à leurs équivalents fermés.
La logique stratégique ici n’est pas la charité. L’activité principale de Poolside consiste à déployer des modèles à l’intérieur des limites de sécurité des entreprises gouvernementales, de défense et réglementées – des clients pour lesquels un accès fermé et mesuré aux API est souvent un échec pour des raisons de conformité et de souveraineté.
Toute entreprise qui standardise aujourd’hui sur un modèle ouvert chinois deviendra plus difficile à gagner demain. La publication de pondérations ouvertes compétitives est à la fois un jeu d’écosystème et une stratégie de haut de gamme pour l’activité de déploiement de haute sécurité de l’entreprise. Il recadre également la course à l’IA loin des terrains sur lesquels Poolside ne peut pas rivaliser (dépenses d’investissement à l’échelle frontière) et vers des terrains où elle pense pouvoir le faire : coût par jeton, auto-hébergement et vitesse d’itération.
Comment une architecture clairsemée rend l’exécution des agents d’IA d’entreprise abordable
La conception technique reflète une thèse spécifique sur l’évolution de la valeur dans le codage de l’IA. L’architecture MoE clairsemée de Laguna S 2.1 – 256 experts routés plus un expert partagé, avec une attention aux requêtes groupées et des couches de fenêtres coulissantes entrelacées, selon la carte modèle Hugging Face – signifie que les coûts d’inférence s’adaptent aux 8 milliards de paramètres actifs, et non au total de 118 milliards. Poolside souligne que le modèle est suffisamment petit pour fonctionner sur un seul Nvidia DGX Spark, la machine IA de bureau.
C’est important pour ce que Poolside appelle l’économie symbolique. Les agents de codage à long horizon sont de grands consommateurs de jetons : les données publiées par l’entreprise montrent que le modèle consomme en moyenne environ 249 000 jetons d’achèvement par trajectoire sur son benchmark le plus difficile lorsque le mode réflexion est activé. Aux prix des API mesurés, les charges de travail agents à l’échelle de l’entreprise deviennent un poste budgétaire significatif. Sur OpenRouter, Poolside propose un point de terminaison gratuit de 256 Ko de contexte et un déploiement dédié de 1 million de contextes au prix de 0,10 $ par million de jetons d’entrée et de 0,20 $ par million de jetons de sortie – une tarification agressive qui sape la plupart des alternatives frontalières d’un ordre de grandeur.
Le soutien de l’écosystème est inhabituellement large pour le premier jour. Le modèle est disponible sur la bibliothèque de modèles de Baseten et sur AI Gateway de Vercel, avec des intégrations dans vLLM, SGLang, Ollama et llama.cpp, ainsi que des variantes quantifiées jusqu’à des fichiers GGUF 4 bits (75 gigaoctets) pour une utilisation locale. Mais l’affirmation la plus intéressante de Poolside est comportementale et non architecturale. Pengming Wang, co-responsable de la recherche appliquée chez Poolside, a déclaré que les gains provenaient de l’amélioration des habitudes de travail du modèle : « plus de vérification, moins de prise pour acquis, ne pas déclarer la victoire tôt et être plus persistant ». L’intelligence brute, affirme l’entreprise, est l’un des axes de capacité ; la façon de travailler d’un mannequin est un deuxième axe qui compte énormément pour les agents laissés sans surveillance pendant des heures.
Publier chaque trajectoire de référence pour contrer la crise de crédibilité de l’IA
La partie la plus importante de cette version pour les acheteurs professionnels pourrait être une démarche de transparence en matière d’évaluation, sans précédent parmi les grands laboratoires : Poolside a publié la trajectoire complète et non éditée de chaque essai lors de ses dernières exécutions de référence – chaque étape de raisonnement, appel d’outil et commande shell derrière chaque score rapporté.
Cela répond à un problème croissant de crédibilité dans l’analyse comparative de l’IA. Alors que les meilleurs scores sur les benchmarks matures se situent dans la fourchette de 70 à 90 %, et que le « piratage de récompense » – des modèles trouvant des solutions en ligne ou des vérificateurs de jeux plutôt que de résoudre des problèmes – est devenu endémique, les chiffres autodéclarés ont perdu une grande partie de leur signal. Poolside a révélé franchement ses propres rencontres avec le problème : pendant la formation, plus de la moitié des trajectoires sur certaines tâches du banc SWE ont été signalées parce que le modèle a simplement recherché en ligne la demande d’extraction de correction de bug originale et l’a appliquée. La société a documenté ses mesures d’atténuation, y compris des ajouts rapides, un jugement basé sur le LLM calibré par rapport aux étiquettes humaines et un examen par un annotateur expert d’une exécution Terminal-Bench avec des scores élevés.
Trois études de cas publiées illustrent ce que l’entreprise entend par persévérance. Dans l’un d’entre eux, le modèle a construit un moteur de rendu HTML/CSS fonctionnel à partir d’un dossier vide au cours d’une session sans surveillance de 181 étapes et 50 minutes. Puis, faute de capacités de vision, il a lancé Chromium sans tête pour comparer numériquement sa sortie de canevas avec le rendu d’un véritable navigateur. Dans un autre, pointant vers le propre faisceau d’agents de Poolside dans une boucle d’optimisation automatisée, le modèle a rendu la base de code Go 5,2 % plus rapide avec une allocation de mémoire inférieure d’environ 70 %, trouvant un bogue de concaténation de chaînes O(n²) en cours de route. Dans un troisième, travaillant dans un bac à sable sans Python installé, le modèle a fait sa théorie des nombres en Perl et a dérivé indépendamment une preuve du problème n°397 d’Erdő – une question combinatoire ouverte pendant cinq décennies jusqu’à ce que GPT-5.2 Pro la résolve pour la première fois en janvier dernier. Poolside note que la construction de son modèle est structurellement différente de la solution publiée précédemment et que sa date limite de connaissance de novembre 2025 précède la première preuve.
Ce que révèlent les limitations divulguées et les petits caractères de référence
Poolside mérite d’être félicité pour avoir divulgué les limitations que la plupart des laboratoires enterrent. Le modèle peut sur-adapter à son harnais natif et tomber sur des schémas d’outils légèrement différents dans des agents tiers, dénaturer JSON dans les arguments d’outils imbriqués et est enclin à trop réfléchir aux mathématiques de la concurrence. Il n’existe actuellement aucun cadran d’effort de réflexion configurable par l’utilisateur – juste activé ou désactivé – et l’écart entre les modes est énorme : la réflexion fait passer Terminal-Bench 2.1 de 60,4 % à 70,2 %, et DeepSWE de 16,5 % à 40,4 %, à un coût symbolique nettement plus élevé.
Les acheteurs doivent appliquer leurs propres remises aux tableaux de comparaison. La méthodologie de Poolside prend au maximum les scores auto-déclarés par les fournisseurs, les classements des auteurs de référence et les chiffres de tiers pour les concurrents – une convention raisonnable, mais qui mélange les harnais et les conditions de test. Sur DeepSWE, notamment, Poolside a utilisé son propre groupe d’agents plutôt que le mini-agent standard du classement, une différence que la société reconnaît rend les scores moins directement comparables. Et la frontière reste clairement hors de portée : des modèles fermés comme GPT-5.6 Sol, à 88,8 sur Terminal-Bench 2.1, et Claude Fable 5, à 88,0, ainsi que le Kimi K3 à poids ouvert de 2,8 billions de paramètres, à 88,3, se situent bien au-dessus de Laguna S 2.1.
La question structurelle plus profonde est de savoir si « Model Factory » de Poolside – la plate-forme interne que la société attribue à sa cadence de publication rapide – peut maintenir ce rythme à mesure que les modèles évoluent. La trajectoire jusqu’à présent est véritablement inhabituelle : la double sortie en avril de Laguna M.1 et XS.2, la mise à jour du 2 juillet de XS 2.1, et maintenant S 2.1, qui, selon la société, surpasse le produit phare d’avril, M.1, à environ un tiers de sa taille active. Remarquablement, S 2.1 a utilisé exactement les mêmes données de pré-formation que XS 2.1, ce qui signifie que presque toutes les améliorations provenaient de l’échelle, des correctifs de formation et de la post-formation sur le corpus de 409 000 environnements de formation agents et non-agents de l’entreprise. Poolside affirme que son prochain modèle Laguna, plus grand, a commencé la pré-formation la semaine dernière.
Pour les décideurs techniques, Laguna S 2.1 est l’option ouverte occidentale la plus crédible à émerger dans près d’un an pour le codage agent auto-hébergé – avec des preuves publiées, une licence permissive, un large support d’écosystème et une histoire économique construite autour du matériel que vous pouvez posséder. La question de savoir si cela entravera la domination des modèles ouverts chinois dépendra moins de cette version que de celles qui la suivront.
Kant, pour sa part, a déjà expliqué au monde comment il entendait que cette histoire se termine. Poolside construit un avenir dans lequel l’intelligence la plus performante « peut être détenue et façonnée par n’importe qui », a-t-il écrit – et la société prévoit de continuer à expédier « jusqu’à ce que cet avenir existe ». Dans une industrie où les plus grands laboratoires confinent de plus en plus leurs meilleurs travaux derrière une API, le plus radical de Laguna S 2.1 n’est peut-être pas ce qu’il obtient, mais le fait que n’importe qui peut le télécharger et le vérifier.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































