Poolside Laguna : des modèles de code open-weight qui frappent au-dessus de leur catégorie
Le 2 juillet 2026, Poolside AI — un labo de foundation models basé aux US qui a levé environ 2 Md$ à une valo de 12 Md$ avec la participation de NVIDIA — a livré ses premiers modèles publics : la famille Laguna. Trois modèles de code MoE, tous publiés sous la licence permissive OpenMDW-1.1, partageant un corpus de pretraining unique et différant principalement par la taille de la machine sur laquelle on les pointe. Deux semaines plus tard ils ont étendu la famille avec Laguna S 2.1, un MoE 118B/8B-actif qui bat DeepSeek-V4-Pro-Max sur DeepSWE v1.1 (40,4 % vs 9,0 %) tout en activant un sixième des paramètres, et atterrit à 78,5 % sur SWE-Bench Multilingual — le meilleur score publié sur ce leaderboard au lancement.
Cette page est le guide de terrain pratique pour la famille : ce qui rend réellement chaque taille intéressante, les deux choix de pipeline d'entraînement que la plupart des couvertures ont sautés, la photo honnête de benchmark contre les concurrents fermés de pointe et open-weight, comment les faire tourner en local aujourd'hui, et les tâches spécifiques où prendre un Laguna est le bon appel plutôt que Claude, GLM-5.2 ou Kimi K3.
- Connaître la famille en un coup d'œil — trois tailles, un corpus, une licence — et quelle taille mappe sur votre hardware
- Comprendre pourquoi 8B paramètres actifs peuvent battre 1,6T total : routage MoE + post-training spécialisé code
- Lire la photo honnête de benchmark à travers SWE-Bench Multilingual, Terminal-Bench 2.1, DeepSWE v1.1 et SWE-Bench Pro
- Connaître les deux premières du pipeline d'entraînement qui façonnent le comportement du modèle — RL en FP8 et entraînement multi-harness
- Faire tourner Laguna via OpenRouter en trois lignes, ou en local via GGUF/MLX sur un MacBook ou DGX Spark
- Décider quand Laguna est le bon outil vs Claude Opus 5, GLM-5.2, Kimi K3 ou GPT-5.5
La famille en un coup d'œil
Trois modèles, un run de pretraining partagé, trois enveloppes hardware. C'est intentionnel : Poolside a pré-entraîné une fois et post-entraîné par taille, donc la personnalité est cohérente à travers la famille et vous choisissez une taille en fonction de la boîte que vous avez, pas de la forme de la tâche.
| Modèle | Params totaux | Params actifs | Contexte | Hardware cible | Licence |
|---|---|---|---|---|---|
| Laguna XS 2.1 | 33B (MoE) | 3B | jusqu'à 256K | Laptop unique / GPU MacBook | OpenMDW-1.1 |
| Laguna S 2.1 | 118B (MoE) | 8B | jusqu'à 1M | DGX Spark unique ou H200 en FP8 | OpenMDW-1.1 |
| Laguna M.1 | 225B (MoE) | 23B | 256K+ | Nœud entreprise multi-GPU | OpenMDW-1.1 |
Les trois takeaways pratiques de ce tableau :
- Même corpus à travers la famille. Le post-training de Laguna S 2.1 n'a ajouté aucune donnée nouvelle par-dessus celle de XS 2.1 — l'annonce S 2.1 le mentionne explicitement. Les améliorations de comportement viennent de la plus grande classe de modèle et d'une recette de post-training différente, pas de le nourrir avec de nouveaux documents. Cela signifie que la sagesse de fine-tuning transfère proprement à travers les tailles.
- La colonne active-param est ce qui compte pour le coût d'inférence. À 8B actif, Laguna S 2.1 a le profil de calcul d'un modèle dense 8B par token, pas d'un 118B. C'est la différence entre « tourne sur un seul accélérateur » et « a besoin d'un rack ».
- OpenMDW-1.1 est une vraie licence permissive, pas une licence source-available. Elle a été publiée par la Linux Foundation pour combler l'écart entre les licences open-source traditionnelles (qui ne couvrent pas proprement les poids et les données) et les licences vendeur « open » qui interdisent silencieusement l'usage commercial. Accorde des droits illimités et sans royalties à travers copyright, brevet, base de données et secret commercial ; les sorties sont explicitement libres.
Trois choses qui ne sont pas évidentes depuis les titres
1. RL en FP8 est un vrai déblocage d'ingénierie, pas du marketing
Le reinforcement learning pour le post-training LLM a historiquement tourné en BF16 parce que le bruit de gradient à la précision FP8 était supposé faire exploser le petit signal que le RL fournit. Poolside affirme publiquement que Laguna S 2.1 est le premier modèle à échelle de pointe entraîné avec RL en FP8. Si vrai — et aucun contre-exemple n'a fait surface au début août 2026 — cela réduit de moitié l'empreinte mémoire de l'étape RL et permet à un cluster donné de dépenser le calcul RL sur des tâches qui étaient trop chères.
La conséquence pratique pour les utilisateurs : l'étape RL de Poolside était sélective. Ils rapportent 409k environnements d'entraînement (83k terminal, 168k software-engineering), avec le SFT bootstrappant la plupart des comportements depuis des données synthétiques et le RL réservé aux problèmes de plus haute difficulté. Cela apparaît dans les deltas de benchmark — le boost du mode thinking sur DeepSWE v1.1 passe de 16,5 % → 40,4 % — qui est la forme que vous attendriez quand le RL a été dépensé étroitement sur du raisonnement dur plutôt que étalé sur chaque tâche.
2. L'entraînement multi-harness est pourquoi il ne s'écroule pas dans les agents tiers
Les modèles de code sont habituellement entraînés à l'intérieur d'un seul harness d'agent (le scaffold propre du vendeur) puis déployés dans des dizaines d'autres (Cursor, Cline, Aider, Continue, Kilo, etc.). L'écart entre harness d'entraînement et de déploiement est d'où viennent beaucoup d'échecs « le benchmark disait que ça marchait ». Poolside a entraîné Laguna à travers 83k environnements terminal et 168k environnements software-engineering couvrant plusieurs harness, ce qui est le mécanisme qu'ils créditent pour rendre le modèle utilisable hors de leur propre scaffold dès le premier jour.
Le signe visible d'un entraînement multi-harness dans le comportement rapporté de Laguna : persistance (n'abandonne pas une approche après un appel d'outil raté), vérification-d'abord (relit sa propre sortie avant de livrer), et débrouillardise (trouve des chemins alternatifs quand le direct est bloqué). Ce sont des comportements d'agent, pas des comportements de next-token — vous ne les obtenez pas de plus de données de pretraining.
Les limitations connues qui mappent directement sur ce même choix de conception valent la peine d'être notées pour ne pas être surpris :
- Peine avec les légères variations de schéma dans les harness tiers vs celui natif de Poolside — le harness doit ressembler « suffisamment » à quelque chose dans les 409k envs d'entraînement.
- Émet parfois du JSON incorrectement échappé dans les appels d'outils imbriqués à l'intérieur d'arrays. Rare mais réel.
- Surréfléchit sur les problèmes de compétition de maths — le thinking étendu tourne plus longtemps que nécessaire sur les tâches type AIME. Bien pour le code, gaspilleur pour les maths.
3. Le ratio de paramètres actifs est toute l'histoire sur le coût
Le chiffre qui attrape l'œil est 1,6T vs 8B : Laguna S 2.1 bat DeepSeek-V4-Pro-Max (1,6T total) sur DeepSWE v1.1 de 31,4 points tout en activant un sixième des paramètres par token. Mais le cadrage utile est le coût d'inférence :
| Modèle | Params actifs / token | Compute brut par token | Prix API de référence* |
|---|---|---|---|
| Laguna XS 2.1 | 3B | ~3B dense-équivalent | free-tier / plage 0,05 $ |
| Laguna S 2.1 | 8B | ~8B dense-équivalent | 0,10 $ in / 0,20 $ out par M (OpenRouter) |
| GLM-5.2 | ~40B | ~40B dense-équivalent | 1,20-1,40 $ in / 4,10-4,40 $ out par M |
| Kimi K3 | ~32B | ~32B dense-équivalent | similaire à la plage GLM |
| Claude Opus 5 (de pointe) | dense, non divulgué | de pointe | 15 $ in / 75 $ out par M |
L'écart 150× par token entre S 2.1 sur OpenRouter et Claude Opus 5 n'est pas un combat équitable pour la génération de titres, mais le ratio utile est S 2.1 vs les autres modèles open-weight de pointe (GLM-5.2, Kimi K3) : Laguna est ~12× moins cher par token output, avec des scores SWE-Bench Multilingual dans la même ligue. C'est l'enveloppe de prix qui change ce qu'il est économiquement sain de confier à un modèle.
Photo de benchmark — la version honnête
Les scores rapportés au lancement de S 2.1, croisés entre le propre post de Poolside et la couverture tiers :
| Benchmark | Laguna S 2.1 | Ce qu'il mesure | Notes |
|---|---|---|---|
| SWE-Bench Multilingual | 78,5 % | Vraies tâches de fix GitHub à travers de nombreux langages | Meilleur score open-weight publié au lancement |
| Terminal-Bench 2.1 | 70,2 % (thinking) / 60,4 % (non-thinking) | Workflows shell longs | ~10 points d'uplift en mode thinking |
| SWE-Bench Pro (Public) | 59,4 % | Fixes autonomes plus durs au niveau du repo | Modèles fermés de pointe toujours devant |
| DeepSWE v1.1 | 40,4 % (thinking) / 16,5 % (non-thinking) | Benchmarks SWE durs | Bat DeepSeek-V4-Pro-Max à 9,0 % malgré ~1/200 des params actifs |
| SWE Atlas (Codebase QnA) | 46,2 % | Comprendre de grands repos | Devant les chiffres DeepSWE |
| Toolathlon Verified | 49,7 % | Orchestration multi-outils | Milieu de peloton |
Trois règles d'interprétation pour les lire :
- SWE-Bench Multilingual et Terminal-Bench 2.1 sont les chiffres à prendre au sérieux pour un modèle de code agentique. Ils mappent sur du travail que vous assignerez réellement — « fixer ce bug dans un vrai repo », « faire passer ce workflow shell au vert ». Poolside mène les deux du côté open-weight.
- Le fermé de pointe gagne encore sur les benchmarks les plus durs. Claude Fable 5 et Kimi K3 mènent sur SWE-Bench Pro et sur certaines tranches de Toolathlon. Ne lisez pas le lancement de Laguna comme « Anthropic est battu » — lisez-le comme « le plafond open-weight pour le code vient de monter de plusieurs points ».
- Le mode thinking n'est pas gratuit mais c'est là que la plupart de la victoire est. Terminal-Bench 60,4 % → 70,2 %, DeepSWE 16,5 % → 40,4 %. Si vous coupez le thinking pour des raisons de coût, vous abandonnez une grosse tranche du modèle.
Faire tourner Laguna
- OpenRouter, Baseten Model Library, Vercel AI Gateway et les intégrations Kilo/Cline/Hermes ont tous offert l'accès dès le premier jour. Prix listé OpenRouter au lancement : 0,10 $ par M input, 0,20 $ par M output, avec un tier gratuit à contexte 256K pour évaluation. Endpoint chat completions compatible OpenAI — swap l'URL de base et l'ID du modèle.
- XS 2.1 (33B/3B MoE) a des conversions GGUF et MLX. Sur un MacBook 32-64GB il tourne à vitesses utilisables sous llama.cpp ou MLX. C'est la taille à utiliser quand vous voulez un assistant de code qui ne quitte jamais le laptop.
- Empreinte mémoire par précision : BF16 ~236GB (a besoin de 2 Sparks ou un nœud multi-GPU), FP8 ~118GB (Spark unique ou H200), INT4 ~59GB (rentre confortablement dans la mémoire unifiée 128GB d'un Spark unique). vLLM, SGLang et Ollama tous supportés au lancement. Poids NVFP4 aussi publiés pour les parts NVIDIA les plus récentes.
- chat.poolside.ai sert la famille sans authentification pour évaluation interactive. Utilisez-le pour construire un ressenti avant de le câbler dans un agent.
Appeler Laguna S 2.1 via OpenRouter (Python)
import os, openai
client = openai.OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
resp = client.chat.completions.create(
model="poolside/laguna-s-2.1",
messages=[
{"role": "system", "content": "You are a senior engineer. Reply with a unified diff, no prose."},
{"role": "user", "content": "Fix the off-by-one in this function:\n\ndef last_n(xs, n): return xs[-n-1:]"},
],
)
print(resp.choices[0].message.content)Quand prendre Laguna vs les alternatives
La carte de décision pragmatique, étant donné le paysage de modèles au début août 2026 :
| Tâche | Meilleur choix | Pourquoi |
|---|---|---|
| Fix de bug long au niveau du repo, sensible au budget | Laguna S 2.1 | SWE-Bench Multilingual open-weight de tête, ~12× moins cher par token output que GLM-5.2 ou Kimi K3 |
| Code agentique sur MacBook, offline requis | Laguna XS 2.1 | 3B params actifs + build MLX ; rien d'autre à cette taille n'atteint un SWE-Bench Multilingual comparable |
| Accuracy absolue de pointe sur les tâches les plus dures, coût sans objet | Claude Opus 5 ou Fable 5 | Fermé de pointe mène encore SWE-Bench Pro et les tranches les plus dures |
| Contexte 1M-token sur un repo, licence permissive nécessaire | GLM-5.2 ou Laguna S 2.1 | Les deux offrent contexte 1M sous licences permissives ; GLM-5.2 est plus fort sur le raisonnement général, Laguna est plus fort sur le code agentique |
| Orchestration multi-outils où vous avez besoin de sémantique d'appel d'outils serrée | Claude ou Kimi K3 | Le score Toolathlon milieu-de-peloton de Laguna et le cas limite JSON-escaping connu en font un défaut plus faible ici |
| Environnement régulé, aucune donnée ne quitte la boîte | Laguna S 2.1 self-hosted | OpenMDW-1.1 accorde l'usage commercial illimité, labo d'origine US ; FP8 rentre dans un accélérateur unique |
Le one-liner : Laguna est le sweet spot actuel quand vous voulez un comportement de code classe pointe sur un petit budget de params actifs, et que la licence et l'origine comptent. Utilisez-le quand ces contraintes lient ; recourez à Claude ou au fermé de pointe quand elles ne lient pas.
Lectures reliées
- GLM-5.2: Open-Weight Frontier Coding Model — le point de comparaison direct sur l'autre leader open-weight ; astuce architecturale différente (IndexShare) pour le même but 1M-contexte.
- Kimi K3 Open-Weight Frontier — l'autre grand modèle de code open-weight de pointe, params plus denses, enveloppe de comportement différente.
- DeepSeek & Qwen: Open Models Playbook — contexte sur le paysage de code open-weight contre lequel Laguna est en compétition.
- Run Models Locally with Ollama — le runtime local que vous utiliserez pour XS 2.1.
- Local Coding Agents — où XS 2.1 s'insère dans l'histoire d'agent local.
- AI Gateways: LiteLLM, OpenRouter, Portkey — comment swapper Laguna dans un stack OpenAI-compatible existant.
- What AI Costs Across Providers — la vue prix-par-tâche qui rend le ratio de Laguna visible.
Vérifiez votre prise
Check yourself
0/4Sources & lectures complémentaires
- Introducing Laguna S 2.1 — Poolside — le post de lancement avec pipeline d'entraînement, tableau de benchmark et options d'inférence.
- Poolside AI Launches Open-Weight 'Laguna' Coding Models — Open Source For You — vue d'ensemble de la famille avec les specs XS 2.1 et M.1.
- American AI startup Poolside launches free, high-performing open model Laguna XS.2 — VentureBeat — la couverture du lancement du 2 juillet pour la famille initiale.
- Poolside drops Laguna S 2.1, an open-weight coding model that beats rivals 10x its size — VentureBeat — analyse post-lancement de la position comparative de S 2.1.
- Poolside Releases Laguna S 2.1 — MarkTechPost — croisement architecture et benchmark.
- Laguna XS 2.1 review — explainx.ai — impressions hands-on et notes hardware.
- OpenMDW license — Linux Foundation — la licence sous laquelle les trois modèles Laguna livrent.