Aller au contenu principal

Poolside Laguna : des modèles de code open-weight qui frappent au-dessus de leur catégorie

Intermédiaire

Le 2 juillet 2026, Poolside AI — un labo de foundation models basé aux US qui a levé environ 2 Md$ à une valo de 12 Md$ avec la participation de NVIDIA — a livré ses premiers modèles publics : la famille Laguna. Trois modèles de code MoE, tous publiés sous la licence permissive OpenMDW-1.1, partageant un corpus de pretraining unique et différant principalement par la taille de la machine sur laquelle on les pointe. Deux semaines plus tard ils ont étendu la famille avec Laguna S 2.1, un MoE 118B/8B-actif qui bat DeepSeek-V4-Pro-Max sur DeepSWE v1.1 (40,4 % vs 9,0 %) tout en activant un sixième des paramètres, et atterrit à 78,5 % sur SWE-Bench Multilingual — le meilleur score publié sur ce leaderboard au lancement.

Cette page est le guide de terrain pratique pour la famille : ce qui rend réellement chaque taille intéressante, les deux choix de pipeline d'entraînement que la plupart des couvertures ont sautés, la photo honnête de benchmark contre les concurrents fermés de pointe et open-weight, comment les faire tourner en local aujourd'hui, et les tâches spécifiques où prendre un Laguna est le bon appel plutôt que Claude, GLM-5.2 ou Kimi K3.

What you'll learn
  • Connaître la famille en un coup d'œil — trois tailles, un corpus, une licence — et quelle taille mappe sur votre hardware
  • Comprendre pourquoi 8B paramètres actifs peuvent battre 1,6T total : routage MoE + post-training spécialisé code
  • Lire la photo honnête de benchmark à travers SWE-Bench Multilingual, Terminal-Bench 2.1, DeepSWE v1.1 et SWE-Bench Pro
  • Connaître les deux premières du pipeline d'entraînement qui façonnent le comportement du modèle — RL en FP8 et entraînement multi-harness
  • Faire tourner Laguna via OpenRouter en trois lignes, ou en local via GGUF/MLX sur un MacBook ou DGX Spark
  • Décider quand Laguna est le bon outil vs Claude Opus 5, GLM-5.2, Kimi K3 ou GPT-5.5

La famille en un coup d'œil

Trois modèles, un run de pretraining partagé, trois enveloppes hardware. C'est intentionnel : Poolside a pré-entraîné une fois et post-entraîné par taille, donc la personnalité est cohérente à travers la famille et vous choisissez une taille en fonction de la boîte que vous avez, pas de la forme de la tâche.

ModèleParams totauxParams actifsContexteHardware cibleLicence
Laguna XS 2.133B (MoE)3Bjusqu'à 256KLaptop unique / GPU MacBookOpenMDW-1.1
Laguna S 2.1118B (MoE)8Bjusqu'à 1MDGX Spark unique ou H200 en FP8OpenMDW-1.1
Laguna M.1225B (MoE)23B256K+Nœud entreprise multi-GPUOpenMDW-1.1

Les trois takeaways pratiques de ce tableau :

  • Même corpus à travers la famille. Le post-training de Laguna S 2.1 n'a ajouté aucune donnée nouvelle par-dessus celle de XS 2.1 — l'annonce S 2.1 le mentionne explicitement. Les améliorations de comportement viennent de la plus grande classe de modèle et d'une recette de post-training différente, pas de le nourrir avec de nouveaux documents. Cela signifie que la sagesse de fine-tuning transfère proprement à travers les tailles.
  • La colonne active-param est ce qui compte pour le coût d'inférence. À 8B actif, Laguna S 2.1 a le profil de calcul d'un modèle dense 8B par token, pas d'un 118B. C'est la différence entre « tourne sur un seul accélérateur » et « a besoin d'un rack ».
  • OpenMDW-1.1 est une vraie licence permissive, pas une licence source-available. Elle a été publiée par la Linux Foundation pour combler l'écart entre les licences open-source traditionnelles (qui ne couvrent pas proprement les poids et les données) et les licences vendeur « open » qui interdisent silencieusement l'usage commercial. Accorde des droits illimités et sans royalties à travers copyright, brevet, base de données et secret commercial ; les sorties sont explicitement libres.

Trois choses qui ne sont pas évidentes depuis les titres

1. RL en FP8 est un vrai déblocage d'ingénierie, pas du marketing

Le reinforcement learning pour le post-training LLM a historiquement tourné en BF16 parce que le bruit de gradient à la précision FP8 était supposé faire exploser le petit signal que le RL fournit. Poolside affirme publiquement que Laguna S 2.1 est le premier modèle à échelle de pointe entraîné avec RL en FP8. Si vrai — et aucun contre-exemple n'a fait surface au début août 2026 — cela réduit de moitié l'empreinte mémoire de l'étape RL et permet à un cluster donné de dépenser le calcul RL sur des tâches qui étaient trop chères.

La conséquence pratique pour les utilisateurs : l'étape RL de Poolside était sélective. Ils rapportent 409k environnements d'entraînement (83k terminal, 168k software-engineering), avec le SFT bootstrappant la plupart des comportements depuis des données synthétiques et le RL réservé aux problèmes de plus haute difficulté. Cela apparaît dans les deltas de benchmark — le boost du mode thinking sur DeepSWE v1.1 passe de 16,5 % → 40,4 % — qui est la forme que vous attendriez quand le RL a été dépensé étroitement sur du raisonnement dur plutôt que étalé sur chaque tâche.

2. L'entraînement multi-harness est pourquoi il ne s'écroule pas dans les agents tiers

Les modèles de code sont habituellement entraînés à l'intérieur d'un seul harness d'agent (le scaffold propre du vendeur) puis déployés dans des dizaines d'autres (Cursor, Cline, Aider, Continue, Kilo, etc.). L'écart entre harness d'entraînement et de déploiement est d'où viennent beaucoup d'échecs « le benchmark disait que ça marchait ». Poolside a entraîné Laguna à travers 83k environnements terminal et 168k environnements software-engineering couvrant plusieurs harness, ce qui est le mécanisme qu'ils créditent pour rendre le modèle utilisable hors de leur propre scaffold dès le premier jour.

Le signe visible d'un entraînement multi-harness dans le comportement rapporté de Laguna : persistance (n'abandonne pas une approche après un appel d'outil raté), vérification-d'abord (relit sa propre sortie avant de livrer), et débrouillardise (trouve des chemins alternatifs quand le direct est bloqué). Ce sont des comportements d'agent, pas des comportements de next-token — vous ne les obtenez pas de plus de données de pretraining.

Les limitations connues qui mappent directement sur ce même choix de conception valent la peine d'être notées pour ne pas être surpris :

  • Peine avec les légères variations de schéma dans les harness tiers vs celui natif de Poolside — le harness doit ressembler « suffisamment » à quelque chose dans les 409k envs d'entraînement.
  • Émet parfois du JSON incorrectement échappé dans les appels d'outils imbriqués à l'intérieur d'arrays. Rare mais réel.
  • Surréfléchit sur les problèmes de compétition de maths — le thinking étendu tourne plus longtemps que nécessaire sur les tâches type AIME. Bien pour le code, gaspilleur pour les maths.

3. Le ratio de paramètres actifs est toute l'histoire sur le coût

Le chiffre qui attrape l'œil est 1,6T vs 8B : Laguna S 2.1 bat DeepSeek-V4-Pro-Max (1,6T total) sur DeepSWE v1.1 de 31,4 points tout en activant un sixième des paramètres par token. Mais le cadrage utile est le coût d'inférence :

ModèleParams actifs / tokenCompute brut par tokenPrix API de référence*
Laguna XS 2.13B~3B dense-équivalentfree-tier / plage 0,05 $
Laguna S 2.18B~8B dense-équivalent0,10 $ in / 0,20 $ out par M (OpenRouter)
GLM-5.2~40B~40B dense-équivalent1,20-1,40 $ in / 4,10-4,40 $ out par M
Kimi K3~32B~32B dense-équivalentsimilaire à la plage GLM
Claude Opus 5 (de pointe)dense, non divulguéde pointe15 $ in / 75 $ out par M
*Prix depuis OpenRouter et agrégateurs équivalents, début août 2026 — traiter comme approximatif.

L'écart 150× par token entre S 2.1 sur OpenRouter et Claude Opus 5 n'est pas un combat équitable pour la génération de titres, mais le ratio utile est S 2.1 vs les autres modèles open-weight de pointe (GLM-5.2, Kimi K3) : Laguna est ~12× moins cher par token output, avec des scores SWE-Bench Multilingual dans la même ligue. C'est l'enveloppe de prix qui change ce qu'il est économiquement sain de confier à un modèle.

Photo de benchmark — la version honnête

Les scores rapportés au lancement de S 2.1, croisés entre le propre post de Poolside et la couverture tiers :

BenchmarkLaguna S 2.1Ce qu'il mesureNotes
SWE-Bench Multilingual78,5 %Vraies tâches de fix GitHub à travers de nombreux langagesMeilleur score open-weight publié au lancement
Terminal-Bench 2.170,2 % (thinking) / 60,4 % (non-thinking)Workflows shell longs~10 points d'uplift en mode thinking
SWE-Bench Pro (Public)59,4 %Fixes autonomes plus durs au niveau du repoModèles fermés de pointe toujours devant
DeepSWE v1.140,4 % (thinking) / 16,5 % (non-thinking)Benchmarks SWE dursBat DeepSeek-V4-Pro-Max à 9,0 % malgré ~1/200 des params actifs
SWE Atlas (Codebase QnA)46,2 %Comprendre de grands reposDevant les chiffres DeepSWE
Toolathlon Verified49,7 %Orchestration multi-outilsMilieu de peloton

Trois règles d'interprétation pour les lire :

  • SWE-Bench Multilingual et Terminal-Bench 2.1 sont les chiffres à prendre au sérieux pour un modèle de code agentique. Ils mappent sur du travail que vous assignerez réellement — « fixer ce bug dans un vrai repo », « faire passer ce workflow shell au vert ». Poolside mène les deux du côté open-weight.
  • Le fermé de pointe gagne encore sur les benchmarks les plus durs. Claude Fable 5 et Kimi K3 mènent sur SWE-Bench Pro et sur certaines tranches de Toolathlon. Ne lisez pas le lancement de Laguna comme « Anthropic est battu » — lisez-le comme « le plafond open-weight pour le code vient de monter de plusieurs points ».
  • Le mode thinking n'est pas gratuit mais c'est là que la plupart de la victoire est. Terminal-Bench 60,4 % → 70,2 %, DeepSWE 16,5 % → 40,4 %. Si vous coupez le thinking pour des raisons de coût, vous abandonnez une grosse tranche du modèle.

Faire tourner Laguna

Guided walkthrough1 of 4
  1. OpenRouter, Baseten Model Library, Vercel AI Gateway et les intégrations Kilo/Cline/Hermes ont tous offert l'accès dès le premier jour. Prix listé OpenRouter au lancement : 0,10 $ par M input, 0,20 $ par M output, avec un tier gratuit à contexte 256K pour évaluation. Endpoint chat completions compatible OpenAI — swap l'URL de base et l'ID du modèle.

Appeler Laguna S 2.1 via OpenRouter (Python)

import os, openai

client = openai.OpenAI(
  base_url="https://openrouter.ai/api/v1",
  api_key=os.environ["OPENROUTER_API_KEY"],
)

resp = client.chat.completions.create(
  model="poolside/laguna-s-2.1",
  messages=[
      {"role": "system", "content": "You are a senior engineer. Reply with a unified diff, no prose."},
      {"role": "user", "content": "Fix the off-by-one in this function:\n\ndef last_n(xs, n): return xs[-n-1:]"},
  ],
)
print(resp.choices[0].message.content)

Quand prendre Laguna vs les alternatives

La carte de décision pragmatique, étant donné le paysage de modèles au début août 2026 :

TâcheMeilleur choixPourquoi
Fix de bug long au niveau du repo, sensible au budgetLaguna S 2.1SWE-Bench Multilingual open-weight de tête, ~12× moins cher par token output que GLM-5.2 ou Kimi K3
Code agentique sur MacBook, offline requisLaguna XS 2.13B params actifs + build MLX ; rien d'autre à cette taille n'atteint un SWE-Bench Multilingual comparable
Accuracy absolue de pointe sur les tâches les plus dures, coût sans objetClaude Opus 5 ou Fable 5Fermé de pointe mène encore SWE-Bench Pro et les tranches les plus dures
Contexte 1M-token sur un repo, licence permissive nécessaireGLM-5.2 ou Laguna S 2.1Les deux offrent contexte 1M sous licences permissives ; GLM-5.2 est plus fort sur le raisonnement général, Laguna est plus fort sur le code agentique
Orchestration multi-outils où vous avez besoin de sémantique d'appel d'outils serréeClaude ou Kimi K3Le score Toolathlon milieu-de-peloton de Laguna et le cas limite JSON-escaping connu en font un défaut plus faible ici
Environnement régulé, aucune donnée ne quitte la boîteLaguna S 2.1 self-hostedOpenMDW-1.1 accorde l'usage commercial illimité, labo d'origine US ; FP8 rentre dans un accélérateur unique

Le one-liner : Laguna est le sweet spot actuel quand vous voulez un comportement de code classe pointe sur un petit budget de params actifs, et que la licence et l'origine comptent. Utilisez-le quand ces contraintes lient ; recourez à Claude ou au fermé de pointe quand elles ne lient pas.

Lectures reliées

Vérifiez votre prise

Check yourself

0/4
  1. Laguna S 2.1 a 118B paramètres totaux mais seulement 8B actifs par token. Quel modèle bat-il sur DeepSWE v1.1 malgré une activation d'environ un sixième des paramètres ?
  2. Pourquoi le même pretrain 4 096-H200 se fait post-entraîner de trois façons différentes pour XS 2.1, S 2.1 et M.1 — plutôt que de servir le plus gros checkpoint partout ?
  3. Vous devez fixer un bug dans un dépôt de 200 fichiers et le coût compte. Les chiffres Terminal-Bench 2.1 comptent. Quel est le choix le plus défendable parmi ceux-ci, en supposant que vous n'avez pas besoin d'accuracy de pointe ?
  4. Laquelle de celles-ci est un vrai mode d'échec documenté de Laguna S 2.1 qui compte pour l'usage en production ?

Sources & lectures complémentaires