Poolside Laguna: modelli di coding open-weight che colpiscono sopra la loro categoria
Il 2 luglio 2026, Poolside AI — laboratorio statunitense di foundation model che ha raccolto circa 2 miliardi di dollari con una valutazione da 12 miliardi e la partecipazione di NVIDIA — ha rilasciato i suoi primi modelli pubblici: la famiglia Laguna. Tre modelli MoE per coding, tutti pubblicati con la licenza permissiva OpenMDW-1.1, che condividono lo stesso corpus di pretraining e differiscono soprattutto per la dimensione della macchina su cui puntarli. Due settimane dopo, la famiglia è stata estesa con Laguna S 2.1, un MoE 118B/8B attivi che batte DeepSeek-V4-Pro-Max su DeepSWE v1.1 (40,4% contro 9,0%) attivando un sesto dei parametri, e ottiene 78,5% su SWE-Bench Multilingual — il punteggio pubblicato più alto della leaderboard al momento del lancio.
Questa pagina è la guida pratica sul campo alla famiglia: cosa rende davvero interessante ciascuna taglia, le due scelte della pipeline di training che la maggior parte della copertura ha ignorato, il quadro onesto dei benchmark rispetto ai concorrenti frontier chiusi e open-weight, come farlo girare in locale oggi, e i compiti specifici in cui scegliere un Laguna è la scelta giusta rispetto a Claude, GLM-5.2 o Kimi K3.
- Conoscere la famiglia a colpo d'occhio — tre taglie, un corpus, una licenza — e quale taglia corrisponde al tuo hardware
- Capire perché 8B parametri attivi possono battere 1,6T totali: routing MoE + post-training specializzato per il coding
- Leggere il quadro onesto dei benchmark su SWE-Bench Multilingual, Terminal-Bench 2.1, DeepSWE v1.1 e SWE-Bench Pro
- Conoscere le due primizie di pipeline di training che modellano il comportamento del modello — RL in FP8 e training multi-harness
- Far girare Laguna via OpenRouter in tre righe, o in locale via GGUF/MLX su un MacBook o DGX Spark
- Decidere quando Laguna è lo strumento giusto rispetto a Claude Opus 5, GLM-5.2, Kimi K3 o GPT-5.5
La famiglia a colpo d'occhio
Tre modelli, un unico run di pretraining condiviso, tre profili hardware. È voluto: Poolside ha pretrainato una volta sola e post-trainato per taglia, quindi la personalità è coerente nell'intera famiglia e la taglia si sceglie in base alla macchina che hai, non alla forma del task.
| Modello | Parametri totali | Parametri attivi | Contesto | Hardware target | Licenza |
|---|---|---|---|---|---|
| Laguna XS 2.1 | 33B (MoE) | 3B | fino a 256K | Laptop singolo / GPU MacBook | OpenMDW-1.1 |
| Laguna S 2.1 | 118B (MoE) | 8B | fino a 1M | Singolo DGX Spark o H200 in FP8 | OpenMDW-1.1 |
| Laguna M.1 | 225B (MoE) | 23B | 256K+ | Nodo enterprise multi-GPU | OpenMDW-1.1 |
Le tre conclusioni pratiche da questa tabella:
- Stesso corpus in tutta la famiglia. Il post-training di Laguna S 2.1 non ha aggiunto nuovi dati rispetto a XS 2.1 — l'annuncio di S 2.1 lo dice esplicitamente. I miglioramenti comportamentali derivano dalla classe di modello più grande e da una diversa ricetta di post-training, non dall'averlo alimentato con nuovi documenti. Questo significa che le lezioni di fine-tuning si trasferiscono in modo pulito tra le taglie.
- La colonna dei parametri attivi è ciò che conta per il costo di inferenza. Con 8B attivi, Laguna S 2.1 ha il profilo computazionale di un modello dense da 8B per token, non di uno da 118B. È la differenza tra "gira su un singolo acceleratore" e "richiede un rack".
- OpenMDW-1.1 è una vera licenza permissiva, non source-available. È stata pubblicata dalla Linux Foundation per colmare il divario tra le licenze open source tradizionali (che non coprono in modo pulito pesi e dati) e le licenze "open" dei vendor che vietano di nascosto l'uso commerciale. Concede diritti illimitati e royalty-free su copyright, brevetti, database e segreti industriali; gli output sono esplicitamente liberi da vincoli.
Tre cose che non sono ovvie dai titoli
1. RL in FP8 è una vera conquista ingegneristica, non marketing
Il reinforcement learning per il post-training degli LLM è storicamente stato eseguito in BF16 perché si presumeva che il rumore dei gradienti alla precisione FP8 facesse esplodere il minuscolo segnale fornito dall'RL. Poolside dichiara pubblicamente che Laguna S 2.1 è il primo modello frontier-scale addestrato con RL in FP8. Se vero — e nessun controesempio è emerso all'inizio di agosto 2026 — questo dimezza il footprint di memoria della fase RL e permette a un dato cluster di spendere compute RL su compiti che prima erano troppo costosi.
La conseguenza pratica per gli utenti: la fase RL di Poolside è stata selettiva. Riportano 409k ambienti di training (83k terminal, 168k software engineering), con SFT che fa da bootstrap alla maggior parte dei comportamenti da dati sintetici e RL riservato ai problemi a più alta difficoltà. Si vede nei delta dei benchmark — il boost della modalità thinking su DeepSWE v1.1 passa da 16,5% → 40,4% — che è la forma che ti aspetti quando l'RL è stato speso in modo mirato sul ragionamento difficile invece che spalmato su ogni task.
2. Il training multi-harness è il motivo per cui non crolla dentro agent di terze parti
I modelli di coding vengono di solito addestrati dentro un singolo agent harness (lo scaffold proprietario del vendor) e poi deployati dentro dozzine di altri (Cursor, Cline, Aider, Continue, Kilo, ecc.). Il divario tra harness di training e di deployment è la fonte di molti fallimenti del tipo "il benchmark diceva che funzionava". Poolside ha addestrato Laguna su 83k ambienti terminal e 168k ambienti software engineering che coprono più harness, ed è il meccanismo a cui attribuiscono l'usabilità del modello fuori dal loro scaffold sin dal primo giorno.
Il segnale visibile del training multi-harness nel comportamento riportato di Laguna: persistenza (non abbandona un approccio dopo un tool call fallito), verification-first (rilegge il proprio output prima di consegnarlo), e intraprendenza (trova percorsi alternativi quando quello diretto è bloccato). Sono comportamenti da agent, non da next-token — non li ottieni con più dati di pretraining.
I limiti noti che si ricollegano direttamente a questa stessa scelta di design vale la pena notarli per non essere colti di sorpresa:
- Fatica con leggere variazioni di schema in harness di terze parti rispetto a quello nativo di Poolside — l'harness deve sembrare "abbastanza vicino" a qualcosa dei 409k env di training.
- A volte emette JSON con escape errato in tool call annidati dentro array. Raro ma reale.
- Sovra-pensa i problemi di gare di matematica — il thinking esteso dura più del necessario su task in stile AIME. Va bene per il coding, spreco per la matematica.
3. Il rapporto di parametri attivi è tutta la storia sul costo
Il numero che cattura l'occhio è 1,6T contro 8B: Laguna S 2.1 batte DeepSeek-V4-Pro-Max (1,6T totali) su DeepSWE v1.1 di 31,4 punti attivando un sesto dei parametri per token. Ma l'inquadramento utile è il costo di inferenza:
| Modello | Parametri attivi / token | Compute per-token approssimativo | Prezzo API di riferimento* |
|---|---|---|---|
| Laguna XS 2.1 | 3B | ~equivalente dense da 3B | free-tier / fascia $0.05 |
| Laguna S 2.1 | 8B | ~equivalente dense da 8B | $0.10 in / $0.20 out per M (OpenRouter) |
| GLM-5.2 | ~40B | ~equivalente dense da 40B | $1.20-1.40 in / $4.10-4.40 out per M |
| Kimi K3 | ~32B | ~equivalente dense da 32B | simile alla fascia GLM |
| Claude Opus 5 (frontier) | dense, non dichiarato | frontier | $15 in / $75 out per M |
Il divario 150× per token tra S 2.1 su OpenRouter e Claude Opus 5 non è un confronto ad armi pari per generare titoli, ma il rapporto utile è S 2.1 contro gli altri modelli frontier open-weight (GLM-5.2, Kimi K3): Laguna è ~12× più economico per token di output, con punteggi SWE-Bench Multilingual nella stessa categoria. È l'ordine di prezzo che cambia quale lavoro è economicamente sensato affidare a un modello.
Quadro dei benchmark — la versione onesta
I punteggi riportati al lancio di S 2.1, incrociati tra il post di Poolside e la copertura di terze parti:
| Benchmark | Laguna S 2.1 | Cosa misura | Note |
|---|---|---|---|
| SWE-Bench Multilingual | 78,5% | Task reali di fix da GitHub su molte lingue | Miglior punteggio open-weight pubblicato al lancio |
| Terminal-Bench 2.1 | 70,2% (thinking) / 60,4% (non-thinking) | Workflow shell lunghi | ~10 punti di uplift dalla modalità thinking |
| SWE-Bench Pro (Public) | 59,4% | Fix repo-level autonomi più difficili | Modelli frontier chiusi ancora avanti |
| DeepSWE v1.1 | 40,4% (thinking) / 16,5% (non-thinking) | Benchmark SWE difficili | Batte DeepSeek-V4-Pro-Max al 9,0% nonostante ~1/200 dei parametri attivi |
| SWE Atlas (Codebase QnA) | 46,2% | Capire repo di grandi dimensioni | Davanti ai numeri di DeepSWE |
| Toolathlon Verified | 49,7% | Orchestrazione multi-tool | A metà classifica |
Tre regole interpretative per leggere questi numeri:
- SWE-Bench Multilingual e Terminal-Bench 2.1 sono i numeri da prendere sul serio per un modello di coding agentic. Mappano lavoro che assegneresti davvero — "fixa questo bug in un repo reale", "porta questo workflow shell a green". Poolside è in testa su entrambi lato open-weight.
- Il frontier chiuso vince ancora sui benchmark più difficili. Claude Fable 5 e Kimi K3 sono in testa su SWE-Bench Pro e su alcune fette di Toolathlon. Non leggere il lancio di Laguna come "Anthropic è battuta" — leggilo come "il tetto open-weight per il coding si è appena alzato di diversi punti".
- La modalità thinking non è gratis ma è dove sta la maggior parte del guadagno. Terminal-Bench 60,4% → 70,2%, DeepSWE 16,5% → 40,4%. Se disattivi il thinking per motivi di costo, stai rinunciando a una grossa fetta del modello.
Far girare Laguna
- OpenRouter, Baseten Model Library, Vercel AI Gateway e le integrazioni Kilo/Cline/Hermes hanno tutti offerto accesso dal primo giorno. Prezzo di listino OpenRouter al lancio: $0.10 per M input, $0.20 per M output, con un tier gratuito a 256K di contesto per valutazione. Endpoint chat completions compatibile OpenAI — cambia base URL e model ID.
- XS 2.1 (33B/3B MoE) ha conversioni GGUF e MLX. Su un MacBook da 32-64GB gira a velocità utilizzabili sotto llama.cpp o MLX. È la taglia da usare quando vuoi un assistente di coding che non lascia mai il laptop.
- Footprint di memoria per precisione: BF16 ~236GB (richiede 2 Spark o un nodo multi-GPU), FP8 ~118GB (singolo Spark o H200), INT4 ~59GB (entra comodamente nei 128GB di memoria unificata di un singolo Spark). vLLM, SGLang e Ollama tutti supportati al lancio. Pesi NVFP4 pubblicati anche per le componenti NVIDIA più recenti.
- chat.poolside.ai serve la famiglia senza autenticazione per valutazione interattiva. Usalo per costruirti una sensazione di massima prima di collegarlo dentro un agent.
Chiamare Laguna S 2.1 via OpenRouter (Python)
import os, openai
client = openai.OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
resp = client.chat.completions.create(
model="poolside/laguna-s-2.1",
messages=[
{"role": "system", "content": "You are a senior engineer. Reply with a unified diff, no prose."},
{"role": "user", "content": "Fix the off-by-one in this function:\n\ndef last_n(xs, n): return xs[-n-1:]"},
],
)
print(resp.choices[0].message.content)Quando scegliere Laguna rispetto alle alternative
La mappa decisionale pragmatica, dato il panorama dei modelli all'inizio di agosto 2026:
| Task | Scelta migliore | Perché |
|---|---|---|
| Fix di bug repo-level long-horizon, sensibile al budget | Laguna S 2.1 | Miglior SWE-Bench Multilingual open-weight, ~12× più economico per token di output di GLM-5.2 o Kimi K3 |
| Coding agentic su un MacBook, offline richiesto | Laguna XS 2.1 | 3B parametri attivi + build MLX; niente altro a questa taglia raggiunge un SWE-Bench Multilingual comparabile |
| Accuratezza frontier assoluta sui task più difficili, costo non è un problema | Claude Opus 5 o Fable 5 | Il frontier chiuso è ancora in testa su SWE-Bench Pro e sulle fette più difficili |
| Contesto da 1M token su un repo, serve licenza permissiva | GLM-5.2 o Laguna S 2.1 | Entrambi offrono 1M di contesto sotto licenze permissive; GLM-5.2 è più forte sul ragionamento generale, Laguna è più forte sul coding agentic |
| Orchestrazione multi-tool dove servono semantiche di tool call molto strette | Claude o Kimi K3 | Il punteggio Toolathlon a metà classifica di Laguna e il noto edge case sull'escape JSON ne fanno un default più debole qui |
| Ambiente regolamentato, nessun dato che esce dalla scatola | Laguna S 2.1 self-hosted | OpenMDW-1.1 concede uso commerciale illimitato, lab di origine USA; FP8 entra in un singolo acceleratore |
La sintesi in una riga: Laguna è oggi il sweet spot quando vuoi comportamento di coding frontier-class su un budget contenuto di parametri attivi, e licenza e origine contano. Usalo quando questi vincoli sono stringenti; rivolgiti a Claude o al frontier chiuso quando non lo sono.
Letture correlate
- GLM-5.2: modello di coding open-weight frontier — il punto di confronto diretto sull'altro leader open-weight; trucco architetturale diverso (IndexShare) per lo stesso obiettivo di contesto 1M.
- Kimi K3 Open-Weight Frontier — l'altro grande modello di coding frontier open-weight, parametri più densi, diverso envelope comportamentale.
- DeepSeek & Qwen: playbook dei modelli open — background sul panorama del coding open-weight con cui Laguna compete.
- Far girare i modelli in locale con Ollama — il runtime locale che userai per XS 2.1.
- Agent di coding locali — dove XS 2.1 si inserisce nella storia degli agent locali.
- AI Gateway: LiteLLM, OpenRouter, Portkey — come sostituire Laguna in uno stack esistente OpenAI-compatibile.
- Quanto costa l'AI tra i vari provider — la vista prezzo-per-task che rende visibile il rapporto di Laguna.
Verifica la tua padronanza
Check yourself
0/4Fonti e ulteriori letture
- Introducing Laguna S 2.1 — Poolside — il post di lancio con pipeline di training, tabella dei benchmark e opzioni di inferenza.
- Poolside AI Launches Open-Weight 'Laguna' Coding Models — Open Source For You — panoramica della famiglia con specifiche di XS 2.1 e M.1.
- American AI startup Poolside launches free, high-performing open model Laguna XS.2 — VentureBeat — la copertura del lancio del 2 luglio per la famiglia iniziale.
- Poolside drops Laguna S 2.1, an open-weight coding model that beats rivals 10x its size — VentureBeat — analisi post-lancio della posizione comparativa di S 2.1.
- Poolside Releases Laguna S 2.1 — MarkTechPost — cross-check di architettura e benchmark.
- Laguna XS 2.1 review — explainx.ai — impressioni pratiche e note hardware.
- Licenza OpenMDW — Linux Foundation — la licenza sotto cui vengono rilasciati tutti e tre i modelli Laguna.