Passa al contenuto principale

Poolside Laguna: modelli di coding open-weight che colpiscono sopra la loro categoria

Intermedio

Il 2 luglio 2026, Poolside AI — laboratorio statunitense di foundation model che ha raccolto circa 2 miliardi di dollari con una valutazione da 12 miliardi e la partecipazione di NVIDIA — ha rilasciato i suoi primi modelli pubblici: la famiglia Laguna. Tre modelli MoE per coding, tutti pubblicati con la licenza permissiva OpenMDW-1.1, che condividono lo stesso corpus di pretraining e differiscono soprattutto per la dimensione della macchina su cui puntarli. Due settimane dopo, la famiglia è stata estesa con Laguna S 2.1, un MoE 118B/8B attivi che batte DeepSeek-V4-Pro-Max su DeepSWE v1.1 (40,4% contro 9,0%) attivando un sesto dei parametri, e ottiene 78,5% su SWE-Bench Multilingual — il punteggio pubblicato più alto della leaderboard al momento del lancio.

Questa pagina è la guida pratica sul campo alla famiglia: cosa rende davvero interessante ciascuna taglia, le due scelte della pipeline di training che la maggior parte della copertura ha ignorato, il quadro onesto dei benchmark rispetto ai concorrenti frontier chiusi e open-weight, come farlo girare in locale oggi, e i compiti specifici in cui scegliere un Laguna è la scelta giusta rispetto a Claude, GLM-5.2 o Kimi K3.

What you'll learn
  • Conoscere la famiglia a colpo d'occhio — tre taglie, un corpus, una licenza — e quale taglia corrisponde al tuo hardware
  • Capire perché 8B parametri attivi possono battere 1,6T totali: routing MoE + post-training specializzato per il coding
  • Leggere il quadro onesto dei benchmark su SWE-Bench Multilingual, Terminal-Bench 2.1, DeepSWE v1.1 e SWE-Bench Pro
  • Conoscere le due primizie di pipeline di training che modellano il comportamento del modello — RL in FP8 e training multi-harness
  • Far girare Laguna via OpenRouter in tre righe, o in locale via GGUF/MLX su un MacBook o DGX Spark
  • Decidere quando Laguna è lo strumento giusto rispetto a Claude Opus 5, GLM-5.2, Kimi K3 o GPT-5.5

La famiglia a colpo d'occhio

Tre modelli, un unico run di pretraining condiviso, tre profili hardware. È voluto: Poolside ha pretrainato una volta sola e post-trainato per taglia, quindi la personalità è coerente nell'intera famiglia e la taglia si sceglie in base alla macchina che hai, non alla forma del task.

ModelloParametri totaliParametri attiviContestoHardware targetLicenza
Laguna XS 2.133B (MoE)3Bfino a 256KLaptop singolo / GPU MacBookOpenMDW-1.1
Laguna S 2.1118B (MoE)8Bfino a 1MSingolo DGX Spark o H200 in FP8OpenMDW-1.1
Laguna M.1225B (MoE)23B256K+Nodo enterprise multi-GPUOpenMDW-1.1

Le tre conclusioni pratiche da questa tabella:

  • Stesso corpus in tutta la famiglia. Il post-training di Laguna S 2.1 non ha aggiunto nuovi dati rispetto a XS 2.1 — l'annuncio di S 2.1 lo dice esplicitamente. I miglioramenti comportamentali derivano dalla classe di modello più grande e da una diversa ricetta di post-training, non dall'averlo alimentato con nuovi documenti. Questo significa che le lezioni di fine-tuning si trasferiscono in modo pulito tra le taglie.
  • La colonna dei parametri attivi è ciò che conta per il costo di inferenza. Con 8B attivi, Laguna S 2.1 ha il profilo computazionale di un modello dense da 8B per token, non di uno da 118B. È la differenza tra "gira su un singolo acceleratore" e "richiede un rack".
  • OpenMDW-1.1 è una vera licenza permissiva, non source-available. È stata pubblicata dalla Linux Foundation per colmare il divario tra le licenze open source tradizionali (che non coprono in modo pulito pesi e dati) e le licenze "open" dei vendor che vietano di nascosto l'uso commerciale. Concede diritti illimitati e royalty-free su copyright, brevetti, database e segreti industriali; gli output sono esplicitamente liberi da vincoli.

Tre cose che non sono ovvie dai titoli

1. RL in FP8 è una vera conquista ingegneristica, non marketing

Il reinforcement learning per il post-training degli LLM è storicamente stato eseguito in BF16 perché si presumeva che il rumore dei gradienti alla precisione FP8 facesse esplodere il minuscolo segnale fornito dall'RL. Poolside dichiara pubblicamente che Laguna S 2.1 è il primo modello frontier-scale addestrato con RL in FP8. Se vero — e nessun controesempio è emerso all'inizio di agosto 2026 — questo dimezza il footprint di memoria della fase RL e permette a un dato cluster di spendere compute RL su compiti che prima erano troppo costosi.

La conseguenza pratica per gli utenti: la fase RL di Poolside è stata selettiva. Riportano 409k ambienti di training (83k terminal, 168k software engineering), con SFT che fa da bootstrap alla maggior parte dei comportamenti da dati sintetici e RL riservato ai problemi a più alta difficoltà. Si vede nei delta dei benchmark — il boost della modalità thinking su DeepSWE v1.1 passa da 16,5% → 40,4% — che è la forma che ti aspetti quando l'RL è stato speso in modo mirato sul ragionamento difficile invece che spalmato su ogni task.

2. Il training multi-harness è il motivo per cui non crolla dentro agent di terze parti

I modelli di coding vengono di solito addestrati dentro un singolo agent harness (lo scaffold proprietario del vendor) e poi deployati dentro dozzine di altri (Cursor, Cline, Aider, Continue, Kilo, ecc.). Il divario tra harness di training e di deployment è la fonte di molti fallimenti del tipo "il benchmark diceva che funzionava". Poolside ha addestrato Laguna su 83k ambienti terminal e 168k ambienti software engineering che coprono più harness, ed è il meccanismo a cui attribuiscono l'usabilità del modello fuori dal loro scaffold sin dal primo giorno.

Il segnale visibile del training multi-harness nel comportamento riportato di Laguna: persistenza (non abbandona un approccio dopo un tool call fallito), verification-first (rilegge il proprio output prima di consegnarlo), e intraprendenza (trova percorsi alternativi quando quello diretto è bloccato). Sono comportamenti da agent, non da next-token — non li ottieni con più dati di pretraining.

I limiti noti che si ricollegano direttamente a questa stessa scelta di design vale la pena notarli per non essere colti di sorpresa:

  • Fatica con leggere variazioni di schema in harness di terze parti rispetto a quello nativo di Poolside — l'harness deve sembrare "abbastanza vicino" a qualcosa dei 409k env di training.
  • A volte emette JSON con escape errato in tool call annidati dentro array. Raro ma reale.
  • Sovra-pensa i problemi di gare di matematica — il thinking esteso dura più del necessario su task in stile AIME. Va bene per il coding, spreco per la matematica.

3. Il rapporto di parametri attivi è tutta la storia sul costo

Il numero che cattura l'occhio è 1,6T contro 8B: Laguna S 2.1 batte DeepSeek-V4-Pro-Max (1,6T totali) su DeepSWE v1.1 di 31,4 punti attivando un sesto dei parametri per token. Ma l'inquadramento utile è il costo di inferenza:

ModelloParametri attivi / tokenCompute per-token approssimativoPrezzo API di riferimento*
Laguna XS 2.13B~equivalente dense da 3Bfree-tier / fascia $0.05
Laguna S 2.18B~equivalente dense da 8B$0.10 in / $0.20 out per M (OpenRouter)
GLM-5.2~40B~equivalente dense da 40B$1.20-1.40 in / $4.10-4.40 out per M
Kimi K3~32B~equivalente dense da 32Bsimile alla fascia GLM
Claude Opus 5 (frontier)dense, non dichiaratofrontier$15 in / $75 out per M
*Prezzi da OpenRouter e aggregatori equivalenti, inizio agosto 2026 — trattali come approssimativi.

Il divario 150× per token tra S 2.1 su OpenRouter e Claude Opus 5 non è un confronto ad armi pari per generare titoli, ma il rapporto utile è S 2.1 contro gli altri modelli frontier open-weight (GLM-5.2, Kimi K3): Laguna è ~12× più economico per token di output, con punteggi SWE-Bench Multilingual nella stessa categoria. È l'ordine di prezzo che cambia quale lavoro è economicamente sensato affidare a un modello.

Quadro dei benchmark — la versione onesta

I punteggi riportati al lancio di S 2.1, incrociati tra il post di Poolside e la copertura di terze parti:

BenchmarkLaguna S 2.1Cosa misuraNote
SWE-Bench Multilingual78,5%Task reali di fix da GitHub su molte lingueMiglior punteggio open-weight pubblicato al lancio
Terminal-Bench 2.170,2% (thinking) / 60,4% (non-thinking)Workflow shell lunghi~10 punti di uplift dalla modalità thinking
SWE-Bench Pro (Public)59,4%Fix repo-level autonomi più difficiliModelli frontier chiusi ancora avanti
DeepSWE v1.140,4% (thinking) / 16,5% (non-thinking)Benchmark SWE difficiliBatte DeepSeek-V4-Pro-Max al 9,0% nonostante ~1/200 dei parametri attivi
SWE Atlas (Codebase QnA)46,2%Capire repo di grandi dimensioniDavanti ai numeri di DeepSWE
Toolathlon Verified49,7%Orchestrazione multi-toolA metà classifica

Tre regole interpretative per leggere questi numeri:

  • SWE-Bench Multilingual e Terminal-Bench 2.1 sono i numeri da prendere sul serio per un modello di coding agentic. Mappano lavoro che assegneresti davvero — "fixa questo bug in un repo reale", "porta questo workflow shell a green". Poolside è in testa su entrambi lato open-weight.
  • Il frontier chiuso vince ancora sui benchmark più difficili. Claude Fable 5 e Kimi K3 sono in testa su SWE-Bench Pro e su alcune fette di Toolathlon. Non leggere il lancio di Laguna come "Anthropic è battuta" — leggilo come "il tetto open-weight per il coding si è appena alzato di diversi punti".
  • La modalità thinking non è gratis ma è dove sta la maggior parte del guadagno. Terminal-Bench 60,4% → 70,2%, DeepSWE 16,5% → 40,4%. Se disattivi il thinking per motivi di costo, stai rinunciando a una grossa fetta del modello.

Far girare Laguna

Guided walkthrough1 of 4
  1. OpenRouter, Baseten Model Library, Vercel AI Gateway e le integrazioni Kilo/Cline/Hermes hanno tutti offerto accesso dal primo giorno. Prezzo di listino OpenRouter al lancio: $0.10 per M input, $0.20 per M output, con un tier gratuito a 256K di contesto per valutazione. Endpoint chat completions compatibile OpenAI — cambia base URL e model ID.

Chiamare Laguna S 2.1 via OpenRouter (Python)

import os, openai

client = openai.OpenAI(
  base_url="https://openrouter.ai/api/v1",
  api_key=os.environ["OPENROUTER_API_KEY"],
)

resp = client.chat.completions.create(
  model="poolside/laguna-s-2.1",
  messages=[
      {"role": "system", "content": "You are a senior engineer. Reply with a unified diff, no prose."},
      {"role": "user", "content": "Fix the off-by-one in this function:\n\ndef last_n(xs, n): return xs[-n-1:]"},
  ],
)
print(resp.choices[0].message.content)

Quando scegliere Laguna rispetto alle alternative

La mappa decisionale pragmatica, dato il panorama dei modelli all'inizio di agosto 2026:

TaskScelta migliorePerché
Fix di bug repo-level long-horizon, sensibile al budgetLaguna S 2.1Miglior SWE-Bench Multilingual open-weight, ~12× più economico per token di output di GLM-5.2 o Kimi K3
Coding agentic su un MacBook, offline richiestoLaguna XS 2.13B parametri attivi + build MLX; niente altro a questa taglia raggiunge un SWE-Bench Multilingual comparabile
Accuratezza frontier assoluta sui task più difficili, costo non è un problemaClaude Opus 5 o Fable 5Il frontier chiuso è ancora in testa su SWE-Bench Pro e sulle fette più difficili
Contesto da 1M token su un repo, serve licenza permissivaGLM-5.2 o Laguna S 2.1Entrambi offrono 1M di contesto sotto licenze permissive; GLM-5.2 è più forte sul ragionamento generale, Laguna è più forte sul coding agentic
Orchestrazione multi-tool dove servono semantiche di tool call molto stretteClaude o Kimi K3Il punteggio Toolathlon a metà classifica di Laguna e il noto edge case sull'escape JSON ne fanno un default più debole qui
Ambiente regolamentato, nessun dato che esce dalla scatolaLaguna S 2.1 self-hostedOpenMDW-1.1 concede uso commerciale illimitato, lab di origine USA; FP8 entra in un singolo acceleratore

La sintesi in una riga: Laguna è oggi il sweet spot quando vuoi comportamento di coding frontier-class su un budget contenuto di parametri attivi, e licenza e origine contano. Usalo quando questi vincoli sono stringenti; rivolgiti a Claude o al frontier chiuso quando non lo sono.

Letture correlate

Verifica la tua padronanza

Check yourself

0/4
  1. Laguna S 2.1 ha 118B parametri totali ma solo 8B attivi per token. Quale modello batte su DeepSWE v1.1 nonostante attivi circa un sesto dei parametri?
  2. Perché lo stesso pretrain su 4.096 H200 viene post-trainato in tre modi diversi per XS 2.1, S 2.1 e M.1 — invece di servire ovunque solo il checkpoint più grande?
  3. Devi fixare un bug in un repository da 200 file e il costo conta. I numeri di Terminal-Bench 2.1 contano. Qual è la scelta più difendibile tra queste, assumendo che tu non abbia bisogno di accuratezza frontier?
  4. Quale di queste è una modalità di fallimento reale e documentata di Laguna S 2.1 che ha rilievo per l'uso in produzione?

Fonti e ulteriori letture