Muse Code + Muse Spark 1.2: l'agente di coding da terminale di Meta
Il 5 agosto 2026 Meta Superintelligence Labs ha rilasciato Muse Code — un agente di coding da terminale — assieme a Muse Spark 1.2, il modello co-addestrato con esso. Due prodotti, un unico rilascio, e l'accoppiata è la parte interessante: Meta sostiene che strumenti addestrati insieme al modello producono meno retry e output di qualità più alta rispetto a un modello generico guidato da un harness generico. Che tu ci creda o meno, il lancio merita una lettura attenta — Muse Code è l'analogo strutturale più vicino a Claude Code che un competitor abbia mai spedito, e alcune sue scelte di design (l'event log append-only, il pricing del tier contributor, le tre skill incluse) sono abbastanza non ovvie da valere la pena di essere rubate a prescindere dall'agente che usi davvero ogni giorno.
Questa pagina è la lettura pratica: cos'è davvero Muse Code, come si confronta con Claude Code sui numeri che Meta stessa ha pubblicato, la trappola nel pricing che si nota alla seconda lettura della tabella dei prezzi, e dove si colloca nel tour di AILmanac.
- Capire cos'è Muse Code a livello architetturale: un agente da terminale con un event log locale append-only, agenti async persistenti in background e tre skill incluse (/plan, /grill, /goal)
- Leggere correttamente i numeri di Terminal-Bench 2.1 e DeepSWE 1.1 — inclusa la cautela vendor-run che la stessa recensione della fonte segnala
- Conoscere i tier di prezzo: $1,25/$4,25 standard vs. $0,10/$0,20 contributor, e cosa ti costa davvero lo sconto 12,5×/21,25× in termini di dati
- Ottenere il comando di installazione, le piattaforme supportate e le cautele sullo stato beta prima di puntarlo su qualcosa di sensibile
- Collocare Muse Code accanto a Claude Code, Codex CLI e al resto del panorama delle CLI di coding-agent
La versione in una frase
Muse Code è un agente di coding da terminale in beta per macOS e Linux, alimentato da Muse Spark 1.2 — un modello multimodale in input, text-only in output, con contesto da 1M token — con agenti async in background, un event log locale append-only per il resume crash-safe e tre skill incluse (/plan, /grill, /goal); Meta prezza il tier standard a $1,25/M input e $4,25/M output, e offre un tier contributor a $0,10/M input e $0,20/M output in cambio del permesso di addestrare i futuri modelli Meta sui tuoi prompt e sulle tue completion.
Quattro cose non ovvie dagli headline di lancio
1. L'event log è un write-ahead log, ed è ciò che rende sicure le run lunghe
Il runtime di Muse Code registra ogni chiamata al modello, ogni esecuzione di tool, ogni approvazione e ogni edit su un event log locale append-only prima di eseguirli. Meta lo descrive come "replay-exact e restart-safe". Se l'agente crasha a metà task — segfault, chiusura del laptop, token scaduto, qualsiasi cosa — riprendi dal log senza perdere lavoro e senza dover ri-promptare il modello per ricostruire lo stato.
È un pattern write-ahead log preso dall'ingegneria dei database, applicato all'harness invece che al livello di storage. Ne conseguono due cose che vale la pena interiorizzare:
- I fallimenti durante run di 24 ore diventano recuperabili invece che costosi. Il case study di Meta sull'ottimizzazione di un kernel ha eseguito 1.000+ chiamate a tool nell'arco di 24 ore su GPU NVIDIA Hopper. Senza un log durevole, un crash all'ora 22 costa l'intera run. Con esso, il modello riprende dall'ultimo evento committato.
- L'auditing a posteriori è banale. Ogni decisione è su disco, in ordine, con input e output dei tool. Puoi ispezionare cosa pensava l'agente, perché ha chiamato un tool specifico e cosa gli è tornato — senza strumentare nulla.
Il pattern comparabile in Claude Code è checkpoint e rewind, che fa snapshot del workspace così puoi tornare indietro attraverso gli edit interattivi. L'event log di Muse Code è uno strumento diverso per un problema diverso: rewind serve a te per fare undo, mentre l'event log serve all'agente per riprendere.
2. Il tier contributor è uno sconto 12,5× / 21,25×, e non è gratis
Due tier di prezzo, dichiarati pubblicamente:
| Tier | Input ($/M) | Cached input ($/M) | Output ($/M) | Cosa cedi |
|---|---|---|---|---|
| Standard | $1,25 | $0,15 | $4,25 | Niente |
| Contributor | $0,10 | — | $0,20 | Permesso di addestrare i futuri modelli Meta sui tuoi prompt e sulle tue completion |
La matematica dello sconto: 12,5× più economico in input, 21,25× più economico in output. Per una vera sessione di coding che legge più di quanto scrive, il calo di costo effettivo si assesta intorno al 15×.
Il trucco non è che Meta guarderà i tuoi prompt (tutti i vendor frontier loggano per abuse review di default). Il trucco sono i diritti di training — Meta si riserva esplicitamente il permesso di addestrare i modelli futuri sui tuoi input e sulle tue completion. Il che significa:
- Qualsiasi cosa che potrebbe far trapelare segreti industriali, PII, codice sotto licenza o dati di un cliente attraverso l'output di un modello futuro è fuori dai giochi.
- Qualsiasi cosa sotto una licenza share-alike o simili di tipo restrittivo che non possiedi è fuori dai giochi.
- Qualsiasi cosa coperta da un NDA è fuori dai giochi.
Leggi i termini esatti di Meta prima di flippare l'interruttore — le recensioni della fonte sono chiare nel dire "conferma i termini esatti e le impostazioni del toggle nella documentazione ufficiale di Meta prima di eseguirlo su qualcosa di sensibile". Uno sconto del 12,5× sui progetti personali è un affare davvero buono. Uno sconto del 12,5× sul monorepo del tuo datore di lavoro è un problema legale che aspetta solo di succedere.
3. I grafici di Meta collocano Muse Spark 1.2 secondo, dietro Claude Opus 5
Meta ha pubblicato confronti su Terminal-Bench 2.1 e DeepSWE 1.1 che mettono Muse Spark 1.2 dietro Claude Opus 5 su entrambi. È un grafico di lancio insolitamente onesto, e va letto con precisione più che con sufficienza.
| Benchmark | Muse Spark 1.2 | Claude Opus 5 (in coppia con Claude Code) |
|---|---|---|
| Terminal-Bench 2.1 | 82,9% | Più alto — Meta lo mette primo (fonti esterne di seconda mano citano ~86,7%) |
| DeepSWE 1.1 | 59,3% | Più alto — Meta lo mette primo (punteggio non pubblicato nelle recensioni che abbiamo potuto verificare) |
Due cautele prima di prendere quei numeri come vangelo:
- Metodologia vendor-run. I numeri pubblicati sono pass@1 mediato su cinque tentativi, ciascun modello accoppiato al proprio agente-prodotto, e Meta stessa nota che il suo setup "potrebbe non essere ottimizzato per modelli di terze parti". Tutti i numeri sono vendor-run, non riproduzioni indipendenti.
- L'unità di misura è modello+harness. Terminal-Bench non valuta un modello nudo — valuta un modello che lavora attraverso un agente. Muse Spark 1.2 è valutato dentro Muse Code; Opus 5 dentro Claude Code. Il risultato è una claim sull'accoppiata, non sul modello in isolamento. Cambia una delle due metà e cambia il numero.
La lettura pratica: Muse Spark 1.2 è un solido secondo sui due benchmark che Meta ha scelto di pubblicare, nell'harness per cui Meta l'ha co-addestrato. È una posizione difendibile per un modello v1.2 contro un'accoppiata Claude Code / Opus 5 matura — ma "secondo sul grafico del vendor stesso" è anche una claim esattamente forte quanto suona. Non estrapolare troppo.
4. Le tre skill incluse valgono la pena di essere rubate anche se non installi mai Muse Code
Muse Code include tre skill di serie, e la forma di ciascuna è istruttiva:
- Converte un task in un piano concreto e si ferma per l'approvazione umana prima di eseguirlo. Stesso pattern della plan mode di Claude Code (docs/claude-code/plan-mode), e la ragione è la stessa: il modello è molto più bravo a proporre una struttura che a eseguire una struttura che non ti ha mostrato prima.
- Fa passare il piano attraverso un questionamento avversariale finché non si stabilizza — 'cosa si rompe se X?', 'cosa hai assunto su Y?', 'esiste un caso in cui Z fallisce in silenzio?'. È lo step mancante nella maggior parte dei loop di agenti naïve: non pianificare, ma mettere sotto pressione il piano prima di spendere token per eseguirlo. Niente di /grill è specifico di Meta; puoi implementare la stessa disciplina con un subagent in qualsiasi CLI di coding.
- Lavora verso un obiettivo specificato attraverso molte chiamate a tool senza chiedere permesso a ogni step. Si accoppia all'event log: l'umano autorizza il goal, il log registra la traiettoria, e l'agente gira. Il case study di ottimizzazione kernel da 1.000+ chiamate a tool è una run /goal.
Il pattern di design interessante qui è la pipeline plan → grill → goal: proponi, critica in modo avversariale, poi esegui sotto un log durevole. Questa decomposizione mappa in modo pulito su workflow che potresti già stare girando con la plan mode di Claude Code più i subagent — ed è un modello mentale più pulito rispetto al loop ad-hoc "vai avanti finché non funziona" con cui la maggior parte delle persone finisce.
Installazione e prima run
Disponibilità: macOS e Linux, beta pubblica dal 5 agosto 2026. Nessuna build Windows al lancio. I pesi sono solo hosted — Meta non ha pubblicato pesi scaricabili per Muse Spark 1.2.
Installa Muse Code (beta macOS / Linux)
curl -fsSL https://dev.meta.ai/install.sh | bash
Le usuali cautele di sicurezza si applicano a qualsiasi installer curl | bash: come minimo, rivedi lo script prima di pipe-arlo alla shell. Meta ospita l'installer sotto il proprio dominio, ma nulla del pattern di installazione rende lo script intrinsecamente più sicuro di qualunque altro.
- Software in beta. Aspettati breaking change, edge non documentati e sorprese sulle quota prima della disponibilità generale.
- Il tier contributor addestra sui tuoi dati. Non attivarlo per codice di lavoro, codice cliente, codice sotto licenza o qualunque cosa sotto NDA.
- Benchmark vendor-run. Muse Spark 1.2 è secondo a Claude Opus 5 sui grafici di Meta stessa — i numeri da fidarsi sono i tuoi, sul tuo repo.
Come si confronta con Claude Code, a colpo d'occhio
| Asse | Muse Code + Muse Spark 1.2 | Claude Code + Claude Opus 5 |
|---|---|---|
| Harness da terminale | Sì (macOS, Linux beta) | Sì (macOS, Linux, Windows) |
| Finestra di contesto | 1M token (input), output solo testo | 1M token, fino a 128K in output |
| Skill di planning avversariale | /grill (inclusa) | Componi con subagent + plan mode |
| Planning ad approvazione obbligata | /plan (inclusa) | Plan mode |
| Run lunghe crash-safe | Event log append-only (replay-exact, restart-safe) | Checkpoint e rewind (snapshot del workspace, undo guidato dall'umano) |
| Sandboxing | Lavoro parallelo isolato in worktree Git separati | Worktree più permessi |
| Supporto MCP | Non documentato nei materiali di lancio verificabili | Supporto MCP completo |
| Tier legittimo più economico | $0,10/M input, $0,20/M output (tier contributor — training sui dati) | Sconto da prompt caching senza cedere diritti di training |
| Ranking benchmark (vendor-run) | 2° su Terminal-Bench 2.1 (82,9%), 2° su DeepSWE 1.1 (59,3%) | 1° su entrambi (secondo il grafico di Meta) |
Per il panorama più ampio — Codex CLI, Aider e il resto — vedi CLI di coding agent a confronto.
Quando conviene davvero prenderlo in mano
Prendi Muse Code quando:
- Il tuo workflow è dominato da run lunghe e non presidiate dove la sicurezza da crash dell'event log vale più di qualsiasi specifica integrazione di tool. Il case study di ottimizzazione kernel da 24 ore è la forma.
- Vuoi una seconda opinione strutturalmente diversa su un task. Un modello diverso + un harness diverso sono una seconda opinione genuinamente diversa. Il miglior uso di una CLI competitor è spesso far girare lo stesso task attraverso di lei e confrontare.
- Sei uno sviluppatore solo che lavora su progetti personali dove il trade-off del tier contributor sul training dei dati è accettabile, e token 12,5×/21,25× più economici cambiano in modo materiale ciò che ti puoi permettere.
Non prenderlo quando:
- Ti serve integrazione con tool MCP, che non è documentata nei materiali di lancio.
- Ti serve il supporto Windows, che al lancio non esiste.
- Stai lavorando su qualcosa coperto da NDA, da una licenza restrittiva, o che contiene dati di cliente / datore di lavoro / PII, a meno che tu non possa pagare il tier standard e sia certo che nessun toggle contributor sia attivo.
- La tua asticella di qualità è "battere Claude Opus 5 su Terminal-Bench 2.1", perché sui numeri di Meta stessa non lo fa.
Check yourself
0/4Dove si colloca accanto a ciò che già conosci
Se hai letto CLI di coding agent a confronto, Muse Code entra come una nuova voce con la stessa forma di Claude Code e Codex CLI — un harness da terminale che si prende in carico gli edit dei file, le chiamate ai tool e i loop di agente long-running. Quello che è diverso è la disciplina di runtime (l'event log) e la struttura dei tier (il pricing contributor). Se hai letto la field guide di Opus 5, il punto di confronto diretto è che Muse Spark 1.2 è un competitor credibile-ma-secondo di Opus 5 sui numeri di Meta stessa, nell'harness per cui Meta l'ha addestrato.
Per il quadro più ampio — come scegliere in tutto il campo — parti da scegliere un modello e cosa costa l'AI tra i provider. Se vuoi confrontare tecniche invece che prodotti, la decomposizione plan → grill → goal vale la pena di essere composta da te in Claude Code con subagent e plan mode — ottieni la disciplina senza la beta e senza la questione del tier contributor.
Fonti e letture ulteriori
- Introducing Muse Code and Muse Spark 1.2 — Meta AI Research — il post ufficiale di lancio: architettura, benchmark e la tesi dell'accoppiata.
- Meta Ships Muse Code Coding Agent With Co-Trained Muse Spark 1.2 Model — Unite.AI — installazione, tier di prezzo e contesto sulla claim del co-training.
- Meta AI Releases Muse Code (Beta) — MarkTechPost — design dell'event log, agenti async in background e il case study di ottimizzazione kernel da 1.000+ chiamate a tool.
- Muse Code Beta — explainx.ai — walkthrough del pricing, cautele sulla policy dati del tier contributor e sandboxing basato su worktree.
- Introducing Muse Code and Muse Spark 1.2 — Simon Willison — il pratico highlight sul pricing a due tier e la progressione del pellicano-in-bicicletta da Spark 1.1 a 1.2.
- Muse Spark 1.2 — Benchmarks, Specs & Release Date — Vorp Labs — la tabella dei prezzi confermata, la finestra di contesto (1.048.576 token) e la cautela pass@1 vendor-run sui numeri dei benchmark.
- Meta debuts Muse Spark 1.2 and first coding agent — Yahoo Finance — l'inquadramento competitivo contro OpenAI e Anthropic.