Muse Code + Muse Spark 1.2 : l'agent de code terminal de Meta
Le 5 août 2026, Meta Superintelligence Labs a livré Muse Code — un agent de code terminal — aux côtés de Muse Spark 1.2, le modèle co-entraîné avec lui. Deux produits, un lancement, et le couplage est la partie intéressante : Meta prétend que les outils entraînés ensemble avec le modèle produisent moins de retries et une sortie de meilleure qualité qu'un modèle générique piloté par une harness générique. Que vous adhériez ou non à cette prétention, le lancement mérite une lecture attentive — Muse Code est l'analogue structurel le plus proche de Claude Code qu'un concurrent ait livré, et quelques-unes de ses décisions de design (le journal d'événements append-only, les tarifs contributeur, les trois skills livrés) sont non évidentes au point de mériter d'être volées quel que soit l'agent que vous utilisez au quotidien.
Cette page est la lecture pratique : ce qu'est vraiment Muse Code, comment il se compare à Claude Code sur les chiffres que Meta a publiés, le piège tarifaire qui apparaît à la seconde lecture du tableau de prix, et où il se place dans le tour AILmanac.
- Comprendre ce qu'est Muse Code architecturalement : un agent terminal avec un journal d'événements append-only local, des agents d'arrière-plan async persistants, et trois skills livrés (/plan, /grill, /goal)
- Lire correctement les chiffres Terminal-Bench 2.1 et DeepSWE 1.1 — y compris la mise en garde vendor-run que la revue source signale elle-même
- Connaître les tiers tarifaires : 1,25 $/4,25 $ standard vs. 0,10 $/0,20 $ contributeur, et ce que la remise 12,5×/21,25× vous coûte réellement en termes de données
- Obtenir la commande d'installation, les plateformes supportées et les mises en garde bêta avant de pointer ça sur quelque chose de sensible
- Placer Muse Code à côté de Claude Code, Codex CLI et du reste du paysage des CLIs d'agents de code
La version en une phrase
Muse Code est un agent de code terminal en bêta pour macOS et Linux, propulsé par Muse Spark 1.2 — un modèle 1M tokens en entrée, multimodal en entrée, texte en sortie — avec des agents d'arrière-plan async, un journal d'événements append-only local pour reprise crash-safe, et trois skills livrés (/plan, /grill, /goal) ; Meta tarifie le tier standard à 1,25 $/M en entrée et 4,25 $/M en sortie, et offre un tier contributeur à 0,10 $/M en entrée et 0,20 $/M en sortie en échange de la permission d'entraîner de futurs modèles Meta sur vos prompts et complétions.
Quatre choses non évidentes dans les titres du lancement
1. Le journal d'événements est un write-ahead log, et c'est ce qui rend les runs longs sûrs
Le runtime de Muse Code enregistre chaque appel au modèle, run d'outil, approbation et édition dans un journal d'événements append-only local avant de l'exécuter. Meta décrit ça comme « replay-exact et restart-safe ». Si l'agent crashe en pleine tâche — segfault, rabat de laptop, jeton expiré, n'importe quoi — vous reprenez depuis le journal sans perdre de travail ni avoir à re-prompter le modèle pour reconstruire l'état.
C'est un pattern de write-ahead log de l'ingénierie de bases de données, appliqué à la harness plutôt qu'à la couche de stockage. Deux choses en découlent qui méritent d'être intériorisées :
- Les échecs pendant des runs de 24 heures deviennent récupérables plutôt que coûteux. L'étude de cas d'optimisation de kernel de Meta a exécuté 1 000+ appels d'outils sur 24 heures sur des GPU NVIDIA Hopper. Sans journal durable, un crash à l'heure 22 coûte tout le run. Avec un, le modèle reprend depuis le dernier événement commité.
- L'audit post-hoc est trivial. Chaque décision est sur disque, dans l'ordre, avec les entrées et sorties d'outils. Vous pouvez inspecter ce que l'agent a pensé, pourquoi il a appelé un outil particulier, et ce qui est revenu — sans instrumenter quoi que ce soit.
Le pattern comparable dans Claude Code est checkpoints et rewind, qui prend un snapshot du workspace pour vous permettre de revenir en arrière à travers des éditions interactives. Le journal d'événements de Muse Code est un outil différent pour un problème différent : rewind vous laisse vous défaire, tandis que le journal d'événements laisse l'agent reprendre.
2. Le tier contributeur est une remise 12,5× / 21,25×, et ce n'est pas gratuit
Deux tiers tarifaires, publiquement divulgués :
| Tier | Entrée ($/M) | Entrée cachée ($/M) | Sortie ($/M) | Ce que vous cédez |
|---|---|---|---|---|
| Standard | 1,25 $ | 0,15 $ | 4,25 $ | Rien |
| Contributeur | 0,10 $ | — | 0,20 $ | Permission pour Meta d'entraîner de futurs modèles sur vos prompts et complétions |
Le calcul de la remise : 12,5× moins cher en entrée, 21,25× moins cher en sortie. Pour une vraie session de code qui lit plus qu'elle n'écrit, la baisse de coût effective atterrit plus près de 15×.
Le piège n'est pas que Meta regardera vos prompts (tous les fournisseurs frontière loggent pour la revue d'abus par défaut). Le piège, ce sont les droits d'entraînement — Meta retient explicitement la permission d'entraîner de futurs modèles sur vos entrées et complétions. Ça signifie :
- Tout ce qui pourrait fuiter des secrets commerciaux, des PII, du code sous licence, ou les données d'un client via une future sortie de modèle est interdit.
- Tout ce qui est sous une licence share-alike ou similaire restrictive que vous ne possédez pas est interdit.
- Tout ce qui est couvert par un NDA est interdit.
Lisez les termes exacts de Meta avant de flipper le toggle — les revues source sont claires : « confirmez les termes exacts et les réglages de toggle dans les docs officielles de Meta avant de le faire tourner sur quoi que ce soit de sensible ». Une réduction de coût 12,5× sur des side-projects personnels est une vraie bonne affaire. Une réduction de coût 12,5× sur le monorepo de votre employeur est un problème juridique qui n'attend qu'à éclater.
3. Les propres graphes de Meta placent Muse Spark 1.2 deuxième, derrière Claude Opus 5
Meta a publié des comparaisons Terminal-Bench 2.1 et DeepSWE 1.1 qui placent Muse Spark 1.2 derrière Claude Opus 5 sur les deux. C'est un graphe de lancement inhabituellement honnête, et il mérite d'être lu précisément plutôt que dédaigneusement.
| Benchmark | Muse Spark 1.2 | Claude Opus 5 (couplé avec Claude Code) |
|---|---|---|
| Terminal-Bench 2.1 | 82,9 % | Plus haut — Meta le classe premier (le reporting externe de seconde main cite ~86,7 %) |
| DeepSWE 1.1 | 59,3 % | Plus haut — Meta le classe premier (score non publié dans les revues qu'on a pu vérifier) |
Deux mises en garde avant de prendre ces chiffres pour argent comptant :
- Méthodologie vendor-run. Les chiffres publiés sont pass@1 moyennés sur cinq tentatives, chaque modèle couplé avec son propre produit agent, et Meta note lui-même que sa config « peut ne pas être ajustée pour des modèles tiers ». Tous les chiffres sont vendor-run, pas des reproductions indépendantes.
- Modèle+harness est l'unité de mesure. Terminal-Bench ne score pas un modèle nu — il score un modèle travaillant à travers un agent. Muse Spark 1.2 est évalué dans Muse Code ; Opus 5 dans Claude Code. Le résultat est une prétention sur le couplage, pas le modèle en isolation. Changer l'une des deux moitiés change le chiffre.
La lecture pratique : Muse Spark 1.2 est un solide second sur les deux benchmarks que Meta a choisi de publier, dans la harness pour laquelle Meta l'a co-entraîné. C'est une position défendable pour un modèle v1.2 face à un couplage mature Claude Code / Opus 5 — mais « second sur le graphe du vendeur » est aussi exactement aussi forte qu'une prétention peut l'être. N'extrapolez pas trop.
4. Les trois skills livrés valent la peine d'être volés même si vous n'installez jamais Muse Code
Muse Code livre trois skills sortis de la boîte, et la forme de chacun est instructive :
- Convertit une tâche en plan concret et fait une pause pour l'approbation humaine avant l'exécution. Même pattern que le plan mode de Claude Code (docs/claude-code/plan-mode), et la raison est la même : le modèle est bien meilleur à proposer de la structure qu'à exécuter une structure qu'il ne vous a jamais montrée d'abord.
- Fait passer le plan à travers un questionnement adversarial jusqu'à ce qu'il se stabilise — 'qu'est-ce qui casse si X ?', 'qu'as-tu supposé sur Y ?', 'y a-t-il un cas où Z échoue silencieusement ?'. C'est l'étape manquante dans la plupart des boucles d'agents naïves : pas la planification, mais le pressure-testing du plan avant de dépenser des tokens à l'exécuter. Rien dans /grill n'est spécifique à Meta ; vous pouvez implémenter la même discipline avec un sous-agent dans n'importe quel CLI de code.
- Travaille vers un objectif spécifié à travers de nombreux appels d'outils sans demander la permission à chaque étape. S'appaire avec le journal d'événements : l'humain autorise le but, le journal enregistre la trajectoire, et l'agent tourne. L'étude de cas d'optimisation de kernel à 1 000+ appels d'outils est un run /goal.
Le pattern de design intéressant ici est le pipeline plan → grill → goal : proposer, critiquer adversarialement, puis exécuter sous un journal durable. Cette décomposition se cartographie proprement sur des workflows que vous faites peut-être déjà tourner avec le plan-mode de Claude Code plus sous-agents — et c'est un modèle mental plus propre que la boucle ad-hoc « continue jusqu'à ce que ça marche » sur laquelle la plupart des gens finissent.
Installation et premier run
Disponibilité : macOS et Linux, bêta publique au 5 août 2026. Pas de build Windows au lancement. Les poids sont hébergés seulement — Meta n'a pas publié de poids téléchargeables pour Muse Spark 1.2.
Installer Muse Code (macOS / Linux beta)
curl -fsSL https://dev.meta.ai/install.sh | bash
L'hygiène de sécurité standard s'applique à tout installeur curl | bash : au minimum, revoyez le script avant de le piper sur un shell. Meta héberge l'installeur sous son propre domaine, mais rien dans le pattern d'installation ne rend le script intrinsèquement plus sûr qu'un autre.
- Logiciel bêta. Attendez-vous à des changements cassants, des rebords non documentés, et des surprises de quota avant la disponibilité générale.
- Le tier contributeur entraîne sur vos données. Ne l'activez pas pour le code de travail, le code client, le code sous licence, ou tout ce qui est sous NDA.
- Benchmarks vendor-run. Muse Spark 1.2 est second à Claude Opus 5 sur les propres graphes de Meta — les chiffres à faire confiance sont les vôtres sur votre propre repo.
Comparaison avec Claude Code, en un coup d'œil
| Axe | Muse Code + Muse Spark 1.2 | Claude Code + Claude Opus 5 |
|---|---|---|
| Harness terminal | Oui (macOS, Linux beta) | Oui (macOS, Linux, Windows) |
| Fenêtre de contexte | 1M tokens (entrée), sortie texte uniquement | 1M tokens, jusqu'à 128K sortie |
| Skill de planification adversariale | /grill (livré) | Composer avec sous-agents + plan mode |
| Planification avec approbation gate | /plan (livré) | Plan mode |
| Runs longs crash-safe | Journal d'événements append-only (replay-exact, restart-safe) | Checkpoints et rewind (snapshot workspace, undo humain-driven) |
| Sandboxing | Travail parallèle isolé dans des worktrees Git séparés | Worktrees plus permissions |
| Support MCP | Non documenté dans les matériels de lancement qu'on a pu vérifier | Support MCP complet |
| Tier légitime le moins cher | 0,10 $/M entrée, 0,20 $/M sortie (tier contributeur — entraînement de données) | Remise prompt caching sans céder les droits d'entraînement |
| Classement benchmark (vendor-run) | 2e sur Terminal-Bench 2.1 (82,9 %), 2e sur DeepSWE 1.1 (59,3 %) | 1er sur les deux (selon le graphe de Meta) |
Pour le champ plus large — Codex CLI, Aider, et le reste — voir CLIs d'agents de code comparés.
Quand y avoir vraiment recours
Ayez recours à Muse Code quand :
- Votre workflow est dominé par de longs runs non surveillés où le crash safety du journal d'événements est plus précieux que n'importe quelle intégration d'outil spécifique. L'étude de cas d'optimisation de kernel de 24 heures est la forme.
- Vous voulez un second avis structurellement différent sur une tâche. Un modèle différent + une harness différente est un second avis vraiment différent. Le meilleur usage d'un CLI concurrent est souvent de faire tourner la même tâche à travers et de comparer.
- Vous êtes un développeur solo travaillant sur des side-projects où le compromis d'entraînement de données du tier contributeur est acceptable, et où des tokens 12,5×/21,25× moins chers changent matériellement ce qui est abordable.
N'y ayez pas recours quand :
- Vous avez besoin de l'intégration d'outils MCP, qui n'est pas documentée dans les matériels de lancement.
- Vous avez besoin du support Windows, qui n'existe pas au lancement.
- Vous travaillez sur quoi que ce soit couvert par un NDA, une licence restrictive, ou contenant des données client / employeur / PII, sauf si vous pouvez payer le tier standard et êtes certain qu'aucun toggle du tier contributeur n'est activé.
- Votre barre de qualité est « battre Claude Opus 5 sur Terminal-Bench 2.1 », parce que sur les propres chiffres de Meta il ne le fait pas.
Check yourself
0/4Où ça s'assied à côté de ce que vous connaissez
Si vous avez lu CLIs d'agents de code comparés, Muse Code s'insère comme une nouvelle entrée avec la même forme que Claude Code et Codex CLI — une harness terminal qui possède les éditions de fichier, les appels d'outils et les boucles d'agents longs. Ce qui est différent, c'est la discipline runtime (journal d'événements) et la structure de tiers (tarifs contributeur). Si vous avez lu le guide de terrain Opus 5, le point de comparaison direct est que Muse Spark 1.2 est un concurrent crédible-mais-second à Opus 5 sur les propres chiffres de Meta, dans la harness pour laquelle Meta l'a entraîné.
Pour l'image plus large — comment choisir dans le champ — commencez par choisir un modèle et ce que l'IA coûte à travers les fournisseurs. Si vous voulez comparer des techniques plutôt que des produits, la décomposition plan → grill → goal mérite d'être composée vous-même dans Claude Code avec des sous-agents et le plan mode — vous obtenez la discipline sans la bêta et sans la question du tier contributeur.
Sources et lectures complémentaires
- Introducing Muse Code and Muse Spark 1.2 — Meta AI Research — le post officiel de lancement : architecture, benchmarks, et la thèse du couplage.
- Meta Ships Muse Code Coding Agent With Co-Trained Muse Spark 1.2 Model — Unite.AI — installation, tiers tarifaires, et contexte sur la prétention de co-entraînement.
- Meta AI Releases Muse Code (Beta) — MarkTechPost — design du journal d'événements, agents d'arrière-plan async, et l'étude de cas d'optimisation de kernel à 1 000+ appels d'outils.
- Muse Code Beta — explainx.ai — parcours tarifaire, mises en garde de politique de données du tier contributeur, et sandboxing basé sur worktrees.
- Introducing Muse Code and Muse Spark 1.2 — Simon Willison — le highlight pratique de la tarification à deux tiers et la progression du pélican-sur-vélo de Spark 1.1 à 1.2.
- Muse Spark 1.2 — Benchmarks, Specs & Release Date — Vorp Labs — le tableau de tarifs confirmé, la fenêtre de contexte (1 048 576 tokens), et la mise en garde vendor-run pass@1 sur les chiffres benchmark.
- Meta debuts Muse Spark 1.2 and first coding agent — Yahoo Finance — le cadrage compétitif face à OpenAI et Anthropic.