Muse Code + Muse Spark 1.2: Meta のターミナル・コーディングエージェント
2026 年 8 月 5 日、Meta Superintelligence Labs はターミナル・コーディングエージェント Muse Code を、それと共に共同学習されたモデル Muse Spark 1.2 と共に出荷した。2 つのプロダクト、1 つのリリース、そして興味深いのはそのペアリングだ。Meta は、モデルと共に学習されたツールは、汎用モデルを汎用ハーネスで駆動するよりも再試行が少なく、より高品質な出力を生むと主張している。その主張を信じるかどうかはさておき、このローンチは注意深く読む価値がある。Muse Code は、競合他社が出荷した中で Claude Code に最も構造的に近い類似物であり、いくつかの設計判断(追記専用イベントログ、contributor ティアの価格設定、同梱の 3 つのスキル)は、実際に日々どのエージェントを使うにせよ、盗む価値があるほど非自明だ。
このページは実践的な読み方を提供する。Muse Code とは実際に何か、Meta 自身が公表した数値上で Claude Code とどう比較されるか、価格表を 2 度目に読んだときに現れる価格の罠、そして AILmanac ツアーの中でどこに位置するか。
- Muse Code のアーキテクチャ的正体を理解する:ローカルの追記専用イベントログ、永続的な非同期バックグラウンドエージェント、出荷済み 3 スキル(/plan、/grill、/goal)を備えたターミナル・エージェント
- Terminal-Bench 2.1 と DeepSWE 1.1 の数値を正しく読む — ソースレビュー自体が指摘するベンダー実行の注意事項も含めて
- 価格ティアを把握する:標準の $1.25 / $4.25 対 contributor の $0.10 / $0.20、そして 12.5× / 21.25× の割引がデータ面で実際に何を代償にしているか
- インストールコマンド、対応プラットフォーム、ベータ版の注意事項を、機密性のあるものに向ける前に把握する
- Muse Code を Claude Code、Codex CLI、その他のコーディング・エージェント CLI ランドスケープの隣に配置する
一文で言えば
Muse Code は macOS と Linux 向けのベータ版ターミナル・コーディングエージェントで、Muse Spark 1.2 — 1M トークンのマルチモーダル入力・テキスト出力モデル — を搭載し、非同期バックグラウンドエージェント、クラッシュセーフな再開のためのローカル追記専用イベントログ、そして同梱の 3 スキル(/plan、/grill、/goal)を備える;Meta は標準ティアを入力 $1.25/M・出力 $4.25/M で価格設定し、contributor ティアを入力 $0.10/M・出力 $0.20/M で提供する — 見返りとして、あなたのプロンプトと補完を将来の Meta モデルの学習に使う許可が求められる。
ローンチの見出しからは明らかでない 4 つのこと
1. イベントログはライトアヘッドログであり、長時間の実行を安全にするのはこれ
Muse Code のランタイムは、すべてのモデル呼び出し、ツール実行、承認、編集を、実行前にローカルの追記専用イベントログに記録する。Meta はこれを「replay-exact かつ restart-safe」と表現している。エージェントがタスクの途中でクラッシュしても — セグフォルト、ノート PC の蓋、トークン期限切れ、なんであれ — 作業を失うことも、状態を再構築するためにモデルに再プロンプトすることもなく、ログから再開できる。
これはデータベース工学から来たライトアヘッドログのパターンを、ストレージ層ではなくハーネスに適用したものだ。内在化する価値のあることが 2 つある:
- 24 時間実行中の失敗が、コストではなくリカバリ可能なものになる。 Meta 自身のカーネル最適化ケーススタディでは、NVIDIA Hopper GPU 上で 24 時間かけて 1,000 以上のツール呼び出しを実行した。永続的なログがなければ、22 時間目の 1 回のクラッシュで全実行が失われる。ログがあれば、モデルは最後にコミットされたイベントから再開する。
- 事後監査が容易になる。 すべての判断がディスク上に、順序通りに、ツールの入力と出力と共に残る。エージェントが何を考え、なぜ特定のツールを呼び、何が返ってきたかを、何も計測せずに検査できる。
Claude Code における比較可能なパターンはチェックポイントと巻き戻しで、ワークスペースをスナップショットしてインタラクティブな編集を段階的に遡れる。Muse Code のイベントログは異なる問題を解く異なるツールだ:巻き戻しは人が取り消すためのもの、イベントログはエージェントが再開するためのものだ。
2. contributor ティアは 12.5× / 21.25× の割引であり、無料ではない
公開されている 2 つの価格ティア:
| ティア | 入力 ($/M) | キャッシュ入力 ($/M) | 出力 ($/M) | 引き換えに差し出すもの |
|---|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 | なし |
| Contributor | $0.10 | — | $0.20 | あなたのプロンプトと補完を将来の Meta モデルの学習に使う許可 |
割引の計算:入力で 12.5 倍、出力で 21.25 倍安い。書くより読むほうが多い実際のコーディングセッションでは、実効コスト削減は 15 倍前後に落ち着く。
罠は Meta があなたのプロンプトを見ることではない(すべての最前線ベンダーはデフォルトで悪用レビューのためにログを取る)。罠は学習権限だ — Meta は将来のモデルをあなたの入力と補完で学習させる許可を明示的に保持する。つまり:
- 将来のモデル出力を通じて企業秘密、PII、ライセンス済みコード、または顧客データを漏らすものはすべて対象外。
- あなたが所有していない share-alike または類似の制限的ライセンス下にあるものはすべて対象外。
- NDA でカバーされるものはすべて対象外。
トグルを入れる前に Meta の正確な条件を読むこと — ソースレビューは「機密性のあるものに対して実行する前に、Meta の公式ドキュメントで正確な条件とトグル設定を確認する」と明確に述べている。個人のサイドプロジェクトで 12.5 倍のコスト削減は本当に良い取引だ。雇用主のモノレポで 12.5 倍のコスト削減は、待ち構える法的問題だ。
3. Meta 自身のチャートは Muse Spark 1.2 を Claude Opus 5 に次ぐ 2 位に置いている
Meta は Muse Spark 1.2 を Terminal-Bench 2.1 と DeepSWE 1.1 の両方で Claude Opus 5 より下 に位置づける比較を公表した。これはローンチチャートとしては異例に正直で、退けるのではなく正確に読む価値がある。
| ベンチマーク | Muse Spark 1.2 | Claude Opus 5(Claude Code とペア) |
|---|---|---|
| Terminal-Bench 2.1 | 82.9% | より高い — Meta は 1 位にランク付け(外部の二次情報では ~86.7% と引用) |
| DeepSWE 1.1 | 59.3% | より高い — Meta は 1 位にランク付け(我々が検証できたレビューではスコアは非公開) |
その数値を福音とする前に 2 つの注意事項:
- ベンダー実行の方法論。 公表された数値は pass@1 を 5 回の試行で平均したもので、各モデルは自身のエージェント製品とペアにされ、Meta 自身がその設定は「第三者モデル向けにチューニングされていない可能性がある」と述べている。すべての数値はベンダー実行であり、独立した再現ではない。
- 測定単位はモデル+ハーネス。 Terminal-Bench はモデル単体を採点しない — エージェントを介して動作するモデルを採点する。Muse Spark 1.2 は Muse Code の中で評価され、Opus 5 は Claude Code の中で評価される。結果はモデル単独ではなく、ペアリングについての主張だ。どちらの半分を入れ替えても数値は変わる。
実践的な読み方:Muse Spark 1.2 は、Meta が公表を選んだ 2 つのベンチマーク上で、Meta が共同学習したハーネスの中で、強い 2 位だ。成熟した Claude Code / Opus 5 ペアリングに対する v1.2 モデルとしては擁護可能な位置 — しかし「ベンダー自身のチャートで 2 位」は、まさにその通りの強さの主張でもある。過剰に外挿しないこと。
4. 同梱の 3 スキルは、Muse Code を絶対にインストールしなくても盗む価値がある
Muse Code は 3 つのスキルを標準搭載し、それぞれの形が示唆に富む:
- タスクを具体的な計画に変換し、実行前に人間の承認を待つ。Claude Code のプランモード(docs/claude-code/plan-mode)と同じパターンで、理由も同じ:モデルは構造を提案するのが、先に見せてもいない構造を実行するよりずっと得意だから。
- 計画が安定するまで敵対的な質問攻めにかける — 『X が起きたら何が壊れる?』、『Y について何を仮定した?』、『Z が静かに失敗するケースはあるか?』。これは素朴なエージェントループで欠けているステップだ:計画ではなく、トークンを実行に費やす前に計画に圧力をかけることだ。/grill には Meta 固有のものは何もない;同じ規律をどのコーディング CLI でもサブエージェントで実装できる。
- 指定された目的に向かって、ステップごとに許可を求めずに多くのツール呼び出しをまたいで動く。イベントログとペアになる:人間が目的を承認し、ログが軌跡を記録し、エージェントが走る。1,000 以上のツール呼び出しを行ったカーネル最適化ケーススタディは /goal 実行だ。
ここで興味深い設計パターンは、plan → grill → goal パイプラインだ:提案し、敵対的に批判し、そして永続的なログの下で実行する。この分解は、Claude Code のプランモードとサブエージェントですでに動かしているかもしれないワークフローに綺麗にマップされる — そしてほとんどの人が結局落ち着く「動くまで続ける」その場しのぎのループよりも、綺麗なメンタルモデルだ。
インストールと最初の実行
利用可能性: macOS と Linux、2026 年 8 月 5 日時点でパブリックベータ。ローンチ時点で Windows ビルドはなし。重みはホスト型のみ — Meta は Muse Spark 1.2 のダウンロード可能な重みを公開していない。
Muse Code をインストール(macOS / Linux ベータ)
curl -fsSL https://dev.meta.ai/install.sh | bash
curl | bash インストーラーには標準的なセキュリティ衛生が当てはまる:最低限、シェルにパイプする前にスクリプトを確認すること。Meta はインストーラーを自社ドメインでホストしているが、インストール・パターンには他のものより本質的にスクリプトを安全にする要素は何もない。
- ベータソフトウェア。一般提供前に破壊的変更、文書化されていない端、クォータの驚きを予期すること。
- contributor ティアはあなたのデータで学習する。仕事のコード、クライアントのコード、ライセンスされたコード、NDA 下のものにはトグルを入れないこと。
- ベンダー実行ベンチマーク。Muse Spark 1.2 は Meta 自身のチャート上で Claude Opus 5 に次ぐ 2 位 — 信頼すべき数値はあなた自身のレポでのあなた自身の数値。
Claude Code との比較を一目で
| 軸 | Muse Code + Muse Spark 1.2 | Claude Code + Claude Opus 5 |
|---|---|---|
| ターミナル・ハーネス | あり(macOS、Linux ベータ) | あり(macOS、Linux、Windows) |
| コンテキストウィンドウ | 1M トークン(入力)、テキストのみ出力 | 1M トークン、最大 128K 出力 |
| 敵対的計画スキル | /grill(同梱) | サブエージェント + プランモード で構成 |
| 承認ゲート付き計画 | /plan(同梱) | プランモード |
| クラッシュセーフな長時間実行 | 追記専用イベントログ(replay-exact、restart-safe) | チェックポイントと巻き戻し(ワークスペース・スナップショット、人間主導の取り消し) |
| サンドボックス化 | 並行作業は別の Git worktree で分離 | Worktrees と権限 |
| MCP サポート | 我々が検証できたローンチ資料には文書化されていない | 完全な MCP サポート |
| 最も安価な正当なティア | 入力 $0.10/M、出力 $0.20/M(contributor ティア — データ学習) | 学習権を放棄せずに プロンプトキャッシング 割引 |
| ベンチマーク順位(ベンダー実行) | Terminal-Bench 2.1 で 2 位(82.9%)、DeepSWE 1.1 で 2 位(59.3%) | Meta のチャート上で両方 1 位 |
より広い分野 — Codex CLI、Aider、その他 — については、コーディング・エージェント CLI 比較を参照。
いつ実際に手を伸ばすべきか
Muse Code に手を伸ばすべきとき:
- ワークフローが長時間の無人実行に支配されている場合、イベントログのクラッシュ安全性は、特定のツール統合より価値がある。24 時間のカーネル最適化ケーススタディがその形だ。
- タスクに対する 2 つ目の、構造的に異なる意見が欲しいとき。 異なるモデル + 異なるハーネスは、本当に異なる 2 つ目の意見だ。競合の CLI の最良の使い方は、同じタスクをそこに通して比較することであることが多い。
- サイドプロジェクトに取り組む個人開発者で、contributor ティアのデータ学習トレードオフが受け入れ可能で、12.5× / 21.25× 安いトークンが手が届く範囲を実質的に変える場合。
手を伸ばすべきでないとき:
- MCP ツール統合が必要な場合、ローンチ資料には文書化されていない。
- Windows サポートが必要な場合、ローンチ時点で存在しない。
- NDA、制限的ライセンス、またはクライアント / 雇用主 / PII データを含むものに取り組んでいる場合 — 標準ティアを支払えて、contributor ティアのトグルが確実にオフだと確信できるのでなければ。
- **品質基準が「Terminal-Bench 2.1 で Claude Opus 5 を打ち負かす」**である場合 — Meta 自身の数値では打ち負かさないから。
Check yourself
0/4あなたが知っているものの隣にどう位置するか
コーディング・エージェント CLI 比較を読んだなら、Muse Code は Claude Code や Codex CLI と同じ形の新エントリとして落ち着く — ファイル編集、ツール呼び出し、長時間実行のエージェントループを所有するターミナル・ハーネス。異なるのはランタイム規律(イベントログ)とティア構造(contributor 価格)だ。Opus 5 フィールドガイドを読んだなら、直接の比較点は、Muse Spark 1.2 が Meta 自身の数値で、Meta が学習したハーネスの中で、Opus 5 に対する信頼できるが 2 位の競合だということだ。
より広い絵 — 分野全体でどう選ぶか — については、モデルの選択とAI がプロバイダー間でいくらかかるかから始めること。プロダクトではなくテクニックを比較したいなら、plan → grill → goal の分解は、Claude Code でサブエージェントとプランモードを使って自分で構成する価値がある — ベータ版と contributor ティアの問題なしに規律を得られる。
ソース & さらに読む
- Introducing Muse Code and Muse Spark 1.2 — Meta AI Research — 公式ローンチ投稿:アーキテクチャ、ベンチマーク、ペアリングのテーゼ。
- Meta Ships Muse Code Coding Agent With Co-Trained Muse Spark 1.2 Model — Unite.AI — インストール、価格ティア、共同学習の主張の文脈。
- Meta AI Releases Muse Code (Beta) — MarkTechPost — イベントログ設計、非同期バックグラウンドエージェント、1,000 以上のツール呼び出しカーネル最適化ケーススタディ。
- Muse Code Beta — explainx.ai — 価格ウォークスルー、contributor ティアのデータ・ポリシー注意点、worktree ベースのサンドボックス化。
- Introducing Muse Code and Muse Spark 1.2 — Simon Willison — 実践的な 2 ティア価格のハイライト、Spark 1.1 から 1.2 への pelican-on-bicycle 進化。
- Muse Spark 1.2 — Benchmarks, Specs & Release Date — Vorp Labs — 確認された価格表、コンテキストウィンドウ(1,048,576 トークン)、ベンチマーク数値のベンダー実行 pass@1 注意事項。
- Meta debuts Muse Spark 1.2 and first coding agent — Yahoo Finance — OpenAI と Anthropic に対する競争的フレーミング。