본문으로 건너뛰기

Muse Code + Muse Spark 1.2: Meta의 터미널 코딩 에이전트

중급

2026년 8월 5일, Meta Superintelligence Labs는 터미널 코딩 에이전트 Muse Code를 함께 co-training된 모델 Muse Spark 1.2와 나란히 출시했습니다. 두 개의 제품, 하나의 릴리스인데, 이 조합이 흥미로운 지점입니다. Meta는 모델과 함께 학습된 도구가 일반 모델을 일반 하네스로 조종하는 것보다 재시도가 적고 출력 품질이 더 높다고 주장합니다. 그 주장을 받아들이든 아니든, 이번 출시는 자세히 읽어볼 가치가 있습니다. Muse Code는 지금까지 경쟁사가 출시한 것 중 Claude Code에 구조적으로 가장 가까운 아날로그이며, 몇 가지 설계 결정(append-only 이벤트 로그, contributor 티어 가격 정책, 세 가지 번들 스킬)은 어떤 에이전트를 실제로 매일 쓰든 훔쳐올 만큼 비자명(non-obvious)합니다.

이 페이지는 실무적 요약입니다. Muse Code가 실제로 무엇인지, Meta가 직접 공개한 숫자로 Claude Code와 어떻게 비교되는지, 가격표를 두 번째로 읽을 때 드러나는 가격 함정은 무엇인지, 그리고 AILmanac 투어에서 어디에 위치하는지.

What you'll learn
  • Muse Code의 아키텍처를 이해한다: 로컬 append-only 이벤트 로그, 상주(persistent) 비동기 백그라운드 에이전트, 그리고 세 가지 번들 스킬(/plan, /grill, /goal)을 갖춘 터미널 에이전트
  • Terminal-Bench 2.1과 DeepSWE 1.1 숫자를 정확히 읽는다 — 소스 리뷰 자체가 강조하는 vendor-run 주의사항을 포함해서
  • 가격 티어를 안다: 표준 $1.25/$4.25 대 contributor $0.10/$0.20, 그리고 12.5배/21.25배 할인이 데이터 관점에서 실제로 무엇을 대가로 하는지
  • 설치 명령어, 지원 플랫폼, 그리고 민감한 대상에 이걸 가리키기 전에 알아야 할 베타 상태의 주의사항을 파악한다
  • Muse Code를 Claude Code, Codex CLI, 그리고 나머지 코딩-에이전트 CLI 지형 옆에 배치한다

한 문장 요약

Muse Code는 macOS와 Linux용 베타 터미널 코딩 에이전트로, Muse Spark 1.2 — 1M 토큰 멀티모달-입력, 텍스트-출력 모델 — 를 기반으로 하며, 비동기 백그라운드 에이전트, 크래시-세이프 재개(resume)를 위한 로컬 append-only 이벤트 로그, 그리고 세 가지 번들 스킬(/plan, /grill, /goal)을 제공합니다. Meta는 표준 티어를 입력 $1.25/M, 출력 $4.25/M로 가격을 책정하며, 향후 Meta 모델을 여러분의 프롬프트와 완료(completions)로 학습할 수 있는 권한을 대가로 입력 $0.10/M, 출력 $0.20/M의 contributor 티어를 제공합니다.

출시 헤드라인에서는 명확하지 않은 네 가지

1. 이벤트 로그는 write-ahead log이며, 장시간 실행을 안전하게 만드는 핵심이다

Muse Code의 런타임은 모든 모델 호출, 도구 실행, 승인, 편집을 실행 전에 로컬 append-only 이벤트 로그에 기록합니다. Meta는 이를 "replay-exact and restart-safe"라고 표현합니다. 에이전트가 작업 도중에 크래시하면 — segfault, 노트북 뚜껑 닫힘, 만료된 토큰, 무엇이든 — 여러분은 로그로부터 재개하며, 작업을 잃거나 모델에게 상태를 재구성하도록 다시 프롬프트할 필요가 없습니다.

이건 데이터베이스 엔지니어링에서 온 write-ahead log 패턴을, 스토리지 계층이 아니라 하네스에 적용한 것입니다. 여기서 따라오는 두 가지가 내면화할 가치가 있습니다.

  • 24시간 실행 중의 실패가 비싼 것이 아니라 복구 가능한 것이 된다. Meta 자체의 커널 최적화 사례 연구는 NVIDIA Hopper GPU에서 24시간에 걸쳐 1,000회 이상의 도구 호출을 실행했습니다. 내구성 있는 로그가 없다면 22시간째의 한 번의 크래시가 전체 실행을 날려버립니다. 로그가 있다면 모델은 마지막으로 커밋된 이벤트에서 재개합니다.
  • 사후(post-hoc) 감사가 사소해진다. 모든 결정이 순서대로, 도구 입력과 출력과 함께 디스크에 있습니다. 에이전트가 무엇을 생각했고, 왜 특정 도구를 호출했으며, 무엇이 되돌아왔는지 — 아무것도 계측(instrument)하지 않고 검사할 수 있습니다.

Claude Code에서 비교 가능한 패턴은 체크포인트와 rewind로, 워크스페이스를 스냅샷하여 대화형 편집을 뒤로 되돌릴 수 있게 해줍니다. Muse Code의 이벤트 로그는 다른 문제를 위한 다른 도구입니다. rewind는 여러분이 undo할 수 있게 하고, 이벤트 로그는 에이전트가 재개할 수 있게 합니다.

2. Contributor 티어는 12.5배 / 21.25배 할인이며, 공짜가 아니다

공개된 가격 티어는 두 가지입니다.

티어입력 ($/M)캐시된 입력 ($/M)출력 ($/M)대가로 주는 것
표준$1.25$0.15$4.25없음
Contributor$0.10$0.20향후 Meta 모델이 여러분의 프롬프트와 completions로 학습할 수 있는 권한

할인 계산: 입력은 12.5배 저렴, 출력은 21.25배 저렴. 쓰는 것보다 많이 읽는 실제 코딩 세션에서는 실효 비용 감소가 약 15배에 가깝게 나옵니다.

함정은 Meta가 여러분의 프롬프트를 들여다본다는 게 아닙니다(모든 프론티어 벤더는 기본적으로 남용 검토를 위해 로깅합니다). 함정은 학습 권리입니다 — Meta는 여러분의 입력과 completions로 향후 모델을 학습시킬 권한을 명시적으로 보유합니다. 즉:

  • 향후 모델 출력을 통해 영업 비밀, PII, 라이선스 코드, 또는 고객 데이터를 유출할 수 있는 것은 금지입니다.
  • 여러분이 소유하지 않은 share-alike 또는 유사한 제한적 라이선스로 보호되는 것은 금지입니다.
  • NDA로 보호되는 것은 금지입니다.

토글을 켜기 전에 Meta의 정확한 약관을 읽으세요 — 소스 리뷰들은 "민감한 것에 대해 실행하기 전에 Meta의 공식 문서에서 정확한 약관과 토글 설정을 확인하라"고 명확히 밝힙니다. 개인 사이드 프로젝트에서 12.5배 비용 절감은 진짜로 좋은 딜입니다. 여러분 고용주의 모노레포에서 12.5배 비용 절감은 언젠가 터질 법적 문제입니다.

3. Meta 자체 차트가 Muse Spark 1.2를 Claude Opus 5 뒤 2위에 놓는다

Meta는 Muse Spark 1.2를 두 벤치마크 모두에서 Claude Opus 5 뒤로 두는 Terminal-Bench 2.1과 DeepSWE 1.1 비교를 공개했습니다. 이건 이례적으로 정직한 출시 차트이며, 무시하기보다는 정확히 읽을 가치가 있습니다.

벤치마크Muse Spark 1.2Claude Opus 5 (Claude Code와 페어링)
Terminal-Bench 2.182.9%더 높음 — Meta는 1위로 랭크 (외부 2차 보도는 ~86.7% 인용)
DeepSWE 1.159.3%더 높음 — Meta는 1위로 랭크 (우리가 검증할 수 있는 리뷰들에서는 점수가 공개되지 않음)

그 숫자를 복음으로 받아들이기 전 두 가지 주의사항:

  1. Vendor-run 방법론. 공개된 숫자는 다섯 번의 시도에 걸친 pass@1 평균이며, 각 모델은 자신의 에이전트 제품과 페어링되고, Meta 자체가 자사의 셋업이 "third-party 모델용으로 튜닝되지 않았을 수 있다"고 명시합니다. 모든 숫자는 독립적 재현이 아닌 vendor-run입니다.
  2. 모델+하네스가 측정 단위다. Terminal-Bench는 벌거벗은 모델을 채점하지 않습니다 — 에이전트를 통해 작동하는 모델을 채점합니다. Muse Spark 1.2는 Muse Code 안에서 평가되고, Opus 5는 Claude Code 안에서 평가됩니다. 결과는 모델 단독이 아닌 페어링에 대한 주장입니다. 어느 한쪽을 바꾸면 숫자가 바뀝니다.

실무적 해석: Muse Spark 1.2는 Meta가 공개한 두 벤치마크에서, Meta가 그것을 위해 co-training한 하네스 안에서, 강력한 2위입니다. v1.2 모델이 성숙한 Claude Code / Opus 5 페어링을 상대로 방어할 수 있는 위치입니다 — 하지만 "벤더 자신의 차트에서 2위"는 딱 그만큼 강한 주장입니다. 과도하게 외삽하지 마세요.

4. 세 가지 번들 스킬은 Muse Code를 설치하지 않아도 훔쳐올 가치가 있다

Muse Code는 세 가지 스킬을 out of the box로 제공하며, 각각의 형태가 시사적입니다.

Guided walkthrough1 of 3
  1. 작업을 구체적인 계획으로 변환하고 실행 전에 사람의 승인을 위해 일시 정지합니다. Claude Code의 plan mode(docs/claude-code/plan-mode)와 같은 패턴이며, 이유도 같습니다. 모델은 자기가 먼저 보여주지 않은 구조를 실행하는 것보다 구조를 제안하는 것에 훨씬 더 능숙합니다.

여기서 흥미로운 설계 패턴은 plan → grill → goal 파이프라인입니다: 제안하고, 적대적으로 비판하고, 내구성 있는 로그 아래에서 실행합니다. 이 분해는 Claude Code plan-mode와 서브에이전트로 이미 실행하고 있을 워크플로우에 깔끔하게 매핑되며 — 대부분의 사람이 결국 도달하는 즉흥적인 "될 때까지 계속" 루프보다 더 깨끗한 정신 모델입니다.

설치와 첫 실행

가용성: macOS와 Linux, 2026년 8월 5일 기준 공개 베타. 출시 시점에 Windows 빌드는 없음. 가중치는 호스트-전용 — Meta는 Muse Spark 1.2용 다운로드 가능한 가중치를 공개하지 않았습니다.

Muse Code 설치 (macOS / Linux 베타)

curl -fsSL https://dev.meta.ai/install.sh | bash

어떤 curl | bash 설치 스크립트에도 표준 보안 위생이 적용됩니다: 최소한 셸로 파이프하기 전에 스크립트를 검토하세요. Meta는 자체 도메인에서 설치 스크립트를 호스팅하지만, 설치 패턴에 관한 어떤 것도 이 스크립트를 다른 어떤 것보다 본질적으로 더 안전하게 만들지 않습니다.

Watch out
  • 베타 소프트웨어입니다. GA 이전에 파괴적 변경, 문서화되지 않은 엣지 케이스, 할당량 서프라이즈를 예상하세요.
  • Contributor 티어는 여러분의 데이터로 학습합니다. 업무 코드, 클라이언트 코드, 라이선스 코드, 또는 NDA 하의 어떤 것에 대해서도 켜지 마세요.
  • Vendor-run 벤치마크입니다. Muse Spark 1.2는 Meta 자체 차트에서 Claude Opus 5에 이어 2위입니다 — 신뢰할 숫자는 여러분의 자체 레포에서 여러분이 직접 낸 숫자입니다.

Claude Code와의 한눈 비교

Muse Code + Muse Spark 1.2Claude Code + Claude Opus 5
터미널 하네스예 (macOS, Linux 베타)예 (macOS, Linux, Windows)
컨텍스트 창1M 토큰 (입력), 텍스트 전용 출력1M 토큰, 최대 128K 출력
적대적 계획 스킬/grill (번들)서브에이전트 + plan mode로 조합
승인-게이트 계획 수립/plan (번들)Plan mode
크래시-세이프 장시간 실행Append-only 이벤트 로그 (replay-exact, restart-safe)체크포인트와 rewind (워크스페이스 스냅샷, 사람 주도 undo)
샌드박싱병렬 작업이 별도 Git worktree로 격리Worktrees + 권한
MCP 지원우리가 검증할 수 있는 출시 자료에는 문서화되지 않음완전한 MCP 지원
가장 저렴한 정당한 티어입력 $0.10/M, 출력 $0.20/M (contributor 티어 — 데이터 학습)학습 권리를 포기하지 않는 프롬프트 캐싱 할인
벤치마크 랭킹 (vendor-run)Terminal-Bench 2.1에서 2위 (82.9%), DeepSWE 1.1에서 2위 (59.3%)둘 다 1위 (Meta 차트 기준)

더 넓은 지형 — Codex CLI, Aider, 그 밖의 것들 — 은 코딩 에이전트 CLI 비교를 참고하세요.

언제 실제로 손을 뻗을까

Muse Code에 손을 뻗으세요, 만약:

  • 여러분의 워크플로우가 길고 무인(unattended) 실행이 지배적이라면, 이벤트 로그의 크래시 안전성이 특정 도구 통합보다 더 가치 있는 경우. 24시간 커널 최적화 사례 연구가 그 형태입니다.
  • 작업에 대해 구조적으로 다른 두 번째 의견을 원한다면. 다른 모델 + 다른 하네스는 진짜로 다른 두 번째 의견입니다. 경쟁사 CLI의 최고 사용처는 종종 같은 작업을 그것으로 실행하고 비교하는 것입니다.
  • 여러분이 사이드 프로젝트를 하는 솔로 개발자이며, contributor 티어의 데이터-학습 트레이드오프가 수용 가능하고, 12.5배/21.25배 저렴한 토큰이 감당 가능한 것을 실질적으로 바꾸는 경우.

손을 뻗지 마세요, 만약:

  • MCP 도구 통합이 필요하다면, 출시 자료에 문서화되어 있지 않습니다.
  • Windows 지원이 필요하다면, 출시 시점에 존재하지 않습니다.
  • NDA, 제한적 라이선스, 또는 클라이언트 / 고용주 / PII 데이터가 포함된 것에 대해 작업하고 있다면, 표준 티어를 지불할 수 있고 contributor-티어 토글이 꺼져 있다는 확신이 없는 한.
  • 여러분의 품질 기준이 "Terminal-Bench 2.1에서 Claude Opus 5를 이긴다"라면, Meta 자체 숫자로 그렇지 않기 때문입니다.

Check yourself

0/4
  1. Muse Code의 append-only 이벤트 로그가 실제로 가능하게 하는 것은?
  2. Contributor 티어는 $1.25 / $4.25 대신 백만 입력/출력 토큰당 $0.10 / $0.20 비용이 듭니다. 무엇을 대가로 하나요?
  3. Meta 자체 출시 차트는 Terminal-Bench 2.1과 DeepSWE 1.1에서 Muse Spark 1.2를 어디에 놓나요?
  4. 세 가지 번들 스킬 중 실행 전에 계획을 적대적으로 스트레스 테스트하는 것은?

여러분이 아는 것 옆에 어디에 놓이는가

코딩 에이전트 CLI 비교를 읽었다면, Muse Code는 Claude Code와 Codex CLI와 같은 형태 — 파일 편집, 도구 호출, 그리고 장시간 실행되는 에이전트 루프를 소유하는 터미널 하네스 — 로 새 항목으로 들어옵니다. 다른 점은 런타임 규율(이벤트 로그)과 티어 구조(contributor 가격)입니다. Opus 5 필드 가이드를 읽었다면, 직접 비교 포인트는 Muse Spark 1.2가 Meta 자체 숫자로 Meta가 그것을 위해 학습시킨 하네스 안에서 Opus 5에 대한 신뢰할 만하지만 두 번째의 경쟁자라는 것입니다.

더 넓은 그림 — 전 지형에 걸쳐 선택하는 법 — 을 위해서는 모델 선택하기제공자별 AI 비용에서 시작하세요. 제품이 아니라 기법을 비교하고 싶다면, plan → grill → goal 분해를 서브에이전트plan mode로 Claude Code에서 직접 조합해볼 가치가 있습니다 — 베타 없이, contributor-티어 질문 없이 규율을 얻습니다.

소스와 추가 자료