Claude 사용자를 위한 Kimi K2
당신은 이미 Claude로 사고합니다. 그런데 r/LocalLLaMA가 Kimi K2 이야기를 멈추지 않습니다 — Moonshot AI의 오픈 웨이트, 에이전트 우선 모델로, 프론티어 가격의 몇 분의 일에 수백 단계에 걸쳐 툴 호출을 이어가면서도 흐름을 놓치지 않습니다. 다른 모든 "X로 갈아타라" 이야기와 이것을 다르게 만드는 부분은 이것입니다: Moonshot이 Anthropic 호환 엔드포인트를 제공하기 때문에, 환경 변수 두 개만 바꾸면 기존 Claude Code를 Kimi K2에 겨눌 수 있습니다. 워크플로의 다른 어떤 것도 움직이지 않습니다. 이 페이지는 당신의 Claude 멘탈 모델을 Kimi K2에 대응시키고, 정확한 교체 방법을 보여주며, 진짜로 다른 몇 가지를 짚어줍니다.
- Claude 개념을 Kimi K2 대응물로 옮긴다 (Kimi 앱, Moonshot의 API, K2-Instruct 대 K2 Thinking, 오픈 웨이트)
- 하나의 큰 구조적 차이를 이해한다: Kimi K2는 오픈 웨이트(Modified MIT)이자 MoE이며, 닫힌 프론티어 모델이 아니다
- Moonshot의 Anthropic 호환 엔드포인트를 통해 변수 두 개만 교체하여 Claude Code를 Kimi K2에 겨눈다
- 호환 레이어에 의존하기 전에 실제 차이점과 주의사항을 안다
- Kimi K2가 더 나은 선택이 되는 지점을 안다 — 긴 에이전트 실행, 비용에 민감한 코딩, 그리고 셀프 호스팅
60초 개념 지도
한 섹션만 읽는다면 이걸 읽으세요. 당신이 Claude에서 아는 것들이 Kimi의 세계와 어떻게 대응되는지 여기 있습니다:
| Claude에서 이렇게 부르던 것… | Kimi의 세계에서는… | 같은 개념인가? |
|---|---|---|
| Claude.ai (챗 앱) | Kimi 앱 (kimi.com / 모바일) | 그렇다 — 소비자/어시스턴트 표면 |
| 모델 선택기 (Opus / Sonnet / Haiku) | K2 변형 — K2-Instruct (빠른 에이전트형)와 K2 Thinking (깊은 추론) | 그렇다 — 속도 대 추론 깊이로 고른다 |
| Extended thinking | K2 Thinking의 사고 연쇄(chain-of-thought)와 툴 호출을 교차 삽입 | 그렇다 — 여기서 추론은 단순한 토글이 아니라 하나의 변형이다 |
| Anthropic Messages API | Moonshot의 네이티브 API 와 Anthropic 호환 엔드포인트 | 부분적으로 — 호환 레이어가 당신의 방언을 말한다 |
| Tool use | Kimi의 네이티브 툴 호출 (설계상 에이전트 우선) | 그렇다 — 선언→호출→실행→반환 루프가 동일하다 |
| 닫힌 웨이트, 호스팅 전용 | Hugging Face의 오픈 웨이트 (Modified MIT) | 아니다 — 이게 가장 큰 차이다; 셀프 호스팅 가능 |
| Claude Code | Kimi를 겨눈 Claude Code, 또는 Moonshot 자체 Kimi CLI | 대체로 — 같은 하네스, 뒤의 모델만 다르다 |
가장 중요한 행은 마지막에서 두 번째입니다: Kimi K2는 오픈 웨이트입니다. 그 아래 모든 것 — 셀프 호스팅, 낮은 가격, 관대한 라이선스 — 은 여기서 흘러나옵니다.
Kimi K2가 실제로 무엇인가
Kimi K2는 Mixture-of-Experts 모델입니다: 대략 총 1T 파라미터에 토큰당 활성 ~32B(384개 전문가, 토큰당 8개 선택). 약 15.5T 토큰으로 사전 학습되었고 Modified MIT License로 배포됩니다 — 다운로드하고 살펴보고 실행할 수 있는 진짜 오픈 웨이트입니다. Moonshot은 이를 에이전트 우선으로 만들었습니다: 모델 카드는 이를 "툴 사용, 추론, 자율적 문제 해결을 위해 특별히 설계되었다"고 설명합니다.
당신에게 가장 중요한 두 변형:
- K2-Instruct — 바로 투입 가능한 에이전트형/챗 모델. 128K 컨텍스트. 자체 보고 SWE-bench Verified 65.8%, LiveCodeBench 53.7%, MMLU 89.5%. 이것이 Sonnet 형태의 일상용 모델입니다.
- K2 Thinking — 추론 에이전트. 사고 연쇄와 함수 호출을 처음부터 끝까지 교차 삽입하며 200–300개의 연속 툴 호출에 걸쳐 안정성을 유지합니다 — 장기 지평 에이전트에 대해 사람들이 극찬하는 특성입니다. 네이티브 INT4, 256K 컨텍스트. 자체 보고 SWE-bench Verified 71.3%, Humanity's Last Exam 44.9%(툴 사용), BrowseComp 60.2%. 이것이 extended thinking을 켠 Opus에 대응하는 모델입니다.
- 오픈 웨이트는 '갈아타기'의 의미를 바꿉니다. Grok이나 Gemini에서는 블랙박스를 임대하지만, Kimi K2에서는 그것을 다운로드해 당신의 하드웨어에서 실행하고 토큰을 외부로 절대 보내지 않을 수도 있습니다. 이것이 바로 이 모델이 우리의 오픈 모델 및 로컬 에이전트 페이지를 지탱하는 이유입니다.
Claude 사용자를 위한 킬러 기능: Claude Code를 Kimi에 겨누기
대부분의 대안과 달리, 당신은 하네스를 떠날 필요가 없습니다. Moonshot은 Anthropic 호환 엔드포인트(/anthropic/v1/messages)를 노출하므로, Anthropic Messages API를 말하는 Claude Code는 환경 변수 두 개를 재정의하는 것만으로 Kimi K2와 대화할 수 있습니다.
- Moonshot의 개발자 플랫폼(platform.moonshot.ai, 중국 본토에서는 platform.moonshot.cn)에 계정을 만들고 API 키를 생성한다. sk-로 시작한다.
- Claude Code의 Anthropic base URL과 auth token을 Anthropic 대신 Moonshot으로 겨눈다. Claude Code 설정의 다른 어떤 것도 — CLAUDE.md, 스킬, MCP 서버, 슬래시 명령 — 바꿀 필요가 없다.
- 모델을 현재 Kimi id(예: kimi-k2 프리뷰/날짜 id)로 설정한다. 모델 id는 계속 바뀌므로, 오래된 것을 하드코딩하지 말고 Moonshot의 현재 모델 목록을 읽는다.
- claude를 실행하고 평소처럼 구동한다. 익숙한 핸들 뒤에 새 모델이 있다고 여긴다: 당신만의 작업을 다시 돌려 비교한다. 같은 하네스 ≠ 같은 동작.
Claude Code를 Kimi K2에 겨누기 (셸)
# Route Claude Code to Moonshot's Anthropic-compatible endpoint export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic" export ANTHROPIC_AUTH_TOKEN="sk-your-moonshot-api-key" # Then just run Claude Code as normal: claude # (In mainland China, use https://api.moonshot.cn/anthropic instead.)
- 호환 레이어는 가깝지만 동일하지는 않습니다. Moonshot의 Anthropic 호환 인터페이스는 모든 Anthropic 기능을 구현하지는 않으며(예: document 파라미터), 서브에이전트나 구조화된 출력 요청에서 드러날 수 있는 thinking 필드 관련 알려진 차이들이 있습니다. 어떤 기능이 이상하게 동작하면 설정보다 호환 레이어를 먼저 의심하고 — Moonshot의 현재 호환성 문서를 확인하세요.
Claude Code를 넘어서: 원시 API와 셀프 호스팅
Claude Code를 구동하는 대신 자체 통합을 작성한다면, 세 가지 경로가 있습니다:
- Anthropic 호환 엔드포인트 — base URL과 키만 바꿔서(위와 같이) Claude/Messages 형태의 클라이언트를 재사용한다. 코드가 이미 Anthropic 형태라면 마찰이 가장 적다.
- Moonshot의 네이티브 API — Moonshot은 OpenAI 호환 표면도 제공하므로, OpenAI 형태의 코드는 base-URL + 키 교체만으로 이전된다. 스택이 OpenAI 쪽에서 왔다면 편리하다.
- 웨이트를 셀프 호스팅 — Hugging Face에서 다운로드하고 Kimi의 네이티브 툴 파싱을 지원하는 추론 엔진(vLLM, SGLang 등)으로 서빙한다. 이것이 프라이버시/비용의 최종 지점이다: 토큰이 당신의 인프라를 떠나지 않는다. 로컬 경로는 Run Models Locally with Ollama와 Private, Local AI Stack를 참고하라.
그대로 넘어오는 것
Kimi K2는 Claude처럼 에이전트 우선이고 툴 네이티브이기 때문에, 당신의 Claude 기술 거의 전부가 그대로 넘어옵니다:
- 프롬프팅 습관. 명확한 지시, 명시적 제약, 예시, 역할 설정 모두 작동합니다. Prompting Basics와 Porting Prompts Across Models를 참고하세요.
- 툴 사용 규율. 선언→호출→실행→반환 루프는 Claude Tool Use와 같은 형태입니다. Kimi는 이를 위해 만들어졌고 아주 긴 툴 체인에서도 버팁니다.
- 컨텍스트 엔지니어링. 촘촘한 컨텍스트, 좋은 검색, 구조화된 입력은 똑같이 중요합니다 — 긴 에이전트 실행에서는 오히려 더 그렇습니다. Context Engineering을 참고하세요.
- 에이전트 구동 기술. 작업 범위 설정, diff 리뷰, 실행을 궤도에 유지하기는 어떤 하네스에도 직접 이식됩니다 — Kimi를 겨눈 Claude Code 포함. What Is Claude Code?와 Long-Running Agent Harnesses를 참고하세요.
Kimi K2가 빛을 발하는 지점
- 장기 지평 에이전트 실행. 대표 특성은 수백 개의 연속 툴 호출에 걸친 안정성입니다 — 작업이 단일 답변이 아니라 툴 사용의 마라톤일 때 K2 Thinking에 손을 뻗으세요.
- 대규모에서 비용에 민감한 코딩. 오픈 웨이트 경제성에서 나오는 강력한 자체 보고 SWE-bench 결과는 이 모델을 대량 코딩 에이전트의 자연스러운 A/B 대상으로 만듭니다.
- 프라이버시와 셀프 호스팅. 오픈 웨이트는 당신의 하드웨어에서 완전히 실행할 수 있다는 뜻입니다 — 어떤 닫힌 프론티어 모델도 제공할 수 없는 단 하나입니다.
- Claude Code 근육 기억 유지. 워크플로를 다시 배우지 않고 더 저렴하거나 셀프 호스팅되는 모델을 원할 때, 변수 두 개 교체는 이기기 어렵습니다.
대부분의 경우 정직한 답: 중요한 작업에서 당신의 평가에서 이기는 쪽 — 그리고 당신의 프라이버시와 예산 제약이 허용하는 쪽. 기술은 이식 가능합니다; 설정과 평가가 진짜 일입니다. 제공자 중립적으로 고르는 방법은 Choosing a Model과 What AI Costs Across Providers를 참고하세요.
스스로 점검하기
0/3- Kimi K2는 Moonshot의 오픈 웨이트, 에이전트 우선 MoE 모델(총 ~1T / 활성 ~32B, Modified MIT)입니다 — 오픈 웨이트가 이야기의 전부입니다: 셀프 호스팅, 낮은 비용, 관대한 라이선스.
- 두 변형이 당신의 Claude 멘탈 모델에 깔끔하게 대응됩니다: K2-Instruct(빠른 에이전트형 ≈ Sonnet)와 K2 Thinking(깊은 추론 + 교차 삽입된 툴 호출 ≈ extended thinking을 켠 Opus).
- Claude 사용자에게 두드러진 점: Moonshot의 Anthropic 호환 엔드포인트로 env 변수 두 개만 재정의하여 Claude Code를 Kimi에 겨눌 수 있습니다 — 워크플로 변경 없음.
- 호환 레이어는 가깝지만 동일하지 않습니다 — 일부 Anthropic 기능(예: document)과 thinking 필드 동작이 갈리므로, 뭔가 이상하면 Moonshot의 현재 문서를 확인하세요.
- 긴 에이전트 실행, 비용에 민감한 코딩, 프라이버시/셀프 호스팅에는 Kimi K2에 손을 뻗으세요 — 다만 변형 이름, 점수, 가격은 빠르게 낡으므로 검증하고 평가하세요.
출처 및 더 읽을거리
- moonshotai/Kimi-K2-Instruct · Hugging Face — 공식 K2-Instruct 모델 카드: 아키텍처, 라이선스, 자체 보고 벤치마크.
- moonshotai/Kimi-K2-Thinking · Hugging Face — K2 Thinking 모델 카드: 교차 삽입된 추론 + 툴 호출, 컨텍스트, 점수.
- moonshotai on Hugging Face — Moonshot의 전체 모델 조직, 더 새로운 포인트 릴리스와 Base 변형 포함.
- MoonshotAI/Kimi-K2 · GitHub — K2 저장소, Anthropic 호환 엔드포인트 논의와 배포 노트 포함.
- Introducing Kimi K2 Thinking — Moonshot 자체의 thinking 에이전트 설명.
- Moonshot AI developer platform — API 키, 현재 모델 id, 가격(구체적 수치를 위한 권위 있는 곳).
다음
- 제공자 중립적으로 고르는 방법 → Choosing a Model
- 더 넓은 오픈 웨이트 분야 → DeepSeek & Qwen Open Models · What AI Costs Across Providers
- 웨이트를 셀프 호스팅 → Run Models Locally with Ollama · Private, Local AI Stack
- 다른 어시스턴트에서도 넘어오시나요? → ChatGPT for Claude Users · Gemini for Claude Users · Grok for Claude Users
- 긴 툴 체인을 얌전하게 → Long-Running Agent Harnesses · Context Engineering