본문으로 건너뛰기

Claude 사용자를 위한 Kimi K2

중급

당신은 이미 Claude로 사고합니다. 그런데 r/LocalLLaMA가 Kimi K2 이야기를 멈추지 않습니다 — Moonshot AI의 오픈 웨이트, 에이전트 우선 모델로, 프론티어 가격의 몇 분의 일에 수백 단계에 걸쳐 툴 호출을 이어가면서도 흐름을 놓치지 않습니다. 다른 모든 "X로 갈아타라" 이야기와 이것을 다르게 만드는 부분은 이것입니다: Moonshot이 Anthropic 호환 엔드포인트를 제공하기 때문에, 환경 변수 두 개만 바꾸면 기존 Claude Code를 Kimi K2에 겨눌 수 있습니다. 워크플로의 다른 어떤 것도 움직이지 않습니다. 이 페이지는 당신의 Claude 멘탈 모델을 Kimi K2에 대응시키고, 정확한 교체 방법을 보여주며, 진짜로 다른 몇 가지를 짚어줍니다.

What you'll learn
  • Claude 개념을 Kimi K2 대응물로 옮긴다 (Kimi 앱, Moonshot의 API, K2-Instruct 대 K2 Thinking, 오픈 웨이트)
  • 하나의 큰 구조적 차이를 이해한다: Kimi K2는 오픈 웨이트(Modified MIT)이자 MoE이며, 닫힌 프론티어 모델이 아니다
  • Moonshot의 Anthropic 호환 엔드포인트를 통해 변수 두 개만 교체하여 Claude Code를 Kimi K2에 겨눈다
  • 호환 레이어에 의존하기 전에 실제 차이점과 주의사항을 안다
  • Kimi K2가 더 나은 선택이 되는 지점을 안다 — 긴 에이전트 실행, 비용에 민감한 코딩, 그리고 셀프 호스팅

60초 개념 지도

한 섹션만 읽는다면 이걸 읽으세요. 당신이 Claude에서 아는 것들이 Kimi의 세계와 어떻게 대응되는지 여기 있습니다:

Claude에서 이렇게 부르던 것…Kimi의 세계에서는…같은 개념인가?
Claude.ai (챗 앱)Kimi 앱 (kimi.com / 모바일)그렇다 — 소비자/어시스턴트 표면
모델 선택기 (Opus / Sonnet / Haiku)K2 변형 — K2-Instruct (빠른 에이전트형)와 K2 Thinking (깊은 추론)그렇다 — 속도 대 추론 깊이로 고른다
Extended thinkingK2 Thinking의 사고 연쇄(chain-of-thought)와 툴 호출을 교차 삽입그렇다 — 여기서 추론은 단순한 토글이 아니라 하나의 변형이다
Anthropic Messages APIMoonshot의 네이티브 API Anthropic 호환 엔드포인트부분적으로 — 호환 레이어가 당신의 방언을 말한다
Tool useKimi의 네이티브 툴 호출 (설계상 에이전트 우선)그렇다 — 선언→호출→실행→반환 루프가 동일하다
닫힌 웨이트, 호스팅 전용Hugging Face의 오픈 웨이트 (Modified MIT)아니다 — 이게 가장 큰 차이다; 셀프 호스팅 가능
Claude CodeKimi를 겨눈 Claude Code, 또는 Moonshot 자체 Kimi CLI대체로 — 같은 하네스, 뒤의 모델만 다르다

가장 중요한 행은 마지막에서 두 번째입니다: Kimi K2는 오픈 웨이트입니다. 그 아래 모든 것 — 셀프 호스팅, 낮은 가격, 관대한 라이선스 — 은 여기서 흘러나옵니다.

Kimi K2가 실제로 무엇인가

Kimi K2는 Mixture-of-Experts 모델입니다: 대략 총 1T 파라미터에 토큰당 활성 ~32B(384개 전문가, 토큰당 8개 선택). 약 15.5T 토큰으로 사전 학습되었고 Modified MIT License로 배포됩니다 — 다운로드하고 살펴보고 실행할 수 있는 진짜 오픈 웨이트입니다. Moonshot은 이를 에이전트 우선으로 만들었습니다: 모델 카드는 이를 "툴 사용, 추론, 자율적 문제 해결을 위해 특별히 설계되었다"고 설명합니다.

당신에게 가장 중요한 두 변형:

  • K2-Instruct — 바로 투입 가능한 에이전트형/챗 모델. 128K 컨텍스트. 자체 보고 SWE-bench Verified 65.8%, LiveCodeBench 53.7%, MMLU 89.5%. 이것이 Sonnet 형태의 일상용 모델입니다.
  • K2 Thinking — 추론 에이전트. 사고 연쇄와 함수 호출을 처음부터 끝까지 교차 삽입하며 200–300개의 연속 툴 호출에 걸쳐 안정성을 유지합니다 — 장기 지평 에이전트에 대해 사람들이 극찬하는 특성입니다. 네이티브 INT4, 256K 컨텍스트. 자체 보고 SWE-bench Verified 71.3%, Humanity's Last Exam 44.9%(툴 사용), BrowseComp 60.2%. 이것이 extended thinking을 켠 Opus에 대응하는 모델입니다.
What you'll learn
  • 오픈 웨이트는 '갈아타기'의 의미를 바꿉니다. Grok이나 Gemini에서는 블랙박스를 임대하지만, Kimi K2에서는 그것을 다운로드해 당신의 하드웨어에서 실행하고 토큰을 외부로 절대 보내지 않을 수도 있습니다. 이것이 바로 이 모델이 우리의 오픈 모델 및 로컬 에이전트 페이지를 지탱하는 이유입니다.

Claude 사용자를 위한 킬러 기능: Claude Code를 Kimi에 겨누기

대부분의 대안과 달리, 당신은 하네스를 떠날 필요가 없습니다. Moonshot은 Anthropic 호환 엔드포인트(/anthropic/v1/messages)를 노출하므로, Anthropic Messages API를 말하는 Claude Code는 환경 변수 두 개를 재정의하는 것만으로 Kimi K2와 대화할 수 있습니다.

Guided walkthrough1 of 4
  1. Moonshot의 개발자 플랫폼(platform.moonshot.ai, 중국 본토에서는 platform.moonshot.cn)에 계정을 만들고 API 키를 생성한다. sk-로 시작한다.

Claude Code를 Kimi K2에 겨누기 (셸)

# Route Claude Code to Moonshot's Anthropic-compatible endpoint
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="sk-your-moonshot-api-key"

# Then just run Claude Code as normal:
claude

# (In mainland China, use https://api.moonshot.cn/anthropic instead.)
Watch out
  • 호환 레이어는 가깝지만 동일하지는 않습니다. Moonshot의 Anthropic 호환 인터페이스는 모든 Anthropic 기능을 구현하지는 않으며(예: document 파라미터), 서브에이전트나 구조화된 출력 요청에서 드러날 수 있는 thinking 필드 관련 알려진 차이들이 있습니다. 어떤 기능이 이상하게 동작하면 설정보다 호환 레이어를 먼저 의심하고 — Moonshot의 현재 호환성 문서를 확인하세요.

Claude Code를 넘어서: 원시 API와 셀프 호스팅

Claude Code를 구동하는 대신 자체 통합을 작성한다면, 세 가지 경로가 있습니다:

  • Anthropic 호환 엔드포인트 — base URL과 키만 바꿔서(위와 같이) Claude/Messages 형태의 클라이언트를 재사용한다. 코드가 이미 Anthropic 형태라면 마찰이 가장 적다.
  • Moonshot의 네이티브 API — Moonshot은 OpenAI 호환 표면도 제공하므로, OpenAI 형태의 코드는 base-URL + 키 교체만으로 이전된다. 스택이 OpenAI 쪽에서 왔다면 편리하다.
  • 웨이트를 셀프 호스팅 — Hugging Face에서 다운로드하고 Kimi의 네이티브 툴 파싱을 지원하는 추론 엔진(vLLM, SGLang 등)으로 서빙한다. 이것이 프라이버시/비용의 최종 지점이다: 토큰이 당신의 인프라를 떠나지 않는다. 로컬 경로는 Run Models Locally with OllamaPrivate, Local AI Stack를 참고하라.

그대로 넘어오는 것

Kimi K2는 Claude처럼 에이전트 우선이고 툴 네이티브이기 때문에, 당신의 Claude 기술 거의 전부가 그대로 넘어옵니다:

  • 프롬프팅 습관. 명확한 지시, 명시적 제약, 예시, 역할 설정 모두 작동합니다. Prompting BasicsPorting Prompts Across Models를 참고하세요.
  • 툴 사용 규율. 선언→호출→실행→반환 루프는 Claude Tool Use와 같은 형태입니다. Kimi는 이를 위해 만들어졌고 아주 긴 툴 체인에서도 버팁니다.
  • 컨텍스트 엔지니어링. 촘촘한 컨텍스트, 좋은 검색, 구조화된 입력은 똑같이 중요합니다 — 긴 에이전트 실행에서는 오히려 더 그렇습니다. Context Engineering을 참고하세요.
  • 에이전트 구동 기술. 작업 범위 설정, diff 리뷰, 실행을 궤도에 유지하기는 어떤 하네스에도 직접 이식됩니다 — Kimi를 겨눈 Claude Code 포함. What Is Claude Code?Long-Running Agent Harnesses를 참고하세요.

Kimi K2가 빛을 발하는 지점

  • 장기 지평 에이전트 실행. 대표 특성은 수백 개의 연속 툴 호출에 걸친 안정성입니다 — 작업이 단일 답변이 아니라 툴 사용의 마라톤일 때 K2 Thinking에 손을 뻗으세요.
  • 대규모에서 비용에 민감한 코딩. 오픈 웨이트 경제성에서 나오는 강력한 자체 보고 SWE-bench 결과는 이 모델을 대량 코딩 에이전트의 자연스러운 A/B 대상으로 만듭니다.
  • 프라이버시와 셀프 호스팅. 오픈 웨이트는 당신의 하드웨어에서 완전히 실행할 수 있다는 뜻입니다 — 어떤 닫힌 프론티어 모델도 제공할 수 없는 단 하나입니다.
  • Claude Code 근육 기억 유지. 워크플로를 다시 배우지 않고 더 저렴하거나 셀프 호스팅되는 모델을 원할 때, 변수 두 개 교체는 이기기 어렵습니다.

대부분의 경우 정직한 답: 중요한 작업에서 당신의 평가에서 이기는 쪽 — 그리고 당신의 프라이버시와 예산 제약이 허용하는 쪽. 기술은 이식 가능합니다; 설정과 평가가 진짜 일입니다. 제공자 중립적으로 고르는 방법은 Choosing a ModelWhat AI Costs Across Providers를 참고하세요.

Kimi에서 Claude로 어휘 대응
Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 6

스스로 점검하기

0/3
  1. Claude Code 설정을 떠나지 않고 Kimi K2를 시도하고 싶습니다. 오래 유효하고 마찰이 가장 적은 방법은?
  2. Kimi K2와 Grok이나 Gemini 같은 닫힌 모델 사이의 단 하나의 가장 큰 구조적 차이는?
  3. Anthropic 호환 엔드포인트는 작동하지만, 당신이 의존하는 문서 업로드 기능이 오동작합니다. 올바른 직감은?
Key takeaways
  • Kimi K2는 Moonshot의 오픈 웨이트, 에이전트 우선 MoE 모델(총 ~1T / 활성 ~32B, Modified MIT)입니다 — 오픈 웨이트가 이야기의 전부입니다: 셀프 호스팅, 낮은 비용, 관대한 라이선스.
  • 두 변형이 당신의 Claude 멘탈 모델에 깔끔하게 대응됩니다: K2-Instruct(빠른 에이전트형 ≈ Sonnet)와 K2 Thinking(깊은 추론 + 교차 삽입된 툴 호출 ≈ extended thinking을 켠 Opus).
  • Claude 사용자에게 두드러진 점: Moonshot의 Anthropic 호환 엔드포인트로 env 변수 두 개만 재정의하여 Claude Code를 Kimi에 겨눌 수 있습니다 — 워크플로 변경 없음.
  • 호환 레이어는 가깝지만 동일하지 않습니다 — 일부 Anthropic 기능(예: document)과 thinking 필드 동작이 갈리므로, 뭔가 이상하면 Moonshot의 현재 문서를 확인하세요.
  • 긴 에이전트 실행, 비용에 민감한 코딩, 프라이버시/셀프 호스팅에는 Kimi K2에 손을 뻗으세요 — 다만 변형 이름, 점수, 가격은 빠르게 낡으므로 검증하고 평가하세요.

출처 및 더 읽을거리

다음