Kimi K3: 세계 최대 오픈 웨이트 모델
2026년 7월 16일 Moonshot AI는 Kimi K3 — 2.8조 파라미터 Mixture-of-Experts 모델이자 현재 그 클래스에서 세계 최대의 오픈 웨이트 릴리스 — 를 배송했습니다. 헤드라인은 이를 중국 랩의 문샷이라 불렀습니다. 실제 주목할 숫자는 더 조용합니다: K3는 Artificial Analysis Intelligence Index에서 4위를 기록하며 Claude Fable 5와 GPT-5.6 Sol 뒤에 있지만 Claude Opus 4.8보다 확실히 앞섭니다. 2026년 7월 27일에 Hugging Face에 전체 웨이트가 착륙하는 모델에게는 이례적인 문장입니다.
이 페이지는 K3에 관해 진정으로 명백하지 않은 것 — 아키텍처 변경, 캐시 히트율을 확인하기 전에는 비싸 보이게 만드는 가격 함정, 그리고 오픈이든 폐쇄든 다른 모든 모델보다 앞서는 특정 작업 — 을 다룹니다.
- 2.8T 파라미터가 2.8T 컴퓨트를 의미하지 않는 이유 이해: MoE 산술과 sparse 활성화의 작동 방식
- K3에 K2보다 2.5× 나은 스케일링 효율을 주는 세 가지 아키텍처 혁신(KDA, AttnRes, LatentMoE) 학습
- 캐시 히트 가격 계산 파악: 실제 코딩 워크로드에서 K3가 $3.00/M보다 $0.30/M에 가까운 이유
- 벤치마크 환경에서 K3의 위치 파악: 어디서 리드하고, 어디서 뒤처지고, 환각률 주의사항이 무엇을 의미하는지
- OpenAI 호환 클라이언트로 세 줄로 API 시작하기
한 문장 버전
Kimi K3는 Moonshot AI의 오픈 웨이트(전체 웨이트는 2026년 7월 27일 드롭), 2.8조 파라미터 sparse MoE로, 롱 호라이즌 에이전틱 코딩과 지식 작업에 튜닝되었으며 네이티브 비전과 100만 토큰 컨텍스트 창을 갖고 있습니다 — 프론티어 API처럼 가격이 매겨지지만 코딩 워크로드가 프롬프트 캐시에 90% 이상 히트하기 때문에 실제로는 종종 더 쌉니다.
헤드라인에서 명백하지 않은 K3의 세 가지
1. "2.8조 파라미터"는 토큰당 2.8조 활성화를 의미하지 않음
헤드라인 수치는 드라마틱하지만, K3는 Mixture-of-Experts 모델입니다. 896개의 전문가 서브네트워크가 있고, 토큰당 16개 전문가만 발화합니다 — 이것이 "Stable LatentMoE" 컴포넌트입니다. 모델은 스토리지에서 거대하지만 포워드 패스당 컴퓨트에서 컴팩트합니다. 추론 시 활성 파라미터 풋프린트는 2.8T보다 훨씬 작습니다. 이는 DeepSeek V4 Pro(MoE도 사용)와 같은 아키텍처 트레이드오프이며, 이만큼 큰 모델이 웨이트가 셀프 호스팅되면 관리 가능한 하드웨어에서 효율적으로 실행될 수 있는 이유입니다.
실용적 함의: 밀집 모델과 MoE 모델 간에 파라미터 수를 직접 비교하지 마세요. 16/896 전문가가 활성인 2.8T MoE는 70B 밀집 모델과 다른 컴퓨트 프로필을 가지며 — 셀프 호스팅을 위한 매우 다른 하드웨어 요구사항을 갖습니다.
2. 캐시 히트율이 비용 계산을 완전히 뒤집음
K3 API 가격은 입력 토큰 $3.00/M, 출력 토큰 $15.00/M — 첫눈에 비쌈. 그러나 Moonshot은 입력 $0.30/M의 캐시 히트 가격(10× 할인)을 제공하며, 코딩 워크로드에서 회사는 90% 이상의 캐시 히트율을 보고합니다. 그것은 진행 중인 코딩 세션의 실효 백만 토큰당 입력 가격이 $3.00이 아니라 $0.30–$0.45에 가깝다는 뜻입니다.
작업 레벨 비용의 실용적 비교(서드파티 평가에서 출처):
| 모델 | 에이전틱 작업당 비용 |
|---|---|
| Kimi K3 | $0.94 |
| GPT-5.6 Sol | $1.04 |
| Claude Opus 4.8 | $1.80 |
K3는 또한 K2.6보다 21% 적은 출력 토큰을 사용 — 더 간결해지도록 학습됨 — 이는 청구서를 더 줄입니다. 헤드라인 가격에서 K3는 프리미엄으로 보임; 현실적 작업 가격에서는 프론티어 경쟁을 언더컷.
3. 아키텍처 혁신은 학습 시점, 사후가 아님
K3는 학습부터 모델에 구워진 세 개의 새 컴포넌트를 배송:
- Kimi Delta Attention (KDA) — 롱 레인지에서 표준 어텐션의 이차 비용 없이 100만 토큰 컨텍스트 창을 효율적으로 처리하는 하이브리드 선형 어텐션 메커니즘.
- Attention Residuals (AttnRes) — 깊이 전체에 걸친 균일 누적 대신, AttnRes는 초기 계층에서 표현을 선택적으로 검색하여, 모델이 긴 에이전틱 실행 동안 자신의 초기 사고를 "돌아볼" 수 있게 함.
- Per-Head Muon과 Sigmoid Tanh Unit (SiTU) — Moonshot이 K2 대비 전체 스케일링 효율 2.5× 개선이라고 주장하는 데 기여한 옵티마이저와 활성화 개선.
MXFP4 웨이트 양자화(MXFP8 활성화와 함께)도 사후가 아니라 학습 인식. 이는 품질에 중요: 사후 양자화는 일반적으로 벤치마크 포인트를 비용으로 지불; 양자화 인식 학습은 그 세금을 대체로 제거.
벤치마크 환경에서 K3의 위치
K3는 Artificial Analysis Intelligence Index에서 전체 4위를 기록 (2026년 7월 기준):
| 순위 | 모델 | 점수 |
|---|---|---|
| 1 | Claude Fable 5 | ~60 |
| 2 | GPT-5.6 Sol | ~59 |
| 3 | (근접 동점 영역) | — |
| 4 | Kimi K3 | ~57 |
| 5 | Claude Opus 4.8 | ~56 |
K3가 모든 모델(오픈과 폐쇄)을 리드하는 곳: Frontend Code Arena (1,679 포인트로 #1 랭크), UI 컴포넌트 생성과 반복 시각 코딩의 실세계 평가. 모델의 100만 토큰 컨텍스트와 네이티브 비전 능력이 여기에 기여.
주의를 적용할 곳: 독립 평가에서 K3의 환각률은 약 51% — 프론티어 폐쇄 모델보다 높음. 벤치마크 정확도는 K2.6의 33%에서 K3의 46%로 뛰었지만 사실적 기반은 같은 속도로 개선되지 않음. 사실적 주장에 대해 K3 출력을 검증하세요; 코드와 구조화된 작업 완료에서 가장 강하고, 검색 없이 오픈 엔드 지식 질문에 덜 신뢰할 수 있음.
DeepSWE (롱 호라이즌 소프트웨어 엔지니어링): K3는 67.3을 기록, 이 글을 쓰는 시점 기준 오픈 웨이트 모델에서 게시된 최고 점수, 프론티어 영역에 매치.
BrowseComp (컨텍스트 관리 없는 롱 컨텍스트 내비게이션): 100만 토큰 창 활성화로 90.4 — 특히 이 규모에서 대부분의 모델이 요구하는 청킹이나 검색 전략 없이 달성.
K3가 설계된 대상
Moonshot K3의 학습은 롱 호라이즌, 최소 감독 작업 — 모델이 계획하고, 도구 호출하고, 디버그하고, 반복하고, 큰 리포나 여러 시간 워크플로에 걸쳐 일관성을 유지해야 하는 종류 — 에 기울었습니다. 공식 블로그가 시연하는 특정 능력:
- GPU 커널 최적화 (Python 래퍼가 아닌 CUDA/Triton 레벨 작업)
- GPU 컴파일러 개발 (벤치마크 작업으로 처음부터 MiniTriton 컴파일러 구축)
- 칩 설계와 RTL 검증 (하드웨어 엔지니어링)
- 다중 에이전트 subagent 오케스트레이션 — K3는 자체 Kimi Work 환경에서 20개 이상의 동시 subagent를 조정할 수 있음
- 인터랙티브 리서치 시각화와 대시보드 생성 (비전 우선 설계와 Frontend Code Arena #1 랭킹이 말이 되는 곳)
"thinking mode"는 출시 시 항상 활성화(최대 노력). API는 아직 튜너블 노력 레벨을 지원하지 않음 — 출시 시 모든 호출이 최대 사고를 사용하며, 이는 토큰을 추가. 추가 추론 노력 레벨은 로드맵에 있지만 아직 사용 불가.
Kimi K3 API 시작하기
K3는 OpenAI 호환 API 형태를 사용하므로, 코드베이스가 이미 OpenAI 클라이언트 shim을 통해 GPT나 Claude를 호출한다면 Kimi를 가리키는 것은 작은 변경입니다:
- platform.kimi.ai에 로그인, API 키 생성. K3는 모델 ID `kimi-k3`로 사용 가능.
- 베이스 URL을 `https://api.moonshot.cn/v1`로, 모델을 `kimi-k3`로 설정. 클라이언트는 표준 `openai` Python 또는 JS SDK — 또는 단일 aggregator를 선호하면 OpenRouter.
- 표준 `image_url` 콘텐츠 유형을 사용해 messages 배열에 이미지 전달. 100만 토큰 작업의 경우 특별 파라미터 불필요 — 컨텍스트 창은 항상 100만.
OpenAI SDK (Python)를 통한 Kimi K3
import openai
client = openai.OpenAI(
api_key="YOUR_MOONSHOT_KEY",
base_url="https://api.moonshot.cn/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Refactor this 5,000-line Python codebase..."}],
)
print(response.choices[0].message.content)OpenRouter를 통해 (단일 API 키, Claude나 GPT에 K3를 쉽게 A/B):
OpenRouter를 통한 Kimi K3
import openai
client = openai.OpenAI(
api_key="YOUR_OPENROUTER_KEY",
base_url="https://openrouter.ai/api/v1",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[{"role": "user", "content": "Review this TypeScript and suggest optimizations."}],
)
print(response.choices[0].message.content)오픈 웨이트 (2026년 7월 27일부터 셀프 호스팅): 웨이트는 Moonshot AI의 조직 페이지 아래 Hugging Face에 릴리스됩니다. 모델은 MXFP4 양자화로 네이티브 배송; 광범위한 하드웨어 호환성이 명시적 설계 목표였음. 전체 하드웨어 요구사항은 릴리스 시 확인될 것.
K2 vs K3: 어느 것에 손을 뻗을지
Claude 사용자를 위한 Kimi K2 페이지에서 이미 K2 도구링이 있을 수 있습니다. 결정하는 방법:
| Kimi K2 (1T param) | Kimi K3 (2.8T param) | |
|---|---|---|
| 총 파라미터 | 1조 | 2.8조 |
| 토큰당 활성 파라미터 | ~32B | ~16/896 전문가 |
| 네이티브 비전 | 아니오 | 예 |
| 컨텍스트 창 | 128K | 1M |
| 오픈 웨이트 사용 가능 | 지금 | 2026년 7월 27일 |
| 벤치마크 랭크 | ~7위 (Artificial Analysis) | 4위 |
| 출력 비용 | 더 낮음 | $15/M (캐시로 상쇄) |
| 최적 대상 | 비용 의식적 에이전틱 도구 사용, 지금 셀프 호스팅 | 롱 호라이즌 시각 코딩, 큰 리포, 멀티모달 작업 |
K3에 손을 뻗을 때: 프론티어 티어 품질(상위 5 모델)이 필요, 작업이 길고 프롬프트 캐시에 반복해서 히트할 가능성이 크거나, 비전이 필요. 컴플라이언스/프라이버시를 위해 오픈 웨이트를 원하지만 7월 27일까지 기다릴 수 있다면 특히 유용.
K2에 남을 때: 지금 셀프 호스팅해야 함, 비용이 주 제약이고 작업이 K3의 추가 깊이에서 이익을 얻지 않음, 또는 이미 작동하는 도구링으로 K2를 프로덕션에서 실행 중.
퀴즈
Check yourself
0/4출처 및 추가 자료
- Kimi K3 공식 기술 블로그 — Moonshot AI — 아키텍처 스펙, 스케일링 주장, 시연된 능력
- Kimi K3 퀵스타트 — Kimi API 플랫폼 — API 문서와 모델 ID
- OpenRouter의 Kimi K3 — 집계된 가격과 벤치마크 개요
- Kimi K3에 관한 Simon Willison — 펠리컨 벤치마크와 비용 세부 내역을 포함한 독립 분석
- Kimi K3 완전 가이드 — Coder Sera — 벤치마크 집계와 작업 레벨 비용 비교
- Tom's Hardware: Moonshot이 2.8T Kimi K3 릴리스 — 하드웨어와 지정학적 컨텍스트
- 관련: Claude 사용자를 위한 Kimi K2 — K2는 지금도 웨이트가 즉시 셀프 호스팅 가능한 상태로 사용 가능
- 관련: DeepSeek, Qwen & 오픈 웨이트 물결 — 더 넓은 오픈 웨이트 환경
- 관련: 모델 선택 — 오픈 웨이트 vs 폐쇄 프론티어를 언제 선택할지