본문으로 건너뛰기

Inkling: Thinking Machines의 오픈 웨이트 모델

중급

2026년 7월 15일, Mira Murati의 연구소인 Thinking Machines Lab은 첫 자체 모델 Inkling을 Apache 2.0 라이선스의 오픈 웨이트로 공개했다. 이 모델은 하룻밤 사이에 Hacker News 첫 페이지에 올랐고, 보도는 게으른 두 가지 형태로 굳어졌다. "1조 파라미터 오픈 모델!"과 이 모델이 지고 있는 것을 보여주는 벤치마크 표.

둘 다 핵심을 놓쳤다. Inkling은 의도적으로 리더보드 정상을 노리지 않는 이례적인 출시이며, 그 가장 흥미로운 기능 — 가중치에 훈련되어 들어간 연속적인 사고 노력 다이얼 — 은 첫 보도의 물결 속에서 널리 잘못 묘사되었다. 이 페이지는 실무적 관점의 정리다.

What you'll learn
  • Inkling이 실제로 무엇인지 이해하기: 41B가 활성인 975B 희소 MoE, Apache 2.0, 1M 컨텍스트, 텍스트/이미지/오디오/비디오를 아우르는 네이티브 멀티모달
  • 사고 노력 다이얼이 진짜 무엇인지 배우기 — API 래퍼가 보여주는 이산적인 low/medium/high 열거형이 아니라, RL로 훈련된 연속적인 실수(float)
  • '오픈 웨이트'가 '당신의 기기에서 실행된다'를 의미하지 않는 이유 알기 — 양자화해도 실제 VRAM 하한은 약 600GB
  • Inkling이 왜 일부러 벤치마크에서 지는지, 그리고 아무도 헤드라인에 넣지 않은, 그것이 이기는 유일한 지표 알기

한 문장 요약

Inkling은 총 975B 파라미터에 토큰당 41B가 활성인 Mixture-of-Experts 트랜스포머로, 텍스트·이미지·오디오·비디오의 45조 토큰으로 사전학습되었고, 1M 토큰 컨텍스트 윈도를 지원하며, Apache 2.0으로 공개되었다 — 가장 뛰어난 사용 가능한 모델이 아니라 커스터마이즈하기에 가장 좋은 기반으로 자리매김했다.

그 마지막 구절이 전략의 전부다. Thinking Machines는 이를 명백히 밝힌다. Inkling은 "오늘날 사용 가능한, 오픈이든 클로즈드든, 가장 강력한 전반적 모델이 아니다." 그 문장과 함께 모델을 출시하는 것은 겸손이 아니라 포지셔닝이며 — 이는 아래의 모든 설계 결정을 설명한다.

사람들을 놀라게 하는 네 가지

1. 노력 다이얼은 실수(float)이며, 뉴스는 그 범위를 틀렸다

이것이 대표 기능이고 출시에서 가장 잘못 보도된 세부사항이다. 여러 매체가 노력 파라미터를 "0.2에서 0.99까지"로 범위를 설명하거나, 이름 붙은 열거형 — none | minimal | low | medium | high | xhigh — 으로 묘사했다.

공식 Tinker 문서는 다르게 말한다. 노력은 연속적인 추론 노력 컨디셔닝이다. 0.0을 포함해 1.0 직전까지의 모든 실수 값이 가능하다(1.0은 포함하지 않음). 기본값은 0.9다. 이름 붙은 레벨들은 그저 권장 스윕 값일 뿐, 실제 인터페이스가 아니다.

프리셋
none0.0
minimal0.1
low0.2
medium0.7
high0.9
xhigh0.99

보도된 0.2 하한은 단지 low 프리셋일 뿐 — 한계가 아니다. 0.45를 넘기는 것을 막는 것은 아무것도 없다. 또한 프리셋이 얼마나 비선형적인지 주목하라. low에서 medium까지의 간격은 0.5인 반면, high에서 xhigh까지는 0.09다. 유용한 해상도는 범위의 상단에 몰려 있다.

이것이 중요한 이유는 대부분의 사람이 reasoning_effort="high"를 노출하는 OpenAI 호환 래퍼를 통해 Inkling을 처음 접할 것이기 때문이다. 그 열거형은 연속적인 노브 위에 얹힌 손실 있는 어댑터다. 비용 대 품질을 조율하고 있다면, 그 열거형은 다이얼의 대부분을 숨긴다.

Tinker 렌더러로 노력을 직접 설정하기

renderer = TmlV0Renderer(get_tokenizer("thinkingmachines/Inkling"))
messages = [Message(role="user", content="Solve this problem step by step.")]
prompt = renderer.build_generation_prompt(messages, effort=0.9)

같은 effort 인자가 파인튜닝에도 이어지는데, 이것이 잠시 짚고 넘어갈 가치가 있는 부분이다 — 선택한 노력 수준에서 훈련할 수 있다.

고정된 노력 수준에서 파인튜닝하기

model_input, weights = renderer.build_supervised_example(
  messages_with_assistant_response,
  effort=0.9,
)

2. 노력은 프롬프트 트릭이 아니다 — 토큰 세금과 함께 훈련되어 들어갔다

다이얼이 연속적인 이유는 추론 시점에 덧붙여진 것이 아니기 때문이다. 강화학습 동안, 팀은 시스템 메시지를 바꾸고 토큰당 비용을 조정하여 노력을 설정했다 — 말 그대로 사고에 대해 모델에게 세금을 매긴 것이다. 모델은 서로 다른 롤아웃에 서로 다른 토큰 예산을 쓰도록 학습했고, 다이얼은 그 훈련의 잔여물이다.

이는 "부디 단계별로 생각해라, 다만 간결하게"와는 진정으로 다른 메커니즘이며, 그래서 그 성과가 실제적이다. Thinking Machines는 Inkling이 Terminal Bench 2.1에서 Nemotron 3 Ultra와 대등하면서도 추론 토큰을 약 3분의 1만 사용한다고 보고한다.

이는 또한 문서가 신중하게 명시하는, 당신이 진지하게 받아들여야 할 주의사항을 설명한다. "더 큰 값은 일반적으로 더 많은 추론을 유도하지만, 모든 샘플에서 더 긴 응답이나 더 높은 정확도를 보장하지는 않는다." 노력은 학습된 경향이지 보장이 아니다. 이를 0.99로 돌려놓고 단조로운 개선을 기대하는 것은 그것이 무엇인지에 대한 오독이다. 그리고 더 높은 노력은 "잘림을 피하기 위해 더 큰 생성 예산을 필요로 할 수 있다" — 최대 토큰을 올리지 않고 노력만 올리면 모델을 생각 도중에 끊게 될 것이다.

3. 오픈 웨이트지만, 당신은 거의 확실히 실행할 수 없다

"975B 파라미터, Apache 2.0, Hugging Face에 올라온 가중치"는 하드웨어 표가 무너뜨리는 가정을 부른다.

수치 형식총합 VRAM 하한예시 구성
BF16최소 2 TBNVIDIA B300 8개, 또는 NVIDIA H200 16개
NVFP4 (W4A4)최소 600 GBNVIDIA B300 4개
NVFP4 (W4A16)최소 600 GBNVIDIA H200 8개

완전히 4비트로 양자화해도 하한은 대략 총합 600GB의 VRAM이다. 이것은 워크스테이션 모델이 아니라 멀티-GPU-클러스터 모델이며, 노트북 모델은 근처에도 못 간다. 41B의 활성 파라미터는 토큰을 통과시키는 것을 저렴하게 만들지만, 메모리에 담아둬야 하는 것을 줄이는 데는 아무 역할도 하지 않는다. 975B 파라미터 전부가 상주해야 하는데, 라우터가 어떤 토큰에서든 그중 무엇이든 집어올 수 있기 때문이다.

오픈 웨이트에 대한 당신의 관심이 "로컬에서 실행하기"라면, Inkling은 잘못된 모델이고 Ollama로 로컬에서 모델 실행하기가 올바른 페이지다. 관심이 수정하고 상업화할 법적 자유 — Apache 2.0, 진정으로 관대한 — 라면, Inkling은 자격을 갖췄고, GPU는 TogetherAI, Fireworks, Modal, Databricks 또는 Baseten에서 빌릴 것이다. 이것들은 오픈 웨이트를 원하는 서로 다른 이유이며, 이 출시는 두 번째 것에만 부합한다.

4. 일부러 벤치마크에서 진다 — 그리고 아무도 보도하지 않은 하나에서 이긴다

벤치마크 표는 볼품없고, Thinking Machines는 그럼에도 그것을 공개했다.

벤치마크Inkling더 강한 경쟁자
Terminal Bench 2.163.8%GLM 5.2: 82.7%
SWEBench Verified77.6%Kimi K2.6: 80.2%
SimpleQA Verified43.9%DeepSeek V4 Pro: 57.0%
FORTRESS Adversarial78.0%Nemotron 3 Ultra: 77.6%

세 번의 패배, 한 번의 근소한 승리. 하지만 흥미로운 결과는 그 표에 전혀 없다 — 바로 캘리브레이션이다. 팀은 **적정 채점 규칙(proper scoring rules)**에 기반한 강화학습으로 훈련했는데, 이는 자신 있게 들리는 것이 아니라 "나는 70% 확신한다"고 말하고 실제로 70% 맞히는 모델에 보상을 준다. 모델은 자신 있게 틀린 답을 내놓는 대신 자신의 불확실성을 잘 추정하는 것에 대해 보상받았고, 이는 ForecastBench와 Prophet Arena 같은 예측 평가에서 드러난다.

틀렸지만 자신 있는 답이 얼버무린 답보다 더 큰 대가를 치르는 어떤 것이든 — 분류(triage), 리서치, 라우팅, 하류에 인간 검토자가 있는 추출 — 잘 캘리브레이션된 44%가 과신하는 57%보다 가치가 더 크다. 그 속성은 리더보드 열에 들어맞지 않는데, 이것이 대략 아무도 그것을 앞세우지 않은 이유다.

아키텍처, 간략히

파라미터 수 너머로 알아둘 만한 부분들:

Guided walkthrough1 of 5
  1. 66층 디코더 전용 트랜스포머. 각 층은 256개의 라우팅 전문가와 2개의 공유 전문가를 두고, 토큰당 6개의 라우팅 전문가가 활성화된다. 공유 전문가는 항상 발화한다 — 이들이 일반적 능력을 담당한다 — 반면 라우터는 토큰별로 전문가를 고른다.

무엇을 위한 것인가, 솔직히

Inkling에 손을 뻗을 때:

  • 유능한 멀티모달 모델을 소유하고 수정해야 할 때. Apache 2.0 + 진짜 멀티모달리티 + Tinker에서의 일급 파인튜닝 지원은 드문 조합이다. 이것이 의도된 용도다.
  • 최고 점수보다 태스크당 비용이 더 중요할 때. 추론 토큰 3분의 1에서의 노력 다이얼은 실제 지렛대이며, 세 단계가 아니라 연속적으로 조율할 수 있다.
  • 캘리브레이션이 중요할 때. 파이프라인이 "모델이 확신하지 못한다"에 따라 행동할 수 있다면, 이는 유별나게 잘 맞는다.

가장 강력한 코딩 에이전트를 원할 때(표는 GLM 5.2와 Kimi K2.6이 이를 이긴다고 말한다), 자신의 하드웨어에서 자체 호스팅하고 싶을 때(VRAM 하한 참조), 또는 최대의 사실 회상을 원할 때(SimpleQA 43.9%는 경쟁력이 없다)는 손을 뻗지 마라.

모델 카드가 직접 명시하는 안전 관련 참고 하나: Inkling에는 "유해한 주제와 관련해 롤플레이 및 간접적으로 구성된 프롬프트에 응하는 이따금의 잔여 경향"이 있으며, 카드는 내장 거부에 의존하기보다 외부 조정(moderation) 계층을 겹쳐 쌓을 것을 명시적으로 권장한다 — Llama Guard를 지목한다. VentureBeat는 이 모델의 태도를 "검열에 대한 저항"으로 틀 지웠지만, 대신 모델 카드 자체의 표현을 실행 지침으로 읽고, 이를 배포한다면 조정 계층을 위한 예산을 잡아라. 카드는 또한 통상적인 잔여 한계들을 나열한다. 환각, 불완전한 지시 이행, 그리고 긴 멀티턴 대화에서의 성능 저하.

Check yourself

0/4
  1. Inkling의 사고 노력 파라미터의 실제 유효 범위는 무엇인가?
  2. Inkling은 총 975B 중 41B의 활성 파라미터를 가진다. 이것이 메모리에 대해 의미하는 바는?
  3. Thinking Machines는 왜 Inkling을 RL에서 적정 채점 규칙으로 훈련했는가?
  4. effort=0.9 대신 effort=0.99로 설정하면 무엇이 보장되는가?

당신이 아는 것 곁에서 어디에 위치하는가

이미 Claude 사용자를 위한 Kimi K2를 읽었다면, 형태는 익숙하다 — 관대한 라이선스를 지닌 1조 규모의 희소 MoE — 하지만 의도는 다르다. Kimi K2는 긴 에이전트 도구 체인에 최적화되어 있다. Inkling은 재구성되는 것에 최적화되어 있다. 멀티모달 입력, 조율 가능한 노력 예산, 그리고 일급 경로로서의 파인튜닝.

더 넓은 그림을 위해서는 모델 선택하기, 오픈 웨이트 분야의 나머지에 대해서는 DeepSeek과 Qwen 오픈 모델, 그리고 노력 다이얼이 겨냥하는 경제학에 대해서는 제공업체별 AI 비용을 참조하라.

출처 및 더 읽을거리