본문으로 건너뛰기

추론 모델 비교

중급

추론 모델답하기 전에 사고하는 데 추가 연산을 씁니다 — 중간 단계로 이루어진 비공개 사고 사슬(chain)을 생성한 다음 최종 답변을 내놓습니다. 이는 오늘날 모든 주요 AI에서 어려운 문제의 정확도를 좌우하는 가장 큰 단일 지렛대입니다. 함정은 이렇습니다: 모든 제공사가 같은 아이디어를 *서로 다른 손잡이(knob)*로 노출하며, 과도하게 쓰면 아무 이득 없이 돈과 지연 시간만 낭비합니다. 이 레슨은 그 손잡이들을 나란히 매핑하여 Claude, GPT, Gemini, DeepSeek, Qwen 전반으로 스킬이 이전되도록 합니다.

What you'll learn
  • 테스트 시점 연산(사고)이 무엇을 사주고 무엇을 사주지 않는지 설명한다
  • 각 제공사의 추론 제어를 매핑한다: Claude effort, OpenAI reasoning.effort, Gemini thinkingBudget/thinkingLevel, DeepSeek reasoner, Qwen enable_thinking
  • 모든 것을 최대치로 기본 설정하는 대신 작업에 맞춰 사고 깊이를 고른다
  • 추론 트레이스를 각 API에서 올바르게 읽어내되 입력으로 다시 넣지 않는다
  • 흔한 함정을 피한다: 과잉 사고, 비활성화할 수 없는 모델, 그리고 effort를 품질 해결책으로 취급하는 것

하나의 아이디어: 사고는 스위치가 아니라 다이얼이다

모든 추론 모델은 같은 트레이드오프 위에 놓여 있습니다:

  • 사고를 덜 함 → 더 빠르고 더 저렴. 추출, 포맷팅, 단순 Q&A에 적합.
  • 사고를 더 함 → 진짜로 어려운 문제(다단계 수학, 까다로운 디버깅, 신중한 증명)에서 더 나음. 대신 지연 시간과 비용이 높아짐.

사람들이 걸려 넘어지는 함정: 이미 쉬웠던 작업에는 추가 사고가 아무것도 해주지 않습니다 — 지연 시간과 비용만 지불할 뿐입니다. 스킬은 답을 바꾸는 곳에 깊이를 쓰는 것입니다. 이 진실은 아래 모든 모델에서 동일하며, 다이얼의 이름만 바뀝니다.

이것은 Claude 전용 확장 사고 & Effort 레슨의 크로스-AI 형제 격입니다 — Claude Messages API 세부 사항은 그 레슨을 참고하세요.

1단계 — 손잡이를 건드리기 전에 작업을 분류하라

Guided walkthrough1 of 3
  1. 추출, 재포맷팅, 분류, 짧은 사실 조회 → 최소 또는 사고 없음. 사고는 도움이 되지 않고 지연 시간만 더한다.
Pro tip
  • 제공사의 medium/dynamic 기본값에서 시작하고, 품질이 눈에 띄게 요구하는 곳에서만 effort를 높여라.
  • 높은 effort는 모호한 프롬프트의 해결책이 아니다 — 더 명확한 사양이 보통 더 많은 사고를 이긴다.

2단계 — 제공사별 손잡이

같은 다이얼, 다섯 개의 서로 다른 제어 인터페이스. 이것이 모델 간에 워크로드를 이식할 때 열어두어야 할 표입니다.

제공사 / 모델제어사고 비활성화 가능?
Claude (확장 사고)effort 등급 (최신 모델은 깊이를 적응적으로 조절; 구형은 budget_tokens를 노출)Low / Medium / High예, 대부분에서 가능 — 낮은 등급을 쓰거나 사고를 생략
OpenAI GPT‑5.5 / o‑시리즈reasoning.effortminimal, low, medium (기본값), high, xhigh (GPT‑5.5 / Codex‑Max)minimal은 추론 토큰을 거의/전혀 내지 않음
Google Gemini 2.5thinkingBudget토큰 수; 0은 비활성화; -1 = dynamic (상한 ~8,192); 2.5 Pro는 128–32768 또는 -1 필요대부분의 2.5 모델에서 0
Google Gemini 3thinkingLevel (thinkingBudget와 함께 쓰지 말 것)등급형 레벨아니오 — Gemini 3.1 Pro는 비활성화 불가
DeepSeek R1 (deepseek-reasoner)전용 reasoner — 항상 사고함해당 없음 (오픈 웨이트, 로컬에서 실행)아니오 — 사고 전용 모델
Qwen3enable_thinking (하이브리드) + /think · /no_think 소프트 스위치on / off, 턴마다 토글예 — enable_thinking=False 또는 /no_think
Watch out
  • 일부 모델은 끄기 스위치를 제거한다: Gemini 3.1 Pro와 DeepSeek R1은 항상 사고한다. 이에 맞춰 지연 시간/비용을 계획하라 — 0으로 다이얼을 내릴 수 없다.
  • Gemini 3에서는 한 요청에 thinkingLevel과 thinkingBudget을 둘 다 설정하면 오류다. 하나만 골라라.
  • Gemini의 dynamic 모드(-1)는 사고를 ~8,192 토큰으로 제한한다 — 대부분의 작업에는 괜찮지만, 가장 어려운 문제에서는 단단한 상한선이 된다.

두 가지 계열

표를 위에서 아래로 읽으면 모델은 두 종류로 나뉩니다 — 어느 쪽을 쥐고 있는지 알면 무엇을 기대해야 하는지 알 수 있습니다:

  • 하이브리드 / 전환형 (Claude, OpenAI, Gemini 2.5, Qwen3): 하나의 모델, 요청마다 사고를 올리거나 내리거나 — 혹은 끌 수 있습니다. 어떤 호출은 사소하고 어떤 호출은 어려운 혼합 트래픽에 가장 좋습니다.
  • 전용 reasoner (DeepSeek R1; 실무상 Gemini 3.1 Pro): 모델이 항상 추론합니다. 포맷팅과 추출을 여기로 라우팅하지 마세요 — 모든 호출에 사고 세금을 지불하게 됩니다. 쉬운 트래픽을 위해서는 저렴한 비사고 모델을 로테이션에 두세요.

3단계 — 추론 트레이스를 올바르게 읽어라

모든 제공사는 사고를 답변과 분리해서 반환합니다 — 그리고 보편적인 규칙은 다음 턴에 추론을 입력으로 다시 붙여넣지 말라입니다. 오직 최종 답변만 되돌려 넣으세요(Claude의 경우, 도구 루프를 위해 API가 건네주는 서명된 사고 블록도 함께).

Guided walkthrough1 of 4
  1. 응답은 사고 블록에 이어 텍스트 블록으로 도착한다. message.content를 순회하며 block.type으로 분기하라.

같은 작업, 세 개의 다이얼 — 적응해서 쓸 수 있는 의사 설정(pseudo-config)

# Claude — balanced
thinking = {"type": "enabled", "budget_tokens": 8000}   # keep < max_tokens

# OpenAI — balanced
reasoning = {"effort": "medium"}

# Gemini 2.5 — let the model decide
thinking_config = {"thinking_budget": -1}   # dynamic; 0 to disable

# Qwen3 (local) — turn thinking OFF for a trivial call
chat_template_kwargs = {"enable_thinking": False}

4단계 — 사고를 쓰지 말아야 할 때

값비싼 실수는 모든 것을 최대치로 기본 설정하는 것입니다. 다음의 경우 사고를 건너뛰거나 최소화하세요:

  • 작업이 기계적일 때 (추출, 재포맷팅, 분류, 알려진 문자열 번역).
  • 빠듯한 지연 시간 예산 아래에 있을 때 (채팅 UI, 자동완성) — minimal/0//no_think를 사용하라.
  • 프롬프트가 불충분하게 명시되었을 때 — 모호한 작업에 사고를 더하면 더 나은 답이 아니라 자신만만한 헤맴이 나온다. 사양부터 고쳐라.
  • 몇 퍼센트포인트의 정확도가 수백만 호출에 걸쳐 토큰 청구서를 몇 배로 불리는 값어치가 없는 대량 배치 작업을 할 때.
Pro tip
  • 경험칙: 사고는 문제에 검증 가능한 정답이 있고 그것이 여러 개의 종속적 단계를 요구할 때 값어치를 한다. 정해진 정답 경로가 없는 개방형 생성에서는 별로 값어치가 없다.

퀴즈

Check yourself

0/4
  1. 이미 쉬웠던 작업에서 추가 사고는 무엇을 사주는가?
  2. 사실상 사고를 끌 수 없는 모델은 무엇인가?
  3. Gemini 2.5에서 thinkingBudget = -1은 무엇을 의미하는가?
  4. 모델의 추론 트레이스로 하지 말아야 할 것은 무엇인가?

플래시카드

모델 전반의 추론 제어 어휘
Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 7

출처 & 더 읽을거리