Claude 사용자를 위한 GPT-5.6와 ChatGPT Work
당신은 이미 Claude로 사고한다. 그런데 2026년 7월 9일, 타임라인 전체가 뒤집혔다. OpenAI가 GPT-5.6의 세 가지 변형인 Sol, Terra, Luna와 ChatGPT Work를 출시했다. ChatGPT Work는 목표를 받아 백그라운드에서 몇 시간 동안 스스로 작업하는 에이전트다. 동료가 "Sol로 갈아타야 할까?"라고 묻는다. 고객은 이미 Claude에서 돌리고 있는 워크플로 절반을 ChatGPT Work로 대체하고 싶어 한다. 이 페이지는 이 출시를 당신의 Claude 사고 모형에 매핑하고, 더 유용하게는 뉴스가 파묻어버린 부분들을 끄집어낸다 — 실제 가격, 정확한 벤치마크 격차, 아무도 예상하지 못한 1.05M 컨텍스트, 그리고 OpenAI가 여전히 Anthropic에게 지는 지점.
- 실제로 무엇이 출시됐는지 파악: Sol, Terra, Luna(그리고 Sol Ultra), 모두 1.05M 토큰 컨텍스트 창을 공유
- OpenAI가 공표하지 않은 방식으로 벤치마크 표 읽기 — GPT-5.6이 앞서는 지점과 Claude Fable 5가 여전히 이기는 지점
- ChatGPT Work 이해: 채팅 모드가 아니라, 몇 시간 뒤에 완성된 스프레드시트·덱·문서·웹앱을 돌려주는 백그라운드 에이전트
- 코딩·에이전트·브라우저 작업에서 Claude 대신 GPT-5.6 Sol을 꺼낼 때 — 그리고 여전히 Claude가 답인 때를 알기
한 문장으로 정리
GPT-5.6은 GPT-5 제품군의 세 티어 리프레시다 — Sol(플래그십), Terra(중간), Luna(예산형) — 모두 1.05M 토큰 컨텍스트 창과 128K 최대 출력을 공유하고, OpenAI는 에이전틱 코딩에서 54% 더 나은 토큰 효율을 공표했다. ChatGPT Work는 그 위에 얹은 새로운 자율 에이전트로, Codex를 흡수한 통합 데스크톱 앱으로 배포된다.
흥미로운 부분은 모델 리프레시 자체가 아니다 — 그건 예상된 일이었다. 흥미로운 건 출시의 모양이다. OpenAI는 이제 모델 + 에이전트 + IDE를 하나의 제품으로 출시하고 있으며, 워크호스 티어 가격(Luna에서 입력 $1 / 출력 $6)을 "저렴한 코딩 모델"의 역사적 위치보다 아래로 매기고 있다.
GPT-5.6 출시에서 사람들이 놓치는 세 가지
모두가 벤치마크 요약을 쓰고 있다. 대부분의 Claude 사용자가 첫 읽기에서 놓치는 부분은 다음과 같다.
1. 세 티어 모두 같은 1.05M 컨텍스트를 공유
OpenAI가 평소 출시하는 방식이 아니다. 이전 리프레시에서는 저렴한 티어가 위쪽으로 유도하기 위해 축소된 컨텍스트 창을 달고 나왔다. GPT-5.6에서는 Sol, Terra, Luna 모두 1.05M 토큰 컨텍스트와 128K 최대 출력을 명시한다 — 같은 모양이다. 즉, Luna가 입력 100만 토큰당 $1 / 출력 100만 토큰당 $6에 긴 컨텍스트 옵션으로 성립한다는 뜻이며, 단순 짧은 요청용이 아니다. 이는 RAG 파이프라인, 저장소 전체 검토, 긴 툴 루프의 셈법을 바꾼다. 대량 검색 작업에 Claude Haiku 스타일 티어를 잡고 있었다면, Luna가 이제 명백한 교차 검증 대상이다.
2. ChatGPT Work는 "채팅 모드"가 아니다 — 완성된 파일을 건네주는 백그라운드 에이전트다
OpenAI가 쓰는 표현이 시사적이다. ChatGPT Work와는 채팅하지 않고, 브리핑한다. 결과("이 다섯 벤더의 경쟁 분석을 만들어줘")를 주면, 연결된 앱과 파일에서 컨텍스트를 수집하고, 작업을 단계로 쪼개고, 몇 분에서 몇 시간 동안 독립적으로 일하고, 완성된 산출물 — 스프레드시트, 슬라이드 덱, 문서, 리포트, 또는 작동하는 웹앱 — 을 넘겨준다. Codex는 같은 데스크톱 앱으로 접혀 들어갔으니, ChatGPT Work가 코드 작성 표면도 소유한다. 이는 Anthropic이 Claude의 managed agents로 걸었던 것과 같은 "장기 자율 작업" 베팅이지만, 엔드유저 제품으로 먼저 출시되고 API는 두 번째로 나왔다. 출시일에 Pro / Enterprise / Edu에 배포됐고, Plus와 Business는 며칠 안에 따라왔다.
3. Sol은 OpenAI가 공표한 벤치마크에서 이긴다. Claude는 여전히 SWE-bench Pro를 앞선다.
마케팅 차트 너머를 보면, 그림은 "Sol이 새로운 왕"보다 더 뒤섞여 있다. OpenAI 자체 수치는 Sol이 Artificial Analysis Coding Agent Index에서 80을 찍는다고 말한다(Claude Fable 5 대비 약 +2.8), 그리고 이걸 절반 이하의 출력 토큰과 약 3분의 1의 비용으로 해낸다. 이건 진짜 승리다. 그러나 Fable 5는 여전히 SWE-Bench Pro를 크게 앞선다 — Sol은 거기서 ~64.6%로 들어온다 — 그리고 출시 보도는 그걸 파묻는 경향이 있다. 번역하자면 워크로드로 골라라, 보도자료가 아니라. "에이전트 인덱스" 스타일의 툴·브라우저 작업이라면 Sol이 이제 이겨야 할 모델이다. 의미 있는 컨텍스트를 갖춘 실제 저장소 버그 수정에서는 Anthropic이 여전히 우위다.
GPT-5.6 티어 표(2026년 7월 9일 기준)
| 모델 | 입력 $/1M | 출력 $/1M | 컨텍스트 | 최대 출력 | 포지셔닝 |
|---|---|---|---|---|---|
| Sol | $5 | $30 | 1.05M | 128K | 플래그십: 복잡한 추론, 코딩, 과학, 에이전트 |
| Terra | $2.50 | $15 | 1.05M | 128K | "GPT-5.5 성능을 절반 가격에" — 일상 작업 |
| Luna | $1 | $6 | 1.05M | 128K | 대량, 단순 작업; 예산형 긴 컨텍스트 |
| Sol Ultra | (미공개) | (미공개) | 1.05M | 128K | 일부 공표 벤치마크에 쓰인 더 높은 노력 Sol 티어; 다중 에이전트 Responses 베타를 노출하는 표면이기도 함 |
OpenAI가 공표한 벤치마크(Sol / Terra / Luna):
- Artificial Analysis Coding Agent Index v1.1: 80 / 77.4 / 74.6
- SWE-Bench Pro: 64.6% / 63.4% / 62.7% (Claude Fable 5가 여전히 앞섬)
- Terminal-Bench 2.1: 88.8% (Sol Ultra 91.9%) / 87.4% / 84.7%
- DeepSWE v1.1: 72.7% / 69.6% / 67.2%
- BrowseComp: 90.4% (Sol Ultra 92.2%) / 87.5% / 83.3%
- ExploitBench: 73.5% / 52.9% / 33.2%
마지막 줄 — ExploitBench — 은 오래 들여다볼 가치가 있다. Sol → Luna 하락이 73.5%에서 33.2%로, 목록의 다른 어떤 벤치마크보다 훨씬 가파르다. 그래서 OpenAI가 Sol에 대해서만 사이버보안 스토리에 기댔고, 연방 검토관들이 공개 전에 추가 시험을 위해 모델을 붙잡아둔 이유다.
ChatGPT Work, 해독
Claude에서 이전되는 것(대부분)
프롬프팅 감각은 여전히 통한다. 명확한 지시, 명시적 출력 형태, 소수 예시, 좋은 설명이 붙은 툴을 모델에 주는 것 — 모두 넘어간다. 이는 Claude 특유의 트릭이 아니라 명령 튜닝된 프런티어 모델의 속성이기 때문이다. 그 주장의 심층 버전은 porting prompts across models와 실용 가이드 ChatGPT for Claude users를 참조하라.
넘어갈 때 재설정할 두 가지:
- API 형태. Anthropic은
messagesAPI에tools블록을 쓰고, OpenAI는 Chat Completions(또는 Responses API)에tools를 쓰며 OpenAI 함수 호출 스키마를 사용한다. 같은 아이디어, 다른 와이어 포맷. - 모드로서의 추론, 단순 슬라이더가 아님. Claude는 thinking/effort 파라미터를 노출한다. GPT-5.6에서는 가장 날카로운 이득이 저렴한 티어에서 effort만 튜닝하는 것이 아니라 올바른 티어(Sol / Sol Ultra)를 고르는 데서 나타난다. 비용은 GPT-5.5보다 더 중요해졌다.
몇 줄로 시도
OpenAI SDK는 그대로다 — model을 GPT-5.6 변형에 맞추기만 하라:
Python에서 GPT-5.6 Sol 호출(OpenAI SDK)
from openai import OpenAI
client = OpenAI() # uses OPENAI_API_KEY
resp = client.chat.completions.create(
model="gpt-5.6-sol", # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
messages=[
{"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
{"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
],
# tools=[...] # OpenAI-style function/tool schema
)
print(resp.choices[0].message.content)- 복잡한 코딩, 에이전트 루프, 또는 Claude Opus 티어를 꺼냈을 법한 작업에는 Sol. 'GPT-5.5를 절반 가격에'라는 기본 워크호스에는 Terra. 검색, 추출, 분류, 기타 대량 작업에는 Luna — 공유된 1.05M 컨텍스트가 이를 장난감이 아닌 실제 옵션으로 만든다.
- 요청이 끝에 정의 가능한 산출물(스프레드시트, 덱, 리포트, 소규모 웹앱)을 갖는다면 ChatGPT Work에 브리핑하고 돌리게 하라. 대화나 의사결정 보조라면 일반 채팅에 머물러라.
- 각 툴을 좋은 제품 스펙처럼 설명하라: 명확한 이름, 한 줄 목적, 예시가 있는 파라미터 설명. GPT-5.6은 Claude와 같은 '주니어에게 툴을 주듯이' 규율에 반응한다.
- Sol/Terra/Luna 가격은 출력이 입력보다 6배 비싸다. 54% 효율 주장은 정확히 *출력*에 관한 것이다 — Claude 예산을 옮기기 전에 자기 워크로드에서 검증하라.
Claude 대신 GPT-5.6을 꺼낼 때
어느 쪽도 절대 우위는 아니다. GPT-5.6을 꺼낼 때:
- 1.05M 컨텍스트의 $1/$6 티어가 필요할 때. Luna는 현재 긴 컨텍스트로 프런티어에 근접한 품질을 얻는 가장 저렴한 방법이다. 이는 리브랜드가 아니라 새 능력이다.
- 작업이 브라우저 중심이거나 에이전트 인덱스 형태일 때. BrowseComp와 Coding Agent Index가 Sol의 가장 강한 카드다. 에이전트가 대부분의 시간을 브라우저나 셸에서 보낸다면 Sol이 이겨야 할 모델이다.
- 엔드유저 산출물로 완성된 스프레드시트/덱/리포트/앱을 만들기 위해 ChatGPT Work의 "브리핑 후 잊기" 워크플로를 원할 때. 에이전트 프레임워크를 스스로 붙일 필요 없이.
Claude를 꺼낼 때: 모델 주위의 관리형 플랫폼 — prompt caching, memory and context editing, managed agents, 컴퓨터 사용, 데스크톱 앱 — 을 원할 때, 그리고 특히 실제 저장소 소프트웨어 엔지니어링이 워크로드일 때. Fable 5가 여전히 SWE-Bench Pro를 큰 격차로 앞선다. 진행 중인 정면 대결은 Claude, GPT, Gemini for coding, 비용 관점은 what AI costs across providers를 보라.
Check yourself
0/3출처 및 더 읽을거리
- OpenAI launches its new family of models with GPT-5.6 (TechCrunch, 9 July 2026) — 출시 보도: 변형, 가격, ChatGPT Work 배포, "54% 더 나은 토큰 효율" 인용, Fable 5 비교
- OpenAI gets permission to roll out GPT-5.6 to the public on July 9 (Engadget) — 정부 검토 과정, Center for AI Standards and Innovation, 단계별 배포
- OpenAI Debuts ChatGPT Work Workplace AI Agent With GPT-5.6 (Forbes) — Altman 인용, 업무 포지셔닝, Claude 비교 대상
- OpenAI Launches ChatGPT Work Agent to Handle Complex Tasks (Bloomberg) — "몇 시간" 자율성 프레이밍, Codex 통합
- GPT-5.6: Models Explained, Benchmarks & Access (CometAPI) — 벤치마크 전체 표(SWE-Bench Pro, Terminal-Bench 2.1, DeepSWE, BrowseComp, ExploitBench, Coding Agent Index), 1.05M 컨텍스트 / 128K 출력 수치
- AILmanac 관련: OpenAI Astra: the preview field note · ChatGPT for Claude users · Claude, GPT & Gemini for coding · Porting prompts across models · What AI costs across providers · Coding-agent CLIs compared