GLM-5.2: 오픈웨이트 프런티어 코딩 모델
2026년 6월 13일, Z.ai(구 Zhipu AI)가 GLM-5.2를 공개했다 — 7,530억 파라미터 Mixture-of-Experts 모델, 1백만 토큰 컨텍스트, Hugging Face에 지역 제한 없는 MIT 라이선스로 게시됐다. 그 뒤 2주간 출시 자체보다 무시하기 힘든 세 가지 일이 벌어졌다: 장기 코딩 벤치마크에서 Claude Opus 4.8과 ~1점 이내에 안착했고, API 가격이 프런티어 대비 약 6배 낮았으며, Semgrep 보안팀이 GLM-5.2가 거의 스캐폴딩 없이 실제 IDOR 취약점 벤치마크에서 Claude Code를 능가했다고 조용히 보고했다.
이 페이지는 GLM-5.2에 대해 정말 비자명한 부분을 다룬다 — 1M 토큰 추론을 다룰 만하게 만드는 IndexShare 아키텍처 변경, Claude 및 GPT-5.5 대비 정직한 벤치마크 상황, 오늘 자체 호스팅 비용, 그리고 닫힌 프런티어 모델에 손을 뻗는 것보다 진짜 더 나은 도구인 지점.
- IndexShare가 무엇이며 왜 장기 컨텍스트 계산을 ~2.9배 줄이는지 이해 — 마케팅 숫자가 아닌 아키텍처적 이유
- 정직한 벤치마크 상황 읽기: GLM-5.2가 Claude Opus 4.8과 맞먹는 지점, 그렇지 않은 지점, 벤더 점수에서 신뢰할 것
- 실효 비용 수학 알기: 프런티어 가격의 Claude Opus 대비 M당 입력 ~$1.20–1.40 / 출력 ~$4.10–4.40
- GLM-5.2를 API로 세 줄로 돌리거나, vLLM 0.23+에서 자체 호스팅(FP8 및 2비트 경로 상세)
- GLM-5.2 vs Claude 선택 시점 — 명확히 이기는 두 작업, 명확히 지는 두 작업
한 문장 요약
GLM-5.2는 Z.ai의 오픈웨이트(MIT), 753B 전체 / ~40B 활성 희소 Mixture-of-Experts 모델로 1M 토큰 컨텍스트와 131,072 토큰 최대 출력을 갖추고 장기 에이전트 코딩용으로 설계됐다 — 닫힌 프런티어 API의 약 1/6 가격이며, 독립 평가에서는 자율 에이전트 작업에 중요한 코딩 벤치마크에서 Claude Opus 4.8과 1점 이내다.
헤드라인에서 드러나지 않는 GLM-5.2의 세 가지
1. IndexShare가 진짜 아키텍처 이야기다
GLM-5.2의 헤드라인 변경은 "더 큰 MoE"가 아니다 — IndexShare다. 희소 어텐션은 각 쿼리가 어떤 과거 토큰에 주목할지 정하는 인덱서가 필요하다. 그 인덱서를 층마다 돌리는 것은 1M 토큰 컨텍스트에서 비싸다. Z.ai의 IndexShare는 네 개의 희소 어텐션 층마다 같은 인덱서를 재사용해, 전체 1M 윈도우에서 토큰당 FLOP을 ~2.9배 줄인다.
실질적 결과: GLM-5.2는 완전 이차 어텐션 모델로 같은 일을 하면 경제적으로 말이 안 될 가격에 진짜 장기 컨텍스트 워크로드를 서빙할 수 있다. FP8 체크포인트(zai-org/GLM-5.2-FP8로 게시)가 131K 토큰 세션 여유를 두고 8× H200에서 돌아가는 이유이기도 하다; IndexShare 없이는 같은 하드웨어가 KV 캐시에서 훨씬 앞서 질식했을 것이다.
GLM-5.2는 추측 디코딩용 개선된 Multi-Token Prediction (MTP) 층도 탑재하며, Z.ai는 ~20% 수락 길이 향상을 보고한다 — 이는 논문 지표뿐 아니라 실제 추론에서 더 빠른 tokens/sec으로 나타난다.
2. 벤치마크 이야기는 "GPT-5.5 이김"보다 강하고 "Opus 이김"보다 약하다
벤더 표와 뉴스는 이를 슬로건으로 압축한다. 정직한 해석:
| 벤치마크 | GLM-5.2 | Claude Opus 4.8 | GPT-5.5 | 비고 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | ~85.0 | — | 장기 셸/에이전트 작업; 4점 격차 |
| SWE-bench Pro | 62.1 | — | 58.6 | 자율 저장소 수준 수정; GPT-5.5 앞섬, GLM-5.1 (58.4) 앞섬 |
| GPQA Diamond | 91.2 | — | — | 어려운 과학 QA; 강함 |
| AIME 2026 | 99.2 | — | — | 벤더 보고; 극단적 수치, 조심스럽게 다룰 것 |
| Artificial Analysis Intelligence Index | 51 | — | — | 출시 시 오픈웨이트 모델 중 최고 점수 |
| Code Arena (전 세계) | #2 | — | — | 닫힌 모델 하나 뒤 |
내재화할 두 가지:
- 에이전트 작업에 매핑되는 코딩 벤치마크(SWE-bench Pro, Terminal-Bench 2.1, Code Arena)에서 GLM-5.2는 Claude Opus 4.8에 더 가깝고 GPT-5.5에서 더 멀다. 오픈웨이트 모델로는 처음이다.
- 가장 어려운 추론 작업과 개방형 지식에서는 닫힌 프런티어 모델이 여전히 앞선다. AIME 99.2 헤드라인은 벤더 보고이며 독립 평가와 함께 읽어야 한다 — Z.ai의 Artificial Analysis Index 51점이 더 보정된 요약이다.
누군가 "GLM-5.2가 Claude Opus를 이겼다" 또는 "GLM-5.2가 GPT-5.5를 이겼다"고 링크할 때 어떤 벤치마크이고 누구의 측정인지 확인하라. 장기 코딩: Opus와 1점 이내, GPT-5.5보다 명백히 앞섬. 일반 추론: 여전히 닫힌 프런티어에 뒤짐. 둘 다 진실이다.
3. Nvidia가 아닌 Huawei Ascend NPU로 학습됐다
GLM-5.2는 Nvidia H100/H200이 아닌 Huawei Ascend 가속기로 학습된 것으로 보고된다. 이는 벤치마킹 디테일이 아니라 공급망 사실이다. Z.ai가 미국 Entity List에 있고 호스팅 API가 중국 인프라를 통해 라우팅된다는 점과 결합해 세 가지 실제 결정을 형성한다:
- 규제 환경은 프로덕션에 연결하기 전 호스팅 API를 수출 통제 정책과 비교해 평가해야 한다. MIT 가중치는 제한이 없다; API는 컴플라이언스 검토의 대체가 아니다.
- 데이터 민감 워크로드는 Z.ai의 API 엔드포인트에 프롬프트를 보내는 대신 자체 호스팅 경로(아래 참조)를 선호해야 한다.
- 애그리게이터(OpenRouter, NVIDIA Build, OpenRelay)는 Z.ai가 아닌 인프라로 GLM-5.2를 제공한다 — 모델은 원하지만 원본 라우팅은 원하지 않는다면 이 경로다.
실효 비용 수학
Z.ai의 자체 API 가격은 제공자 전반에 걸쳐 백만 입력 토큰당 약 $1.20–$1.40, 백만 출력 토큰당 $4.10–$4.40이다. 이를 Claude Opus 4.8 영역(프런티어 가격 $15/M 입력, $75/M 출력)과 비교하면 비율은 대략 입력 1:6, **출력 1:15+**이다. Semgrep의 IDOR 벤치마크는 GLM-5.2의 취약점당 비용을 ~$0.17로 측정했고, 프런티어 등가물은 수 달러였다.
놓치기 쉬운 함정: GLM-5.2는 모델 수준에서 "high" 또는 "max" 사고 노력으로 돌아가므로, 같은 작업에 대해 출력 토큰 수가 비사고 모델보다 높다. 작업당 비용은 여전히 낮지만, 비율은 토큰당 가격이 시사하는 만큼 극단적이지 않다 — 각각 더 낮은 가격에 답변당 더 많은 토큰을 지불하는 셈이다.
API로 시작하기
GLM-5.2는 OpenAI 호환 chat completions를 사용한다. 엔드포인트 URL과 모델 ID는 제공자마다 다르다 — 하나 고르기:
| 제공자 | 베이스 URL | 모델 ID | 환경 변수 |
|---|---|---|---|
| Z.ai (직접) | https://api.z.ai/api/paas/v4/ | glm-5.2 | ZAI_API_KEY |
| OpenRouter | https://openrouter.ai/api/v1 | z-ai/glm-5.2 | OPENROUTER_API_KEY |
| NVIDIA Build | https://integrate.api.nvidia.com/v1 | z-ai/glm-5.2 | NVIDIA_API_KEY |
| OpenRelay | https://inference.openrelay.inc/v1 | openrelay/glm-5.2 | OPENRELAY_API_KEY |
- 직접 접근은 z.ai에서 가입해 키를 생성한다. 애그리게이터 접근(미국 Entity List 반대편에 있다면 권장)은 OpenRouter나 NVIDIA Build를 사용한다.
- 공식 openai SDK가 수정 없이 작동한다 — base_url과 모델 이름만 변경한다. OpenAI API 형태 위에 지어진 프레임워크(LangChain, LlamaIndex, Vercel AI SDK)도 같은 방식으로 작동한다.
- 함수 호출, JSON 모드, 1M 토큰 컨텍스트 모두 표준 chat.completions 형태로 작동한다. 장기 컨텍스트를 '활성화'하는 특별한 매개변수는 없다 — 항상 사용 가능하다.
OpenAI SDK (Python)를 통한 GLM-5.2, OpenRouter 경유
import openai
client = openai.OpenAI(
api_key="YOUR_OPENROUTER_KEY",
base_url="https://openrouter.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.2",
messages=[
{"role": "user", "content": "Refactor this 800-line auth module for testability. Preserve behavior; return a unified diff."},
],
)
print(response.choices[0].message.content)Z.ai 직접 엔드포인트를 통한 GLM-5.2 (Python)
import openai
client = openai.OpenAI(
api_key="YOUR_ZAI_API_KEY",
base_url="https://api.z.ai/api/paas/v4/",
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[
{"role": "system", "content": "You are a careful staff engineer."},
{"role": "user", "content": "Review this repo and list the top 5 risks, with file:line references."},
],
)
print(response.choices[0].message.content)자체 호스팅: 세 가지 현실적 경로
MIT 라이선스와 게시된 FP8 가중치는 많은 팀에게 자체 호스팅을 요점으로 만든다. 하드웨어 많은 순부터 적은 순으로 세 가지 실제 경로:
경로 A — vLLM으로 8× H200에서 FP8 (프로덕션급)
레퍼런스 배포. 공식 FP8 체크포인트를 다운로드하고 vLLM 0.23.0+ (또는 SGLang 0.5.13.post1+)로 서빙한다. Z.ai의 자체 추론에 가장 가까운 구성이다; 131K 토큰 최대 출력과 안정적인 처리량을 준다.
vLLM으로 GLM-5.2 FP8를 8× H200에 배포
# 1) Download the FP8 weights (~750 GB) huggingface-cli download zai-org/GLM-5.2-FP8 \ --local-dir /models/glm-5.2-fp8 # 2) Serve with vLLM 0.23.0+ python -m vllm.entrypoints.openai.api_server \ --model /models/glm-5.2-fp8 \ --served-model-name glm-5.2-fp8 \ --tensor-parallel-size 8 \ --quantization fp8 \ --enable-expert-parallel \ --max-model-len 131072 \ --kv-cache-dtype fp8_e5m2 \ --gpu-memory-utilization 0.92 \ --enable-chunked-prefill \ --max-num-seqs 32 \ --port 8000
경로 B — Mac Studio 또는 24GB GPU + 256GB RAM에서 2비트 GGUF
Unsloth의 동적 2비트 GGUF는 GLM-5.2를 ~1.51TB에서 ~239GB로 압축한다 — **256GB Mac Studio (Ultra)**에 맞거나 24GB GPU와 256GB 시스템 RAM을 갖춘 워크스테이션에 맞을 만큼 작다(MoE 라우팅은 한 번에 몇 개 전문가만 활성 유지하므로 DRAM 오프로드가 작동한다). "실제로 매장에서 살 수 있는 하드웨어로 돌린다"의 경로다. H200 랙보다는 느린 tokens/sec을 예상하되 솔로 에이전트 워크로드에 사용 가능하다.
경로 C — 커뮤니티의 AWQ/W4A16 양자화
서드파티 양자화(예: QuantTrio/GLM-5-AWQ, PhalaCloud/GLM-5.2-W4AFP8)는 vLLM의 AWQ 커널과 호환되는 4비트 가중치 경로를 목표로 한다. FP8보다 작은 메모리 발자국을 원하지만 2비트 GGUF보다 여유를 원할 때 유용하다. Z.ai는 2026년 7월 말 기준 공식 AWQ 변형을 게시하지 않았다 — 프로덕션 사용 전 커뮤니티 버전의 캘리브레이션을 검증하라.
GLM-5.2를 어떤 계층에서든 자체 호스팅하려면 여전히 토크나이저와 채팅 템플릿에 주의가 필요하다. Hugging Face 모델 카드는 둘 다 제공한다; 프롬프트를 수동으로 조립하는 대신 add_generation_prompt=True로 apply_chat_template를 사용하라. 잘못 매칭된 템플릿은 "왜 내 오픈웨이트 모델이 API보다 훨씬 나쁜가?" 보고의 가장 흔한 원인이다.
GLM-5.2 vs Claude 선택
진짜 더 나은 도구인 두 작업:
- 비공개 코드베이스의 장기 자율 코딩. 자체 호스팅 FP8는 코드나 컨텍스트가 인프라를 벗어나지 않고 프런티어 인접 SWE-bench Pro 점수를 준다. Claude Opus 4.8은 Terminal-Bench 2.1에서 살짝 더 날카롭지만, 온프렘 추론의 컴플라이언스 승리는 종종 4퍼센트 포인트를 능가한다.
- 적대적 페이로드에 대한 보안 연구. Semgrep의 IDOR 실험(빈 프롬프트 하네스로 F1 39%, Claude Code 37%보다 앞섬)은 Claude의 안전 학습이 오탐을 일으키는 방어적 보안 작업에서 GLM-5.2가 유의미하게 덜 거부하는 경향임을 시사한다.
Claude가 여전히 더 나은 도구인 두 작업:
- 개방형 추론과 사실적 지식 질문. GLM-5.2는 일반 지식과 개방형 추론에서 닫힌 프런티어 모델에 뒤진다; Claude Opus/Sonnet 5와 Fable 5가 여기서 앞선다.
- 거부 모드 뉘앙스가 중요한 모든 것. Claude의 위해 회피는 더 미묘하다(합법 작업에 과도한 거부가 적고, 진짜 위해에 더 날카로운 정지). GLM-5.2의 안전층은 더 얇고 엣지 케이스에 덜 보정되어 있다.
크로스 링크: 더 넓은 오픈웨이트 지형은 DeepSeek, Qwen & 오픈웨이트 물결과 Kimi K3: 세계 최대 오픈웨이트 모델 참조. "이것을 로컬로 돌려야 하나?" 결정은 Local vs Claude agent 참조.
Semgrep의 IDOR 결과 한 문단
Semgrep은 취약점 데이터셋(실제 오픈소스 IDOR 결함), F1 채점, 시스템 프롬프트를 일정하게 유지하고 모델과 주변 하네스를 변화시켰다. GPT-5.5를 쓴 커스텀 Semgrep Multimodal 리그는 61% F1을 기록했다; Opus 4.8을 쓴 같은 리그는 **53%**를 기록했다. GLM-5.2를 프롬프트만 사용해 (bare Pydantic AI 하네스, 엔드포인트 열거 없음, 가이드 탐색 없음) 테스트했을 때 39% F1을 기록했다 — 같은 작업에서 Claude Code (37% F1)를 이겼고 취약점 발견당 ~$0.17, 프런티어 비용의 약 1/6이었다. 그들의 헤드라인: "We have Mythos at home." 중요한 주의: 하나의 작업, 하나의 데이터셋, 한 번의 실행 — 결과는 방향성이지 SSRF, XSS 등 다른 클래스에 일반화된다는 약속이 아니다.
퀴즈
Check yourself
0/5- GLM-5.2 (2026년 6월 13일)는 장기 코딩에서 Claude Opus 4.8과 1점 이내로 근접한 최초의 MIT 라이선스 오픈웨이트 모델 — 오픈웨이트 계층의 진짜 전환점.
- IndexShare가 아키텍처 이야기: 4개 층마다 재사용되는 희소 어텐션 인덱서, 1M 컨텍스트에서 ~2.9배 토큰당 계산 감소 — 장기 컨텍스트 서빙을 경제적으로 만듦.
- 실효 비용은 입력 토큰당 Claude Opus의 ~1/6, 더 높은 출력 토큰 수(기본으로 high/max 사고 켜짐)로 일부 상쇄. Semgrep은 발견된 IDOR 취약점당 ~$0.17로 측정.
- 세 가지 자체 호스팅 경로: vLLM으로 8× H200에서 FP8 (프로덕션), Mac Studio / 24GB + 256GB 박스에서 2비트 동적 GGUF (접근 가능), 또는 커뮤니티 AWQ/W4 양자화 (중간 지점).
- 비공개 장기 코딩과 방어적 보안 연구에는 GLM-5.2를 사용; 개방형 추론, 사실적 지식, 미묘한 안전 엣지에는 Claude 유지.
출처 및 추가 읽기
- zai-org/GLM-5.2 — Hugging Face 모델 카드 — 정통 사양: 753B 파라미터, MIT 라이선스, IndexShare 설명, 추론 스택 지원 매트릭스
- zai-org/GLM-5.2-FP8 — Hugging Face — 8× H200 배포에 사용되는 FP8 체크포인트
- zai-org/GLM-5.2 · vLLM Recipes — 레퍼런스 vLLM 서빙 구성
- MorphLLM: GLM-5.2 — 753B 오픈웨이트 코딩 모델, 벤치마크, 가격 — 가격과 Terminal-Bench / SWE-bench Pro 숫자
- DataNorth: Zhipu AI, GLM-5.2 오픈웨이트 AI 모델 출시 — 출시 맥락, IndexShare, 에이전트 환경 지원
- Semgrep: "We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks" — Claude Code 대비 IDOR F1 실험, 방법론과 주의사항 포함
- MarkTechPost: GLM-5.2 OpenAI 호환 API — 실습 가이드 — 추론 노력, 함수 호출, 검색 사용 패턴
- The AI Rankings: GLM-5 가격과 벤치마크 — 가격, 라이선스, Ascend 학습 세부사항
- ZCode configuration docs — Z.ai의 공식 하네스 — 직접 API 베이스 URL과 코딩 플랜 엔드포인트 차이
- AILmanac 관련: Kimi K3: 세계 최대 오픈웨이트 모델, DeepSeek, Qwen & 오픈웨이트 물결, Local vs Claude agent, 제공자별 AI 비용.