AI Models & Assistants
Claude is our core — but the same skills travel. This section widens the lens to the whole AI world: the major assistants, how they differ, when to use which, and the techniques that transfer across all of them.
- Pick the right model for a job without re-learning the field every time
- Move between assistants — ChatGPT, Gemini, Grok, open models — without losing your technique
- Run capable models on your own machine, and know when that is worth it
- Combine Claude with local models and agent frameworks
Start here
If you read one page in this section, read this one. Everything below is a branch off it.
- How to choose a model — a durable framework that outlives any particular release.
Then follow whichever thread matches what you are doing.
The current flagships
The two September 2026 releases at the top of both stacks, read side by side.
- Claude Fable 5.1: what changed and how to migrate — three breaking changes, five betas, cache reads at a quarter of the price
- GPT-6 Astra: the field guide for Claude users — same list price, different bill, Critical-tier cyber classification
Coming from another assistant
You already know one tool and want your habits to carry over.
- ChatGPT for Claude users
- Gemini for Claude users
- Grok for Claude users
- Porting prompts across models — what transfers, what breaks
Comparing before you commit
- Claude vs GPT vs Gemini for coding
- Reasoning models compared
- What AI costs across providers
- Generative media: image, audio, video
Running models yourself
Local models trade some capability for privacy, cost control, and working offline. These pages cover when that trade is worth making.
- Run models locally with Ollama — the practical starting point
- Why a 35 KB system prompt breaks on a local model — context budgets, Ollama's silent middle-of-prompt truncation, and the failure signals to watch
- DeepSeek, Qwen & the open models
- DeepSeek V4-Flash-Vision: first native-vision frontier open weight
- Colibrì: run a 744B MoE from your SSD — expert streaming on 16–32 GB machines, and what it really costs in tok/s
- A private local AI stack
- Claude plus local models — using both, deliberately
Agents beyond Claude
- Local AI agents
- Open-source agent frameworks
- Claude, MCP and local tools
- A2A: the agent-to-agent protocol
- Agent payments: x402, MPP and AgentCore GA — how agents actually pay for things now
- OpenAI Agents API vs Claude Managed Agents — the two hosted agent loops side by side: permissions, vaults, budgets, network policy, sandbox cost
Everything in this section
The full list, including pages added since this index was written.
AI Models & Assistants
Claude is the core here, but the same skills travel. Start with how to choose, then go as deep as you need on any assistant, on running models locally, or on agents.
AI 모델 지형도: Claude, ChatGPT, Gemini 및 오픈 모델 중에서 고르기
작업에 맞는 AI 모델을 고르기 위한 오래 통하는 프레임워크 — Claude, ChatGPT, Gemini, Llama, Mistral, Grok 및 오픈/로컬 모델 전반에 걸쳐 — 그리고 이 모든 모델에 공통으로 전이되는 기술.
Claude Fable 5.1: What Changed and How to Migrate
Anthropic shipped Claude Fable 5.1 and Mythos 5.1 on September 1, 2026: same $10/$50 price, cache reads cut to $0.25, three breaking API changes (forced tool_choice errors, one-way thinking blocks, append-only history) and five additive betas. The migration field guide for anyone pinning claude-fable-5 or claude-opus-5.
Claude Fable 5 & Mythos 5: 플래그십 필드 가이드
Fable 5는 Anthropic의 가장 유능한 모델입니다. API는 인-밴드로 거부(HTTP 200, stop_reason: refusal)하며, 적응형 thinking만 있고, 원시 thinking을 반환하지 않습니다. 최상위 모델을 고정한다면 통합을 작성하는 방식이 바뀝니다. Opus 4.8 대비 언제 사용할지, fallback 패턴, 프롬프팅 전환.
Claude Opus 5: 실전 가이드
Opus 5는 2026년 7월 24일에 출시되었으며, 두 달 만에 나온 Anthropic의 네 번째 모델입니다. Opus 4.8과 동일한 $5/$25 가격이지만 Frontier-Bench 점수는 두 배 이상, ARC-AGI-3는 다음으로 좋은 모델의 3배이며 새로운 xhigh/max effort 계층이 추가되었습니다. 중요한 벤치마크, 순진한 마이그레이션을 깨뜨리는 두 가지 400 오류, 그리고 Opus 5가 스택에서 Fable 5를 대체하는 시점을 다룹니다.
Claude Sonnet 5: 필드 가이드
Sonnet 5는 Claude Code의 새로운 기본값이자 Sonnet 4.6의 드롭인 후계자입니다. 하지만 마이그레이션 시 400 오류를 유발하는 API 제약이 세 가지 있고, 새 토크나이저는 동일 텍스트에 대해 약 30% 더 많은 토큰을 생성합니다. 가격 계산, effort 재매핑(Sonnet 5 medium ≈ Sonnet 4.6 high), 그리고 팀들이 자주 놓치는 프롬프팅 변화를 다룹니다.
Claude 사용자를 위한 ChatGPT
Claude에 능숙하지만 ChatGPT를 써야 하나요? 중요한 차이점, 그대로 옮겨지는 것, 그리고 각각 언제 손을 뻗어야 하는지.
Claude 사용자를 위한 GPT-5.6와 ChatGPT Work
OpenAI는 2026년 7월 9일 GPT-5.6 제품군(Sol, Terra, Luna)과 ChatGPT Work를 출시했다. Claude 사용자에게 실제로 무엇이 바뀌었는가 — 1.05M 컨텍스트, $1 티어, 몇 시간 동안 스스로 일하는 에이전트, 그리고 아무도 다루지 않은 부분들.
GPT-5.6 2026년 8월 업데이트: 노력 슬라이더, 무료 Think 버튼 & 272K 가격 절벽
2026년 8월 6일 OpenAI가 GPT-5.6에 대한 사이클 중간 업데이트를 배포했고, 대부분의 리뷰는 이를 'Sol이 더 똑똑해졌다'로 축약했다. 진짜 이야기: 요청 가격 방식을 바꾸는 6단계 노력 제어, 무료 계층 Think 버튼, 전체 호출을 다시 가격 매기는 272K 토큰 가격 절벽, Sol에서만 작동하는 Fast 모드. Claude 사용자에게 각각 의미하는 바.
OpenAI Astra: 프리뷰 현장 노트
OpenAI의 '차세대 주요 모델' Astra는 2026년 8월 1일 Lean으로 검증된 열 개 수학 증명과 거의 없는 제품 스펙으로 프리뷰됐다. 실제로 확인된 것, 아직 알려지지 않은 것, 그리고 Claude 사용자가 기다려야 하는지 — 정직하고 출처가 있는 견해.
Codex Agent Plugins & 카탈로그 페더레이션 (v0.147.0): 실전 가이드
2026년 8월 7일 OpenAI가 Codex CLI v0.147.0을 출시했습니다 — Skills를 이식 가능한 Agent Plugins로 바꾸고 4계층 카탈로그를 도입하며, 이름과 다르게 작동하는 --approve-for-me 플래그를 추가하고, --full-auto를 조용히 제거하며 MCP 2026-07-28에 옵트인시키는 릴리스. Claude 사용자 관점에서 각 부분이 실제로 하는 일.
ChatGPT로 로그인
OpenAI의 새로운 아이덴티티 계층, 출시 3일 차. 실제로 어떤 데이터가 넘어가는지, 엔터프라이즈 관리자가 무엇을 할 수 있는지, 그리고 OpenAI에 의도치 않은 발판을 내주지 않으면서 자신의 앱에 이를 수용하는 방법.
Ollama로 AI 모델을 로컬에서 실행하기
오픈 웨이트 모델(Llama, Mistral, Qwen…)을 여러분의 컴퓨터에서 실행하세요 — 비공개, 오프라인, 무료로 — Ollama와 함께. 설치, CLI, 그리고 코드에서 호출하기.
코딩을 위한 Claude vs GPT vs Gemini
코딩용 프런티어 모델을 고르기 위한 프레임워크(순위표가 아님) — 중요한 요소들, 그리고 왜 당신의 저장소에서 돌린 평가가 모든 벤치마크를 이기는지.
코딩 에이전트 CLI 비교
Claude Code, Codex CLI, Gemini CLI 그리고 오픈소스 터미널 에이전트 — 모델뿐 아니라 하네스(harness)가 결과를 결정하는 방식, 그리고 AGENTS.md로 설정을 이식 가능하게 유지하는 법.
Supabase Evals — 실제 백엔드 에이전트 벤치마크
Supabase는 Claude Code, Codex, OpenCode를 목(mock)이 아닌 실제 컨테이너화된 Supabase 스택에서 실행하는 벤치마크를 오픈소스로 공개했습니다. 이 벤치마크가 무엇을 측정하는지, 모델이 실제로 문서와 스킬을 어떻게 사용하는지에 관한 발견, 그리고 저녁 한나절에 로컬에서 실행하는 방법을 다룹니다.
Claude 사용자를 위한 Apple Foundation Models 3와 온디바이스 LLM 스택
Apple의 3세대 Foundation Models(AFM 3)가 WWDC 2026에서 등장했습니다 — 3B 밀집 온디바이스 모델, iPhone에서 실행되는 20B 스파스 MoE, 그리고 이제 여러분의 LLM 프로바이더(Claude 포함)를 가져올 수 있게 하는 Swift 네이티브 프레임워크. 실제로 출시된 것, 명백하지 않은 메커니즘, 그리고 Claude 앱을 배포하는 사람에게 온디바이스 스토리를 어떻게 바꾸는지.
Claude 사용자를 위한 Gemini
Claude에 익숙한데 구글의 Gemini가 필요하신가요? 중요한 차이점들 — Gems, Workspace 통합, 거대한 컨텍스트, 멀티모달 — 그리고 무엇이 그대로 이어지는지.
Claude 사용자를 위한 Gemini 3.6 Flash, Flash-Lite 그리고 Flash Cyber
2026년 7월 21일 Google은 Gemini 3.5 Pro를 완전히 건너뛰고 대신 세 개의 Flash-티어 모델을 출시했습니다. 실제 가격, 실제 벤치마크, 마이그레이션 함정, 그리고 대부분의 리뷰가 놓치는 부분 — Claude Opus 4.6을 V8 버그 사냥에서 이긴 사이버보안 파인튠 포함.
Gemini 3.7 Flash for Claude Users: Coding-Agent Workhorse at Half Price (Aug 2026)
On 13 August 2026, three weeks after 3.6 Flash, Google shipped Gemini 3.7 Flash at half the introductory price with a 16-point DeepSWE jump. The gotchas most write-ups skip: an expiring intro price, a 3× throughput advantage that matters for agent loops but not chat, and where it still trails Claude Sonnet 5.
Claude 사용자를 위한 Grok
Claude에 능숙한데 xAI의 Grok이 필요한가요? 중요한 차이점들 — 실시간 X/웹 검색, OpenAI 호환 API, Grok Build 코딩 에이전트 — 그리고 그대로 옮겨지는 모든 것.
Muse Code + Muse Spark 1.2: Meta의 터미널 코딩 에이전트
2026년 8월 5일, Meta는 터미널 코딩 에이전트인 Muse Code와 함께 co-training된 모델 Muse Spark 1.2를 출시했습니다. append-only 이벤트 로그가 실제로 무엇을 제공하는지, contributor 티어가 표준 대비 왜 12.5배 저렴한지, Terminal-Bench 2.1에서 Claude Code와 어떻게 비교되는지, 그리고 어떤 에이전트를 쓰든 훔쳐올 만한 세 가지 번들 스킬은 무엇인지.
오픈소스 AI 에이전트 프레임워크
LLM 에이전트를 구축하기 위한 주요 오픈 프레임워크 — LangGraph, LlamaIndex, AutoGen, CrewAI 그리고 최소 루프 접근 방식 — 에 대한 공급자 중립적인 지도와 선택 방법.
네이티브 멀티 에이전트 API: OpenAI의 Responses 멀티 에이전트 베타 vs 직접 구축하기
2026년 7월 9일, OpenAI는 Responses API 멀티 에이전트 베타와 Sol Ultra Mode를 출시했습니다. '모델이 하나의 HTTP 요청으로 N개의 서브에이전트를 스폰하고 종합하는' 것을 최상위 프리미티브로 만든 최초의 프런티어 벤더입니다. 실제로 출시된 것, API 형태, 비용 계산, Anthropic의 대안, 그리고 네이티브 프리미티브가 DIY 팬아웃을 이기는 경우를 다룹니다.
A2A: 에이전트 간 프로토콜
MCP는 에이전트를 도구에 연결합니다. A2A는 에이전트를 다른 에이전트에 연결합니다 — 프레임워크, 클라우드, 회사를 넘나들며. Agent Card, task, 여덟 가지 라이프사이클 상태, 스트리밍 vs. 웹훅, 그리고 A2A가 MCP와 어떻게 결합되는지 배우세요.
Agent Payments: x402, MPP and AgentCore GA
How AI agents actually pay for things now — the x402 HTTP-402 protocol, the exact/upto/batch-settlement schemes, facilitators, Amazon Bedrock AgentCore Payments' Aug 2026 GA (payment sessions, Coinbase Bazar MCP, Stripe Privy, Machine Payment Protocol), and how to add a paywall or a spending agent without inventing a wallet.
모델 간 프롬프트 이식하기
Claude, GPT, Gemini 및 오픈 모델 사이에서 프롬프트를 옮기는 법 — 깔끔하게 이전되는 부분, 모델별로 조정할 부분, 그리고 마이그레이션 워크플로.
모델 라우팅 패턴: 캐스케이드, 분류기, 그리고 실제로 배포되는 것
각 요청을 올바른 AI 모델로 보내기 위한 설계 패턴 — 규칙 기반, 분류기, 복잡도, 캐스케이드, 앙상블, 폴백. 각 패턴을 언제 사용해야 하는지, 무엇이 깨지는지, 그리고 2026년에 실제로 배포되는 레시피.
DeepSeek, Qwen 그리고 오픈 웨이트의 물결
강력한 오픈 웨이트 모델(DeepSeek, Qwen, Llama, Mistral)이 격차를 크게 좁혔습니다. '오픈 웨이트'가 무엇을 의미하는지, 폐쇄형 프런티어 대비 트레이드오프, 그리고 이를 활용하는 방법.
Qwen3.8-Max: 최초의 오픈 웨이트 Max급 모델 (가중치가 실제로 공개된다면)
2026년 8월 3일: 알리바바의 Qwen3.8-Max는 2.4T 파라미터 MoE(95B 활성), 1M 컨텍스트, OpenAI/Anthropic 규격 이중 API를 갖추고 API 전용으로 출시되었으며, OSWorld에서 GPT-5.6 Sol Max를 앞서는 벤치마크 점수를 기록했다. 진정으로 새로운 점, Hugging Face 페이지가 비어 있을 때 '오픈 웨이트'가 실제로 의미하는 바, 그리고 자체 호스팅을 비싸게 만드는 희소성 수학.
DeepSeek V4-Flash-Vision: First Native-Vision Frontier Open Weight
On Aug 31 2026 DeepSeek open-sourced V4-Flash-Vision-Exp — a 305B MoE that adds native vision to V4-Flash without hurting text agent scores, matches or beats Claude Opus 4.8 on ApexBench / Agents' Last Exam / ZeroBench at a fraction of the price, and ships MIT. The specific numbers, the hard 384-token-per-image cap most guides ignore, and the concrete way to run it.
Claude 사용자를 위한 Kimi K2
Claude에는 익숙한데 Moonshot의 Kimi K2가 궁금하신가요? Claude Code를 실제로 겨눌 수 있는 오픈 웨이트 에이전트형 모델 — Moonshot이 Anthropic 호환 엔드포인트를 제공하기 때문입니다. 진짜로 다른 점은 무엇이고, 무엇이 그대로 넘어오는지.
GLM-5.2: 오픈웨이트 프런티어 코딩 모델
Z.ai의 753B MoE (~40B 활성), 1M 토큰 컨텍스트, MIT 라이선스 — 장기 코딩에서 Claude Opus 4.8과 1점 이내로 근접, API 비용은 약 1/6. IndexShare가 실제로 하는 일, 로컬 실행 방법, 그리고 실제 환경에서 Claude Code를 이기는 지점.
Inkling: Thinking Machines의 오픈 웨이트 모델
Mira Murati의 Thinking Machines Lab이 Inkling을 출시했다 — 연속적인 사고 노력(thinking-effort) 다이얼을 갖춘 9750억 파라미터 Apache 2.0 멀티모달 MoE. 출시 보도가 무엇을 놓쳤는지, 왜 의도적으로 벤치마크에서 지는지, 그리고 그 노력 노브가 실제로 무엇을 하는지.
Kimi K3: 세계 최대 오픈 웨이트 모델
Moonshot AI의 2.8조 파라미터 오픈 웨이트 모델이 많은 벤치마크에서 Claude Opus 4.8을 이기고 Frontend Code Arena에서 1위. 아키텍처적으로 무엇이 다른지, 캐시 히트 가격이 비용 계산을 뒤집는 때, 손 뻗을 가치가 있는지.
Kimi K3 로컬 실행: vLLM, DSpark & 실제 하드웨어 청구서
2026년 Moonshot의 2.8T 오픈 웨이트 Kimi K3를 셀프 호스팅하기 위한 결정판 실전 가이드. DSpark speculative decoding이 실제로 하는 일, 최소 하드웨어(1× DGX B300 또는 16× DGX Spark), 정확한 vLLM serve 명령, 아무도 경고하지 않는 prefill/decode 비대칭, 호스팅 추론이 자체 랙을 언더컷할 때.
Grok Build 내부 들여다보기: 오픈 에이전트 하니스 읽기
xAI가 자사 코딩 에이전트의 전체 Rust 소스를 Apache 2.0으로 공개했다 — 에이전트 루프, 툴 레이어, TUI, 확장 시스템까지. 크레이트 맵이 에이전트 구축에 대해 가르쳐 주는 것, 여기서 '오픈 소스'가 왜 소스 공개(source-available)를 의미하는지, 그리고 트리에 여전히 남아 있는 데이터 수집기 코드가 무엇을 말해 주는지.
Poolside Laguna: 체급을 뛰어넘는 오픈 웨이트 코딩 모델
Poolside AI의 Laguna 패밀리(XS 2.1, S 2.1, M.1) — 3B–23B 활성 파라미터, 1M 토큰 컨텍스트, OpenMDW-1.1 라이선스를 가진 MoE 코딩 모델. 8B 활성의 S 2.1이 실제로 무엇을 이기는지, 왜 3B 활성의 XS 2.1이 MacBook에서 돌아가는지, 최초로 알려진 FP8 기반 RL 학습 파이프라인, 그리고 Claude, GLM-5.2, Kimi K3 대신 이 모델을 선택해야 할 때.
생성형 미디어: 이미지, 오디오 및 비디오 AI
텍스트 채팅을 넘어서 — 이미지, 비디오, 음성, 음악을 위한 AI 지도: 주요 도구, 지속되는 기술, 그리고 중요한 권리/윤리.
MiniMax H3 (Hailuo 3.0): 오픈 웨이트 옴니 비디오 모델
MiniMax는 33B 단일 스트림 트랜스포머를 오픈소스로 공개했습니다. 이 모델은 한 번의 패스로 네이티브 스테레오 오디오와 함께 2K 해상도의 4~15초 비디오를 생성합니다. 라이선스는 미국/EU/영국/한국에서의 셀프 호스팅을 조용히 차단하며, 오픈 베이스는 2K가 아닌 768p이고, 33B 파라미터 중 약 13B는 추론 시 건너뛸 수 있는 AdaLN 브랜치입니다. H3가 실제로 무엇이며, 비용은 얼마이고, 언제 클로즈드 비디오 API를 이길 수 있는지.
AI의 실제 비용 (제공업체별 비교)
제공업체 간 AI 비용을 비교하기 위한 견고한 프레임워크 — 가격 책정 원형, 워크로드 추정 방법, 청구액을 줄이는 레버, 그리고 오픈/로컬이 유리한 시점.
AI 에이전트가 토큰을 태우는 이유 (그리고 청구서를 억제하는 법)
에이전트 실행은 채팅보다 50~1000배 비싸다 — 모델이 멍청해져서가 아니라 컨텍스트 눈덩이 때문이다. 그 메커니즘, 놀라운 숫자들, 그리고 Claude, GPT, Gemini, 오픈 모델 전반에서 실제로 청구서를 줄이는 네 가지 레버.
로컬 AI 에이전트 구축하기
로컬 오픈 웨이트 모델로 완전히 자신의 머신에서 실행되는 자율 에이전트 — 프라이빗하고, 오프라인이며, 실행 비용이 무료입니다. 아키텍처, 트레이드오프, 그리고 시작하는 방법.
Claude + 로컬 모델: 하이브리드 패턴
Claude와 로컬 오픈웨이트 모델을 시너지로 함께 작동시키세요 — 라우터, 초안 후 다듬기, 프라이버시 마스킹, 대량 전처리 — 프런티어의 추론 능력을 로컬의 프라이버시와 비용으로.
AI 게이트웨이: LiteLLM, OpenRouter, Portkey, Vercel
프로덕션 AI 게이트웨이는 여러분의 앱과 모든 모델 — Claude, GPT, Gemini, Llama — 사이의 잃어버린 라우터입니다. LiteLLM, OpenRouter, Portkey, Vercel AI Gateway를 비교하고, Claude Code를 자체 프록시를 통해 배선하는 법.
로컬 코딩 에이전트 (그리고 Claude와의 조합 방법)
당신의 머신에서 실행되며 레포지토리를 편집하는 코딩 에이전트 — Aider, Cline, Continue, OpenHands, Claude Code — 품질을 위한 Claude 또는 프라이버시를 위한 로컬 모델로 구동됩니다.
MCP로 Claude를 로컬 도구 및 에이전트에 연결하기
Model Context Protocol을 사용하면 Claude가 여러분의 컴퓨터에서 비공개로 실행되는 도구, 데이터, 에이전트를 오케스트레이션할 수 있습니다 — Claude를 두뇌로, 로컬 기능을 손으로 삼는 시너지입니다. 로컬 MCP 서버를 추가하거나 직접 만들어 보세요.
프라이빗 로컬 AI 스택 구축하기 (엔드투엔드)
모든 것을 하나로 연결하기: 로컬 모델(Ollama) + 모델 비종속 에이전트 + 로컬 MCP 서버를 통한 도구 — 당신의 기기에서 동작하는 프라이빗 어시스턴트, Claude는 선택적 스마트 레이어로.
로컬 에이전트 vs Claude: 의사결정 가이드
완전 로컬 에이전트, Claude 기반, 아니면 하이브리드? 이를 결정하는 요인들 — 프라이버시, 작업 난이도, 비용, 지연 시간, 신뢰성 — 그리고 왜 하이브리드가 종종 이기는지.
로컬 및 하이브리드 에이전트 보안
파일을 편집하고 명령을 실행할 수 있는 에이전트는 강력하면서도 위험합니다. 최소 권한, 샌드박싱, 사람의 승인, 프롬프트 인젝션 방어, 예산 상한 — 에이전트를 안전하게 실행하는 방법.
추론 모델 비교
Claude, GPT, Gemini, DeepSeek, Qwen 전반의 사고 예산(thinking budget)과 추론 강도(reasoning effort) — 언제 사고에 토큰을 쓰고, 언제 쓰지 말아야 하는가.
전이중 음성 AI: 음성 에이전트가 갑자기 진짜가 된 이유
GPT-Live와 새로운 음성 네이티브 모델들은 말하면서 동시에 듣습니다. 전이중이 무엇을 바꾸는지, 어떻게 동작하는지, 그리고 지금의 음성 AI 지형.
Claude 음성과 Opus & Sonnet (2026년 7월): 추론 우선 음성 vs GPT-Live
Anthropic이 2026년 7월 23일 Claude 음성을 Opus, Sonnet, 그리고 연결 앱으로 개방했습니다 — 하지만 턴 기반 스택을 유지했습니다. 실제로 무엇이 바뀌었는지, 통화 도중 언제 모델을 전환할지, 그리고 이 설계 베팅이 OpenAI의 풀 듀플렉스 GPT-Live와 어떻게 다른지.
토큰 속도: AI 추론이 갑자기 10-15배 빨라진 이유
웨이퍼 스케일 칩과 LPU가 프런티어 모델을 초당 수백 토큰으로 서빙합니다. 추론 속도를 실제로 제한하는 것, 새로운 하드웨어 경쟁, 그리고 빠른 토큰이 에이전트·음성·추론을 바꾸는 이유.
컴퓨터 사용 에이전트 비교
Claude, GPT, Gemini 모두 이제 화면을 조작할 수 있습니다 — 하지만 각자 다른 액션 공간, 좌표 계약, 안전 게이트를 노출합니다. 실제로 무엇이 깨지고, 그것을 견디는 루프를 어떻게 만드는가.
AI 에이전트를 위한 공유 로그인 브라우저: ego lite 패턴
새로운 부류의 브라우저 — 2026년 7월 24일 GitHub Trending #1에 오른 ego lite가 최고의 예 — 는 Claude Code, Codex, Cursor, 그리고 어떤 코딩 에이전트든 여러분의 실제 로그인을 상속받는 격리된 Chromium 세션을 몰이하게 합니다. Spaces와 semantic snapshot이 실제로 해결하는 것, 왜 에이전트 작업에서 Playwright를 앞지르는지, 그리고 자율 프로세스와 세션 쿠키를 공유하는 보안 비용.
Cloudflare Kitesurf: The First Browser Runtime Built for AI Agents (Not Humans)
On August 6, 2026 Cloudflare launched Kitesurf, a stateless, agent-first browser that runs entirely in V8 isolates on Workers. It uses 3-7x less CPU and memory than Chromium on common agent tasks — at the cost of ~1.7x wall-clock time. Written in Rust, using Firefox's CSS parser (Stylo) and the Blitz rendering engine, drop-in compatible with Puppeteer/Playwright via the Chrome DevTools Protocol. This page: what changed, when to reach for it instead of headless Chrome, how to wire it into Claude Code / Codex / your MCP client, and the four things it flat-out can't do yet.
SKILL.md: 크로스 에이전트 오픈 표준
하나의 SKILL.md 파일, 서른두 개의 에이전트. Agent Skills 오픈 표준이 실제로 무엇인지, 점진적 공개(progressive disclosure)가 어떻게 컨텍스트 비용을 낮게 유지하는지, 무엇이 이식성을 깨뜨리는지, 그리고 Claude Code, Codex, Gemini CLI, Cursor에서 수정 없이 동작하는 스킬을 작성하는 방법.
Colibrì: Run a 744B MoE From Your SSD (and What It Really Costs You)
Colibrì is a pure-C, zero-dependency engine that runs GLM-5.2 (744B), Kimi K3 (2.8T), DeepSeek V4.1 Flash and six other frontier MoE models on a 16–32 GB machine by keeping the dense layers in RAM and streaming the routed experts from NVMe. This page explains the memory hierarchy, the numbers that decide whether it is usable for you (0.05 to 6.8 tok/s), the SSD-wear and speculative-decoding gotchas, and the exact commands to get a first token.
OpenAI Agents API vs Claude Managed Agents: The Hosted Agent Loop, Compared
On September 10, 2026 OpenAI put the Codex harness behind a single API call: the Agents API public beta — durable sessions, hosted or self-hosted sandboxes, automatic compaction, tool search, subagents. Anthropic has run the same shape since April as Managed Agents. Both use the same four primitives; they differ on permissions, secrets, budgets, network policy and what the sandbox costs. The side-by-side, the request shapes, the six gotchas, and when to pick which.
Why a 35 KB System Prompt Breaks on a Local Model
Moving a big Claude/GPT system prompt to Ollama or another local runtime: the context-budget math, Ollama's silent middle-of-prompt truncation, the failure signals of context exhaustion, and the restructuring that actually works.