Poolside Laguna: 체급을 뛰어넘는 오픈 웨이트 코딩 모델
2026년 7월 2일, NVIDIA의 참여와 함께 약 120억 달러 밸류에이션으로 20억 달러 규모의 자금을 조달한 미국 기반 파운데이션 모델 연구소 Poolside AI가 첫 공개 모델인 Laguna 패밀리를 출시했다. 관대한 OpenMDW-1.1 라이선스로 배포되는 세 개의 MoE 코딩 모델은 단일 사전 학습 코퍼스를 공유하며, 주로 어느 정도 크기의 머신을 겨냥하느냐에서 차이가 난다. 2주 뒤 이들은 Laguna S 2.1로 패밀리를 확장했는데, 이는 118B/8B 활성 MoE로 활성 파라미터가 6분의 1에 불과함에도 DeepSWE v1.1에서 DeepSeek-V4-Pro-Max를 이기며(40.4% vs 9.0%), 출시 시점 기준 해당 리더보드 상위 공개 점수인 **SWE-Bench Multilingual 78.5%**를 기록했다.
이 페이지는 Laguna 패밀리에 대한 실전 필드 가이드다. 각 크기가 실제로 흥미로운 이유, 대부분의 커버리지에서 놓친 두 가지 학습 파이프라인 선택, 폐쇄형 프런티어와 오픈 웨이트 경쟁자들에 대한 정직한 벤치마크 그림, 오늘 로컬에서 실행하는 방법, 그리고 Claude, GLM-5.2, Kimi K3 대신 Laguna를 선택하는 것이 옳은 구체적 작업들을 다룬다.
- 패밀리를 한눈에 파악 — 세 가지 크기, 하나의 코퍼스, 하나의 라이선스 — 그리고 어느 크기가 당신의 하드웨어에 맞는지
- 8B 활성 파라미터가 왜 1.6T 총 파라미터를 이길 수 있는지 이해: MoE 라우팅 + 코딩 특화 사후 학습
- SWE-Bench Multilingual, Terminal-Bench 2.1, DeepSWE v1.1, SWE-Bench Pro에 걸친 정직한 벤치마크 그림 읽기
- 모델의 동작을 형성하는 두 가지 학습 파이프라인의 최초 사례들 파악 — FP8 기반 RL과 멀티 하니스 학습
- OpenRouter를 통해 세 줄로 Laguna를 실행하거나, MacBook 또는 DGX Spark에서 GGUF/MLX로 로컬 실행
- Claude Opus 5, GLM-5.2, Kimi K3, GPT-5.5 대신 Laguna가 적절한 도구인 시점 결정
패밀리 한눈에 보기
세 개의 모델, 하나의 공유 사전 학습 실행, 세 가지 하드웨어 범위. 이는 의도적이다: Poolside는 한 번 사전 학습하고 크기별로 사후 학습했기에 패밀리 전체에서 성격이 일관되며, 작업 형태가 아니라 보유한 박스에 맞춰 크기를 선택하게 된다.
| 모델 | 총 파라미터 | 활성 파라미터 | 컨텍스트 | 타겟 하드웨어 | 라이선스 |
|---|---|---|---|---|---|
| Laguna XS 2.1 | 33B (MoE) | 3B | 최대 256K | 단일 노트북 / MacBook GPU | OpenMDW-1.1 |
| Laguna S 2.1 | 118B (MoE) | 8B | 최대 1M | FP8에서 단일 DGX Spark 또는 H200 | OpenMDW-1.1 |
| Laguna M.1 | 225B (MoE) | 23B | 256K+ | 엔터프라이즈 멀티 GPU 노드 | OpenMDW-1.1 |
이 표에서 얻는 세 가지 실용적 시사점:
- 패밀리 전체가 동일한 코퍼스를 사용. Laguna S 2.1의 사후 학습은 XS 2.1의 것 위에 새로운 데이터를 추가하지 않았다 — S 2.1 발표에서 이를 명시적으로 밝힌다. 동작 개선은 새 문서를 주입한 것이 아니라 더 큰 모델 클래스와 다른 사후 학습 레시피에서 나온다. 이는 파인튜닝 노하우가 크기 전반에 걸쳐 깔끔하게 전이된다는 의미다.
- 활성 파라미터 열이 추론 비용에 있어 중요하다. 8B 활성일 때 Laguna S 2.1은 토큰당 118B가 아니라 8B 밀집(dense) 모델의 컴퓨트 프로파일을 갖는다. 이것이 "단일 액셀러레이터에서 실행"과 "랙이 필요함"의 차이다.
- OpenMDW-1.1은 진짜 관대한 라이선스이지 소스 공개 라이선스가 아니다. 이 라이선스는 전통적인 오픈 소스 라이선스(가중치와 데이터를 깔끔하게 다루지 못함)와 상업적 사용을 슬쩍 금지하는 벤더의 "오픈" 라이선스 사이의 격차를 메우기 위해 Linux Foundation이 발행했다. 저작권, 특허, 데이터베이스, 영업 비밀에 걸쳐 무제한, 로열티 없는 권리를 부여하며, 출력물은 명시적으로 제약이 없다.
헤드라인에서는 명확하지 않은 세 가지
1. FP8 기반 RL은 마케팅이 아니라 실제 엔지니어링 돌파구
LLM 사후 학습을 위한 강화 학습은 역사적으로 BF16에서 실행되어 왔는데, FP8 정밀도에서의 그래디언트 노이즈가 RL이 제공하는 미세한 시그널을 날려버릴 것으로 가정되었기 때문이다. Poolside는 Laguna S 2.1이 FP8에서 RL로 학습된 최초의 프런티어 규모 모델이라고 공개적으로 주장한다. 사실이라면 — 2026년 8월 초 기준으로 반례가 등장하지 않았다 — 이는 RL 단계의 메모리 풋프린트를 절반으로 줄이고, 특정 클러스터가 이전에는 너무 비쌌던 작업에 RL 컴퓨트를 쓸 수 있게 한다.
사용자에게 실용적인 결과: Poolside의 RL 단계는 선택적이었다. 그들은 40만 9천 개의 학습 환경(터미널 83k, 소프트웨어 엔지니어링 168k)을 보고하며, SFT가 합성 데이터로부터 대부분의 동작을 부트스트래핑하고 RL은 가장 어려운 문제에 예약되었다. 이는 벤치마크 델타에 나타난다 — DeepSWE v1.1에서 사고 모드 부스트가 **16.5% → 40.4%**로 오른다 — 이는 RL이 모든 작업에 걸쳐 얇게 뿌려진 것이 아니라 어려운 추론에 좁게 사용되었을 때 예상할 수 있는 형태다.
2. 멀티 하니스 학습이 서드파티 에이전트 내부에서 무너지지 않는 이유
코딩 모델은 보통 하나의 에이전트 하니스(벤더 자체 스캐폴드) 내부에서 학습된 후 수십 개의 다른 하니스(Cursor, Cline, Aider, Continue, Kilo 등) 내부에 배포된다. 학습과 배포 하니스 사이의 격차는 "벤치마크에서는 됐다는데" 실패가 많이 발생하는 지점이다. Poolside는 여러 하니스에 걸쳐 있는 83k 터미널 환경과 168k 소프트웨어 엔지니어링 환경에서 Laguna를 학습시켰으며, 이것이 첫날부터 자체 스캐폴드 외부에서도 모델을 사용할 수 있게 한 메커니즘이라고 그들은 인정한다.
Laguna의 보고된 동작에서 멀티 하니스 학습의 가시적 표시: 끈기(하나의 실패한 도구 호출 후에도 접근 방식을 포기하지 않음), 검증 우선(출시 전 자체 출력을 다시 읽음), 자원 활용력(직접 경로가 막히면 대체 경로 찾기). 이는 다음 토큰 동작이 아니라 에이전트 동작이다 — 더 많은 사전 학습 데이터에서 얻을 수 있는 것이 아니다.
동일한 설계 선택에 직접 매핑되는 알려진 한계들은 놀라지 않도록 주목할 가치가 있다:
- Poolside의 네이티브 하니스 대비 서드파티 하니스의 약간의 스키마 변형에 어려움을 겪음 — 하니스는 40만 9천 개 학습 환경 중 무언가와 "충분히 비슷하게" 보여야 함.
- 배열 안의 중첩된 도구 호출에서 잘못 이스케이프된 JSON을 간혹 발생시킴. 드물지만 실제로 발생.
- 수학 경시 대회 문제를 과도하게 사고함 — 확장 사고가 AIME 스타일 작업에서 필요 이상으로 오래 실행됨. 코딩에는 괜찮지만 수학에는 낭비.
3. 활성 파라미터 비율이 비용에 관한 전부
눈길을 끄는 수치는 1.6T vs 8B다: Laguna S 2.1은 DeepSWE v1.1에서 DeepSeek-V4-Pro-Max(1.6T 총 파라미터)를 31.4점 차이로 이기면서 토큰당 파라미터의 6분의 1만 활성화한다. 하지만 유용한 프레이밍은 추론 비용이다:
| 모델 | 토큰당 활성 파라미터 | 대략적인 토큰당 컴퓨트 | 참조 API 가격* |
|---|---|---|---|
| Laguna XS 2.1 | 3B | 3B 밀집 등가 | 무료 티어 / $0.05 범위 |
| Laguna S 2.1 | 8B | 8B 밀집 등가 | M당 $0.10 입력 / $0.20 출력 (OpenRouter) |
| GLM-5.2 | ~40B | ~40B 밀집 등가 | M당 $1.20-1.40 입력 / $4.10-4.40 출력 |
| Kimi K3 | ~32B | ~32B 밀집 등가 | GLM 범위와 유사 |
| Claude Opus 5 (프런티어) | 밀집, 비공개 | 프런티어 | M당 $15 입력 / $75 출력 |
OpenRouter의 S 2.1과 Claude Opus 5 간의 토큰당 150배 격차는 헤드라인 만들기에는 공정한 싸움이 아니지만, 유용한 비율은 S 2.1 대 다른 오픈 웨이트 프런티어 모델(GLM-5.2, Kimi K3)이다: Laguna는 출력 토큰당 ~12배 저렴하며 SWE-Bench Multilingual 점수는 같은 리그에 있다. 이것이 모델에게 넘겨주기에 경제적으로 합리적인 작업이 무엇인지 바꿔놓는 가격 범위다.
벤치마크 그림 — 정직한 버전
S 2.1 출시에서 보고된 점수들로, Poolside 자체 포스트와 서드파티 커버리지 간에 교차 확인됨:
| 벤치마크 | Laguna S 2.1 | 측정 대상 | 참고 |
|---|---|---|---|
| SWE-Bench Multilingual | 78.5% | 여러 언어에 걸친 실제 GitHub 수정 작업 | 출시 시점 상위 공개 오픈 웨이트 점수 |
| Terminal-Bench 2.1 | 70.2% (사고 모드) / 60.4% (비사고 모드) | 긴 셸 워크플로 | ~10점 사고 모드 상승 |
| SWE-Bench Pro (Public) | 59.4% | 더 어려운 자율 리포지토리 레벨 수정 | 프런티어 폐쇄 모델이 여전히 앞섬 |
| DeepSWE v1.1 | 40.4% (사고 모드) / 16.5% (비사고 모드) | 어려운 SWE 벤치마크 | 활성 파라미터가 ~1/200임에도 9.0%의 DeepSeek-V4-Pro-Max를 이김 |
| SWE Atlas (Codebase QnA) | 46.2% | 대형 리포지토리 이해 | DeepSWE 수치보다 앞섬 |
| Toolathlon Verified | 49.7% | 멀티 도구 오케스트레이션 | 중간 수준 |
이를 읽는 세 가지 해석 규칙:
- 에이전틱 코딩 모델에 있어 진지하게 받아들일 수치는 SWE-Bench Multilingual과 Terminal-Bench 2.1이다. 이는 실제로 할당할 작업 — "실제 리포지토리에서 이 버그 고치기", "이 셸 워크플로를 그린으로 만들기" — 에 매핑된다. Poolside는 오픈 웨이트 진영에서 둘 다에서 선두이다.
- 가장 어려운 벤치마크에서는 여전히 폐쇄형 프런티어가 이긴다. Claude Fable 5와 Kimi K3가 SWE-Bench Pro와 Toolathlon의 일부 슬라이스에서 앞선다. Laguna의 출시를 "Anthropic이 졌다"로 읽지 말 것 — "코딩용 오픈 웨이트 천장이 방금 몇 점 위로 이동했다"로 읽을 것.
- 사고 모드는 공짜가 아니지만 대부분의 승리가 여기 있다. Terminal-Bench 60.4% → 70.2%, DeepSWE 16.5% → 40.4%. 비용 이유로 사고를 끄면 모델의 큰 부분을 포기하는 것이다.
Laguna 실행하기
- OpenRouter, Baseten Model Library, Vercel AI Gateway, Kilo/Cline/Hermes 통합 모두 첫날 접근을 제공. OpenRouter의 출시 정가: M당 $0.10 입력, $0.20 출력, 평가용 무료 256K 컨텍스트 티어. OpenAI 호환 chat completions 엔드포인트 — 베이스 URL과 모델 ID를 바꾸면 됨.
- XS 2.1 (33B/3B MoE)은 GGUF와 MLX 변환이 있음. 32-64GB MacBook에서 llama.cpp 또는 MLX 하에서 사용 가능한 속도로 실행됨. 노트북을 벗어나지 않는 코딩 어시스턴트를 원할 때 사용할 크기.
- 정밀도별 메모리 풋프린트: BF16 ~236GB (2대의 Spark 또는 멀티 GPU 노드 필요), FP8 ~118GB (단일 Spark 또는 H200), INT4 ~59GB (단일 Spark의 128GB 통합 메모리에 편안하게 들어감). vLLM, SGLang, Ollama 모두 출시 시점에 지원됨. 최신 NVIDIA 부품용 NVFP4 가중치도 공개됨.
- chat.poolside.ai는 인증 없이 대화형 평가를 위해 패밀리를 서비스함. 에이전트에 연결하기 전에 감각을 잡기 위해 사용.
OpenRouter를 통해 Laguna S 2.1 호출하기 (Python)
import os, openai
client = openai.OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
resp = client.chat.completions.create(
model="poolside/laguna-s-2.1",
messages=[
{"role": "system", "content": "You are a senior engineer. Reply with a unified diff, no prose."},
{"role": "user", "content": "Fix the off-by-one in this function:\n\ndef last_n(xs, n): return xs[-n-1:]"},
],
)
print(resp.choices[0].message.content)Laguna vs 대안 — 언제 선택할 것인가
2026년 8월 초 모델 지형 기준의 실용적 결정 지도:
| 작업 | 최적 선택 | 이유 |
|---|---|---|
| 예산에 민감한 장기 리포지토리 레벨 버그 수정 | Laguna S 2.1 | 상위 오픈 웨이트 SWE-Bench Multilingual, GLM-5.2 또는 Kimi K3보다 출력 토큰당 ~12배 저렴 |
| MacBook에서 에이전틱 코딩, 오프라인 필수 | Laguna XS 2.1 | 3B 활성 파라미터 + MLX 빌드; 이 크기에서 비교 가능한 SWE-Bench Multilingual을 달성하는 것은 없음 |
| 가장 어려운 작업에서의 절대적 프런티어 정확도, 비용 무관 | Claude Opus 5 또는 Fable 5 | 폐쇄형 프런티어가 여전히 SWE-Bench Pro와 가장 어려운 슬라이스에서 선두 |
| 리포지토리에 1M 토큰 컨텍스트, 관대한 라이선스 필요 | GLM-5.2 또는 Laguna S 2.1 | 둘 다 관대한 라이선스 하에 1M 컨텍스트 제공; GLM-5.2가 일반 추론에서 더 강하고, Laguna는 에이전틱 코딩에서 더 강함 |
| 엄격한 도구 호출 시맨틱이 필요한 멀티 도구 오케스트레이션 | Claude 또는 Kimi K3 | Laguna의 중간 수준 Toolathlon 점수와 알려진 JSON 이스케이핑 엣지 케이스로 인해 여기서는 기본 선택으로 약함 |
| 규제 환경, 데이터가 박스를 떠나지 않음 | Laguna S 2.1 셀프 호스팅 | OpenMDW-1.1이 무제한 상업적 사용 허용, 미국 출신 연구소; FP8이 단일 액셀러레이터에 들어감 |
한 줄 요약: Laguna는 작은 활성 파라미터 예산에서 프런티어급 코딩 동작을 원하고, 라이선스와 출신이 중요할 때의 현재 스위트 스팟이다. 그런 제약이 걸릴 때 사용; 그렇지 않을 때는 Claude나 폐쇄형 프런티어로 향할 것.
관련 자료
- GLM-5.2: 오픈 웨이트 프런티어 코딩 모델 — 다른 오픈 웨이트 리더에서의 직접 비교점; 동일한 1M 컨텍스트 목표를 위한 다른 아키텍처 트릭(IndexShare).
- Kimi K3 오픈 웨이트 프런티어 — 또 다른 주요 오픈 웨이트 프런티어 코딩 모델, 더 밀집한 파라미터, 다른 동작 범위.
- DeepSeek & Qwen: 오픈 모델 플레이북 — Laguna가 경쟁하는 오픈 웨이트 코딩 지형에 대한 배경.
- Ollama로 모델을 로컬에서 실행하기 — XS 2.1에 사용할 로컬 런타임.
- 로컬 코딩 에이전트 — XS 2.1이 로컬 에이전트 스토리에 들어맞는 위치.
- AI 게이트웨이: LiteLLM, OpenRouter, Portkey — 기존 OpenAI 호환 스택에 Laguna를 어떻게 넣을지.
- 프로바이더별 AI 비용 — Laguna의 비율이 보이게 하는 작업당 가격 관점.
이해도 점검
Check yourself
0/4출처 & 추가 자료
- Introducing Laguna S 2.1 — Poolside — 학습 파이프라인, 벤치마크 표, 추론 옵션이 담긴 출시 포스트.
- Poolside AI Launches Open-Weight 'Laguna' Coding Models — Open Source For You — XS 2.1 및 M.1 사양이 포함된 패밀리 개요.
- American AI startup Poolside launches free, high-performing open model Laguna XS.2 — VentureBeat — 초기 패밀리에 대한 7월 2일 출시 커버리지.
- Poolside drops Laguna S 2.1, an open-weight coding model that beats rivals 10x its size — VentureBeat — S 2.1의 비교 위치에 대한 출시 후 분석.
- Poolside Releases Laguna S 2.1 — MarkTechPost — 아키텍처 및 벤치마크 교차 확인.
- Laguna XS 2.1 review — explainx.ai — 실전 감상과 하드웨어 노트.
- OpenMDW license — Linux Foundation — 세 Laguna 모델이 모두 배포되는 라이선스.