본문으로 건너뛰기

Poolside Laguna: 체급을 뛰어넘는 오픈 웨이트 코딩 모델

중급

2026년 7월 2일, NVIDIA의 참여와 함께 약 120억 달러 밸류에이션으로 20억 달러 규모의 자금을 조달한 미국 기반 파운데이션 모델 연구소 Poolside AI가 첫 공개 모델인 Laguna 패밀리를 출시했다. 관대한 OpenMDW-1.1 라이선스로 배포되는 세 개의 MoE 코딩 모델은 단일 사전 학습 코퍼스를 공유하며, 주로 어느 정도 크기의 머신을 겨냥하느냐에서 차이가 난다. 2주 뒤 이들은 Laguna S 2.1로 패밀리를 확장했는데, 이는 118B/8B 활성 MoE로 활성 파라미터가 6분의 1에 불과함에도 DeepSWE v1.1에서 DeepSeek-V4-Pro-Max를 이기며(40.4% vs 9.0%), 출시 시점 기준 해당 리더보드 상위 공개 점수인 **SWE-Bench Multilingual 78.5%**를 기록했다.

이 페이지는 Laguna 패밀리에 대한 실전 필드 가이드다. 각 크기가 실제로 흥미로운 이유, 대부분의 커버리지에서 놓친 두 가지 학습 파이프라인 선택, 폐쇄형 프런티어와 오픈 웨이트 경쟁자들에 대한 정직한 벤치마크 그림, 오늘 로컬에서 실행하는 방법, 그리고 Claude, GLM-5.2, Kimi K3 대신 Laguna를 선택하는 것이 옳은 구체적 작업들을 다룬다.

What you'll learn
  • 패밀리를 한눈에 파악 — 세 가지 크기, 하나의 코퍼스, 하나의 라이선스 — 그리고 어느 크기가 당신의 하드웨어에 맞는지
  • 8B 활성 파라미터가 왜 1.6T 총 파라미터를 이길 수 있는지 이해: MoE 라우팅 + 코딩 특화 사후 학습
  • SWE-Bench Multilingual, Terminal-Bench 2.1, DeepSWE v1.1, SWE-Bench Pro에 걸친 정직한 벤치마크 그림 읽기
  • 모델의 동작을 형성하는 두 가지 학습 파이프라인의 최초 사례들 파악 — FP8 기반 RL과 멀티 하니스 학습
  • OpenRouter를 통해 세 줄로 Laguna를 실행하거나, MacBook 또는 DGX Spark에서 GGUF/MLX로 로컬 실행
  • Claude Opus 5, GLM-5.2, Kimi K3, GPT-5.5 대신 Laguna가 적절한 도구인 시점 결정

패밀리 한눈에 보기

세 개의 모델, 하나의 공유 사전 학습 실행, 세 가지 하드웨어 범위. 이는 의도적이다: Poolside는 한 번 사전 학습하고 크기별로 사후 학습했기에 패밀리 전체에서 성격이 일관되며, 작업 형태가 아니라 보유한 박스에 맞춰 크기를 선택하게 된다.

모델총 파라미터활성 파라미터컨텍스트타겟 하드웨어라이선스
Laguna XS 2.133B (MoE)3B최대 256K단일 노트북 / MacBook GPUOpenMDW-1.1
Laguna S 2.1118B (MoE)8B최대 1MFP8에서 단일 DGX Spark 또는 H200OpenMDW-1.1
Laguna M.1225B (MoE)23B256K+엔터프라이즈 멀티 GPU 노드OpenMDW-1.1

이 표에서 얻는 세 가지 실용적 시사점:

  • 패밀리 전체가 동일한 코퍼스를 사용. Laguna S 2.1의 사후 학습은 XS 2.1의 것 위에 새로운 데이터를 추가하지 않았다 — S 2.1 발표에서 이를 명시적으로 밝힌다. 동작 개선은 새 문서를 주입한 것이 아니라 더 큰 모델 클래스와 다른 사후 학습 레시피에서 나온다. 이는 파인튜닝 노하우가 크기 전반에 걸쳐 깔끔하게 전이된다는 의미다.
  • 활성 파라미터 열이 추론 비용에 있어 중요하다. 8B 활성일 때 Laguna S 2.1은 토큰당 118B가 아니라 8B 밀집(dense) 모델의 컴퓨트 프로파일을 갖는다. 이것이 "단일 액셀러레이터에서 실행"과 "랙이 필요함"의 차이다.
  • OpenMDW-1.1은 진짜 관대한 라이선스이지 소스 공개 라이선스가 아니다. 이 라이선스는 전통적인 오픈 소스 라이선스(가중치와 데이터를 깔끔하게 다루지 못함)와 상업적 사용을 슬쩍 금지하는 벤더의 "오픈" 라이선스 사이의 격차를 메우기 위해 Linux Foundation이 발행했다. 저작권, 특허, 데이터베이스, 영업 비밀에 걸쳐 무제한, 로열티 없는 권리를 부여하며, 출력물은 명시적으로 제약이 없다.

헤드라인에서는 명확하지 않은 세 가지

1. FP8 기반 RL은 마케팅이 아니라 실제 엔지니어링 돌파구

LLM 사후 학습을 위한 강화 학습은 역사적으로 BF16에서 실행되어 왔는데, FP8 정밀도에서의 그래디언트 노이즈가 RL이 제공하는 미세한 시그널을 날려버릴 것으로 가정되었기 때문이다. Poolside는 Laguna S 2.1이 FP8에서 RL로 학습된 최초의 프런티어 규모 모델이라고 공개적으로 주장한다. 사실이라면 — 2026년 8월 초 기준으로 반례가 등장하지 않았다 — 이는 RL 단계의 메모리 풋프린트를 절반으로 줄이고, 특정 클러스터가 이전에는 너무 비쌌던 작업에 RL 컴퓨트를 쓸 수 있게 한다.

사용자에게 실용적인 결과: Poolside의 RL 단계는 선택적이었다. 그들은 40만 9천 개의 학습 환경(터미널 83k, 소프트웨어 엔지니어링 168k)을 보고하며, SFT가 합성 데이터로부터 대부분의 동작을 부트스트래핑하고 RL은 가장 어려운 문제에 예약되었다. 이는 벤치마크 델타에 나타난다 — DeepSWE v1.1에서 사고 모드 부스트가 **16.5% → 40.4%**로 오른다 — 이는 RL이 모든 작업에 걸쳐 얇게 뿌려진 것이 아니라 어려운 추론에 좁게 사용되었을 때 예상할 수 있는 형태다.

2. 멀티 하니스 학습이 서드파티 에이전트 내부에서 무너지지 않는 이유

코딩 모델은 보통 하나의 에이전트 하니스(벤더 자체 스캐폴드) 내부에서 학습된 후 수십 개의 다른 하니스(Cursor, Cline, Aider, Continue, Kilo 등) 내부에 배포된다. 학습과 배포 하니스 사이의 격차는 "벤치마크에서는 됐다는데" 실패가 많이 발생하는 지점이다. Poolside는 여러 하니스에 걸쳐 있는 83k 터미널 환경과 168k 소프트웨어 엔지니어링 환경에서 Laguna를 학습시켰으며, 이것이 첫날부터 자체 스캐폴드 외부에서도 모델을 사용할 수 있게 한 메커니즘이라고 그들은 인정한다.

Laguna의 보고된 동작에서 멀티 하니스 학습의 가시적 표시: 끈기(하나의 실패한 도구 호출 후에도 접근 방식을 포기하지 않음), 검증 우선(출시 전 자체 출력을 다시 읽음), 자원 활용력(직접 경로가 막히면 대체 경로 찾기). 이는 다음 토큰 동작이 아니라 에이전트 동작이다 — 더 많은 사전 학습 데이터에서 얻을 수 있는 것이 아니다.

동일한 설계 선택에 직접 매핑되는 알려진 한계들은 놀라지 않도록 주목할 가치가 있다:

  • Poolside의 네이티브 하니스 대비 서드파티 하니스의 약간의 스키마 변형에 어려움을 겪음 — 하니스는 40만 9천 개 학습 환경 중 무언가와 "충분히 비슷하게" 보여야 함.
  • 배열 안의 중첩된 도구 호출에서 잘못 이스케이프된 JSON을 간혹 발생시킴. 드물지만 실제로 발생.
  • 수학 경시 대회 문제를 과도하게 사고함 — 확장 사고가 AIME 스타일 작업에서 필요 이상으로 오래 실행됨. 코딩에는 괜찮지만 수학에는 낭비.

3. 활성 파라미터 비율이 비용에 관한 전부

눈길을 끄는 수치는 1.6T vs 8B다: Laguna S 2.1은 DeepSWE v1.1에서 DeepSeek-V4-Pro-Max(1.6T 총 파라미터)를 31.4점 차이로 이기면서 토큰당 파라미터의 6분의 1만 활성화한다. 하지만 유용한 프레이밍은 추론 비용이다:

모델토큰당 활성 파라미터대략적인 토큰당 컴퓨트참조 API 가격*
Laguna XS 2.13B3B 밀집 등가무료 티어 / $0.05 범위
Laguna S 2.18B8B 밀집 등가M당 $0.10 입력 / $0.20 출력 (OpenRouter)
GLM-5.2~40B~40B 밀집 등가M당 $1.20-1.40 입력 / $4.10-4.40 출력
Kimi K3~32B~32B 밀집 등가GLM 범위와 유사
Claude Opus 5 (프런티어)밀집, 비공개프런티어M당 $15 입력 / $75 출력
*가격은 2026년 8월 초 OpenRouter 및 동등한 애그리게이터 기준 — 근사치로 취급할 것.

OpenRouter의 S 2.1과 Claude Opus 5 간의 토큰당 150배 격차는 헤드라인 만들기에는 공정한 싸움이 아니지만, 유용한 비율은 S 2.1 대 다른 오픈 웨이트 프런티어 모델(GLM-5.2, Kimi K3)이다: Laguna는 출력 토큰당 ~12배 저렴하며 SWE-Bench Multilingual 점수는 같은 리그에 있다. 이것이 모델에게 넘겨주기에 경제적으로 합리적인 작업이 무엇인지 바꿔놓는 가격 범위다.

벤치마크 그림 — 정직한 버전

S 2.1 출시에서 보고된 점수들로, Poolside 자체 포스트와 서드파티 커버리지 간에 교차 확인됨:

벤치마크Laguna S 2.1측정 대상참고
SWE-Bench Multilingual78.5%여러 언어에 걸친 실제 GitHub 수정 작업출시 시점 상위 공개 오픈 웨이트 점수
Terminal-Bench 2.170.2% (사고 모드) / 60.4% (비사고 모드)긴 셸 워크플로~10점 사고 모드 상승
SWE-Bench Pro (Public)59.4%더 어려운 자율 리포지토리 레벨 수정프런티어 폐쇄 모델이 여전히 앞섬
DeepSWE v1.140.4% (사고 모드) / 16.5% (비사고 모드)어려운 SWE 벤치마크활성 파라미터가 ~1/200임에도 9.0%의 DeepSeek-V4-Pro-Max를 이김
SWE Atlas (Codebase QnA)46.2%대형 리포지토리 이해DeepSWE 수치보다 앞섬
Toolathlon Verified49.7%멀티 도구 오케스트레이션중간 수준

이를 읽는 세 가지 해석 규칙:

  • 에이전틱 코딩 모델에 있어 진지하게 받아들일 수치는 SWE-Bench Multilingual과 Terminal-Bench 2.1이다. 이는 실제로 할당할 작업 — "실제 리포지토리에서 이 버그 고치기", "이 셸 워크플로를 그린으로 만들기" — 에 매핑된다. Poolside는 오픈 웨이트 진영에서 둘 다에서 선두이다.
  • 가장 어려운 벤치마크에서는 여전히 폐쇄형 프런티어가 이긴다. Claude Fable 5와 Kimi K3가 SWE-Bench Pro와 Toolathlon의 일부 슬라이스에서 앞선다. Laguna의 출시를 "Anthropic이 졌다"로 읽지 말 것 — "코딩용 오픈 웨이트 천장이 방금 몇 점 위로 이동했다"로 읽을 것.
  • 사고 모드는 공짜가 아니지만 대부분의 승리가 여기 있다. Terminal-Bench 60.4% → 70.2%, DeepSWE 16.5% → 40.4%. 비용 이유로 사고를 끄면 모델의 큰 부분을 포기하는 것이다.

Laguna 실행하기

Guided walkthrough1 of 4
  1. OpenRouter, Baseten Model Library, Vercel AI Gateway, Kilo/Cline/Hermes 통합 모두 첫날 접근을 제공. OpenRouter의 출시 정가: M당 $0.10 입력, $0.20 출력, 평가용 무료 256K 컨텍스트 티어. OpenAI 호환 chat completions 엔드포인트 — 베이스 URL과 모델 ID를 바꾸면 됨.

OpenRouter를 통해 Laguna S 2.1 호출하기 (Python)

import os, openai

client = openai.OpenAI(
  base_url="https://openrouter.ai/api/v1",
  api_key=os.environ["OPENROUTER_API_KEY"],
)

resp = client.chat.completions.create(
  model="poolside/laguna-s-2.1",
  messages=[
      {"role": "system", "content": "You are a senior engineer. Reply with a unified diff, no prose."},
      {"role": "user", "content": "Fix the off-by-one in this function:\n\ndef last_n(xs, n): return xs[-n-1:]"},
  ],
)
print(resp.choices[0].message.content)

Laguna vs 대안 — 언제 선택할 것인가

2026년 8월 초 모델 지형 기준의 실용적 결정 지도:

작업최적 선택이유
예산에 민감한 장기 리포지토리 레벨 버그 수정Laguna S 2.1상위 오픈 웨이트 SWE-Bench Multilingual, GLM-5.2 또는 Kimi K3보다 출력 토큰당 ~12배 저렴
MacBook에서 에이전틱 코딩, 오프라인 필수Laguna XS 2.13B 활성 파라미터 + MLX 빌드; 이 크기에서 비교 가능한 SWE-Bench Multilingual을 달성하는 것은 없음
가장 어려운 작업에서의 절대적 프런티어 정확도, 비용 무관Claude Opus 5 또는 Fable 5폐쇄형 프런티어가 여전히 SWE-Bench Pro와 가장 어려운 슬라이스에서 선두
리포지토리에 1M 토큰 컨텍스트, 관대한 라이선스 필요GLM-5.2 또는 Laguna S 2.1둘 다 관대한 라이선스 하에 1M 컨텍스트 제공; GLM-5.2가 일반 추론에서 더 강하고, Laguna는 에이전틱 코딩에서 더 강함
엄격한 도구 호출 시맨틱이 필요한 멀티 도구 오케스트레이션Claude 또는 Kimi K3Laguna의 중간 수준 Toolathlon 점수와 알려진 JSON 이스케이핑 엣지 케이스로 인해 여기서는 기본 선택으로 약함
규제 환경, 데이터가 박스를 떠나지 않음Laguna S 2.1 셀프 호스팅OpenMDW-1.1이 무제한 상업적 사용 허용, 미국 출신 연구소; FP8이 단일 액셀러레이터에 들어감

한 줄 요약: Laguna는 작은 활성 파라미터 예산에서 프런티어급 코딩 동작을 원하고, 라이선스와 출신이 중요할 때의 현재 스위트 스팟이다. 그런 제약이 걸릴 때 사용; 그렇지 않을 때는 Claude나 폐쇄형 프런티어로 향할 것.

관련 자료

이해도 점검

Check yourself

0/4
  1. Laguna S 2.1은 총 118B 파라미터를 갖지만 토큰당 활성 파라미터는 8B에 불과하다. 파라미터의 약 6분의 1만 활성화함에도 DeepSWE v1.1에서 어떤 모델을 이기는가?
  2. 왜 동일한 4,096-H200 사전 학습이 XS 2.1, S 2.1, M.1을 위해 세 가지 다른 방식으로 사후 학습되는가 — 그냥 가장 큰 체크포인트를 어디에나 서비스하는 대신에?
  3. 200개 파일 리포지토리의 버그를 수정해야 하고 비용이 중요하다. Terminal-Bench 2.1 수치가 중요하다. 프런티어 정확도가 필요 없다고 가정할 때, 이들 중 가장 방어 가능한 선택은?
  4. 다음 중 프로덕션 사용에 중요한, 실제로 문서화된 Laguna S 2.1의 실패 모드는?

출처 & 추가 자료