DeepSeek、Qwen 与开放权重浪潮
在很长一段时间里,“优秀 AI”的故事就是少数几个闭源前沿模型的故事——你只能通过 API 租用它们。如今这已不再是故事的全部。一波开放权重模型——许多来自中国实验室,比如 DeepSeek 和阿里巴巴的 Qwen,此外还有 Meta 的 Llama 和法国的 Mistral——已经变得足够好、足够便宜、足够小,以至于下载并运行你自己的高能力模型成为了一个真正可行的选项。本页是这一版图的持久地图:为什么会发生、“开放权重”到底意味着什么、相对闭源前沿模型的诚实取舍,以及今天如何真正地使用这些模型。
- 理解开放权重模型为何变得有竞争力——单位成本的能力,以及开放的推理能力
- 厘清“开放权重”真正的含义——相对于开源和开放数据
- 识别几种原型:通用对话、推理、编程,以及小型/高效模型
- 权衡相对于闭源前沿的真实取舍——在最难任务上的能力差距,以及自行拥有基础设施与安全责任
- 了解真正使用它们的两种方式:托管 API,或通过 Ollama 自托管
开放权重模型为何突然变得有竞争力
三件事大约在同一时间发生了转变,它们合在一起弥合了日常使用中的大部分差距。
- 单位成本的能力急剧下降。 更好的训练方案、数据筛选,以及**混合专家(MoE)**架构(一个大模型中每个 token 只激活一部分参数)让实验室能够推出远超其成本的模型。对于很大一部分真实任务——起草、摘要、抽取、分类、常规编程——一个优秀的开放模型如今已“足够好”,而成本只是前沿 API 的一小部分。
- 开放的推理模型出现了。 DeepSeek 的推理系列是一个转折点:它表明“在回答前一步步思考”的能力——此前是少数闭源模型的护城河——是可以用开放权重训练并发布的。一旦某个实验室证明了这一点,开放生态系统的其余部分便纷纷跟进。
- 小模型变得真正可用。 100 亿参数以下、甚至 10 亿参数以下的模型变得连贯而有用,这意味着你可以在笔记本电脑或便宜的服务器上运行有能力的东西。这改变了隐私、延迟和规模的经济学。
净效应是:与闭源前沿的差距并没有消失,但对大多数工作而言,它不再是决定性因素。决定性因素变成了成本、控制权,以及你的数据存放在哪里。
“开放权重”到底意味着什么
这是整个领域中最容易被混淆的一点。“开放”一词以三种不同的方式承担了大量含义,而它们并不是一回事。
| 术语 | 你实际得到的 | 你通常得不到的 |
|---|---|---|
| 开放权重 | 训练好的模型文件(权重)。你可以下载、运行、微调并自托管。 | 训练数据,有时还包括完整的训练代码。使用可能受某种自定义许可证的约束。 |
| 开源(严格意义) | 权重加上在 OSI 风格许可证下的训练/推理代码,可自由使用、修改和再分发。 | 通常仍然不包括训练数据。 |
| 开放数据 | 模型训练所用的实际数据集,公开发布。 | 对于前沿规模的模型这很罕见;大多数“开放”模型是开放权重,而非开放数据。 |
实用的要点是:人们所称的“开源”模型大多其实是开放权重。 你可以运行并改造它们,但通常无法从零复现它们,而且你必须阅读许可证。许可证各不相同:
- 有些采用宽松许可证(Apache 2.0、MIT),对商业使用而言很干净——例如 Qwen 和 Mistral 的模型历来使用 Apache 2.0,而 DeepSeek 的重要发布采用过 MIT。
- 有些采用带条件的自定义社区许可证——例如 Meta 的 Llama 许可证历来包含一条条款,限制(按月活跃用户计)规模最大的公司自由使用它。
在基于某个模型进行开发之前,务必查看该模型的具体模型卡以了解其许可证。中立但重要的一点:一个模型是开放权重,只告诉你你可以自行托管它;它并不告诉你法律条款,也不会让许可或数据驻留的问题消失——它只是把这些问题转移给了你。
四种原型
开放权重家族几乎总是以一个变体系列的形式出现,而不是单一的模型。学会这四种原型,你就能一眼读懂任何实验室的产品线。
单个家族——Qwen 是最清晰的例子——通常会给你整个阶梯:用于边缘和笔记本的微型模型、用于服务器的中型模型、用于最难任务的大型旗舰,外加专门用于编程和推理的变体。你挑选适合你硬件和任务的那一档,而不是“那个模型”。
相对于闭源前沿的诚实取舍
开放权重模型并不是严格意义上的升级。它们是另一种交易。下面中立地摆出这笔取舍。
| 维度 | 开放权重(自托管或廉价托管) | 闭源前沿(托管 API) |
|---|---|---|
| 最难任务的能力 | 很强且正在快速追赶,但在最难的推理、长时程智能体和小众任务上,闭源前沿通常仍然领先 | 通常是最艰难任务的上限 |
| 规模化成本 | 可以显著更便宜,尤其是自托管或通过预算型托管 | 每 token 溢价;可预测但会累积 |
| 隐私 / 数据驻留 | 你可以把数据完全保留在你的环境内部 | 数据离开你的网络流向提供商 |
| 控制与定制 | 完全:微调、量化、锁定版本、离线运行 | 仅限于 API 所暴露的内容;版本可能在你不知情下发生变化 |
| 谁负责安全与运维 | 你自己——护栏、滥用过滤、正常运行时间、扩展和打补丁都是你的工作 | 由提供商运行基础设施并提供基线安全 |
最后一行是人们低估的那一项。当你自托管一个开放权重模型时,你也继承了前沿实验室通常替你承担的责任:内容安全和滥用缓解、保持部署已打补丁、容量和正常运行时间,以及自己评估每一个新的模型版本。“开放权重”为你买来了控制权,而控制权既是收益,也是成本。关于这笔取舍中 API 一侧的成本直觉,参见 Token 经济学。
如何真正使用一个开放模型
恰好有两条路径,大多数团队在不同阶段都会两者并用。
- 托管 API — 许多提供商(包括实验室自身以及第三方推理托管方)在 API 后面提供开放权重模型,通常是与 OpenAI 兼容的。你以零基础设施工作获得开放模型的经济性。当你想要低成本又不想运行服务器时最合适,但请注意你的数据仍会离开你的网络。
- 自托管 — 下载权重并在你自己的环境中运行它们。最大的隐私和控制权,也是数据确实无法离开你网络时的唯一选项。最简单的入门方式是 Ollama,它用一条命令拉取并运行开放模型。
四步在本地试用一个模型
- 从 ollama.com/download 下载(macOS/Windows),或使用 Linux 安装脚本。这会给你 ollama 命令以及一个本地后台服务。完整讲解见“在本地运行模型”页面。
- 更小的模型需要更少的 RAM/VRAM。笔记本电脑可以轻松运行小型变体(几 GB);大型旗舰需要一块真正的 GPU 或服务器。先从小的开始,确认一切正常,如果质量不够再往上扩。
- ollama run <model> 会在首次使用时下载权重(数 GB),然后把你带入一个交互式聊天。首次运行较慢是因为它在拉取;之后的运行会从缓存中瞬间启动。
- Ollama 暴露了一个与 OpenAI 兼容的本地端点,因此你可以把现有的 OpenAI 风格 SDK 指向 localhost 而非云端。现在同一份代码就能针对一个私有的本地模型运行。
用 Ollama 在本地拉取并运行一个开放模型
ollama run qwen3
这一条命令会下载一个 Qwen 开放权重模型并启动一个本地聊天——无需 API 密钥,也没有数据离开你的机器。把 qwen3 换成另一个家族(例如某个 Llama、Mistral 或 DeepSeek 标签),就能在你自己的任务上比较它们。为给定的工作挑选合适的模型本身就是一项技能:参见 选择模型。
在实践中如何在开放与闭源之间做选择
不要按排行榜来选。要按约束来选:
- 数据不能离开你的网络 → 自托管的开放权重就是答案,没有例外。
- 高流量、成本敏感、“足够好”的质量 → 开放权重(托管或自托管)通常在成本上胜出。
- 你需要在最难任务上做到绝对最好 → 闭源前沿仍然倾向于领先——在真正重要的地方使用它,并把较容易的流量路由到更便宜的开放模型。
- 你想微调、量化、锁定版本或离线运行 → 只有开放权重才能给你那种控制权。
最经久耐用的做法,是在你自己的真实数据上,对一个开放候选和一个闭源候选各跑一个小型评测。基准描述的是别人的任务;你的评测描述的是你的任务。
自我检验
0/3- 得益于单位成本的能力、开放的推理模型,以及真正可用的小模型,开放权重模型弥合了日常使用中的大部分差距
- “开放权重” = 可下载、可运行、可微调的权重——但不一定意味着开源代码、开放的训练数据或宽松许可证;务必阅读模型卡
- 按原型读懂任何产品线:通用对话、推理、编程,以及小型/高效——大多数家族都提供完整的尺寸阶梯
- 取舍是真实的:开放买来的是成本、隐私和控制权,但闭源前沿通常仍在最难任务上领先,而且你要继承安全与基础设施的责任
- 使用它们的两种方式:一个(通常与 OpenAI 兼容的)托管 API,或用一条命令通过 Ollama 自托管——然后在你自己的数据上评测,而不是看排行榜