🧊 前沿科技知识库
全部 / 人工智能(AI)

开放权重(开源)模型生态

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:人工智能 / 开放权重模型与本地部署 | 说明:信息来源为公开网络资料,详见文末参考来源

一、概述

「开放权重(open-weight)」指模型参数可公开下载、可自行部署与微调,区别于仅提供 API 的闭源模型。2025–2026 年,开放权重阵营从「追赶者」变为「半壁江山」:一方面,Meta Llama、阿里 Qwen、DeepSeek、Google Gemma、Mistral、微软 Phi、OpenAI gpt-oss、智谱 GLM、MiniMax、月之暗面 Kimi 等构成庞大的模型矩阵;另一方面,中国开源模型在 OpenRouter 等平台上的调用量持续领先。有分析称,截至 2026 年 3 月,OpenRouter 月度榜单前五名中有三席为中国模型,MiniMax、Kimi、DeepSeek 正成为全球开发者的优先选项,其优势可归纳为「开源、活跃、价格」三要素(事关AI,中国首次超越美国 — 中新网)。

Mozilla 于 2026 年 9 月发布的 State of Open Source AI 报告认为,开放权重模型已从「实验性替代品」转变为全球 AI 基础设施的关键支柱,驱动力来自性能快速提升、运营成本显著下降,以及企业对模型部署「主权与控制权」的空前需求(Mozilla State of Open Source AI Report 2026)。

需要澄清一个术语混淆:多数所谓「开源模型」实为开放权重,其许可证并非都通过 OSI 认证,例如 Llama 4 采用自定义的社区许可证,因而被明确指为「open-weight 但不是 OSI 认可的开源」(Llama 4 — The Planet Tools)。更严格地说,真正的开源 LLM 应同时公开权重、架构,理想情况下还包括训练代码;而现实中多数模型仅公开权重,训练数据与训练代码通常不公开(Best Open Source LLMs in 2026 — Onyx)。

二、2025–2026 最新进展

三、核心技术与关键概念

1. 许可证类型

许可证代表模型特点
Apache 2.0Qwen 3.5/3.8、Gemma 4、Mistral Large 3、gpt-oss、MiMo-V2.5宽松,允许自由商用、修改、分发(通常要求署名)
MITDeepSeek V4、GLM-5/5.1/5.2、Kimi K2.5/K2.6、MiMo-V2-Flash宽松,开放仓库权重与代码,限制最少
Llama 社区许可Meta Llama 4自定义商业许可,非 OSI 开源
Gemma Terms of UseGoogle Gemma(早期版本)允许多数用途,但限制损害 Google 产品的用途
无标准许可DeepSeek V3.2(部分口径)公开发布权重但无标准开源许可,商用需先审查

许可维度可拆解为四项:是否允许商用、是否允许微调、是否允许再分发、以及限制条款(Best Open Source LLMs in 2026 — Onyx)。据 2026 年汇总,Mistral Large 3、Qwen3.5、Gemma 4 为 Apache-2.0,GLM-5.2、DeepSeek V4、Kimi K2.6 为 MIT 或 Modified MIT(Best Open-Source LLMs — aiwiki)。

Llama 4 社区许可的关键条款:月活超过 7 亿 的产品需向 Meta 单独申请许可(由其酌情授予);衍生 AI 模型名称须含「Llama」;分发须显著标注「Built with Llama」并保留版权声明;可接受使用政策排除军事等用途(Llama 4 许可说明、Meta AI — aiwiki)。Llama 4 于 2025 年 4 月 5 日发布,为原生生多模态模型,Scout 版本上下文窗口达 1000 万 token,知识截止于 2024 年 8 月(Llama 4)。注:另有中文来源称 Llama 4 采用 Apache 2.0,与多数英文来源不符,本库以官方社区许可口径为准,读者引用时需交叉核对(Meta Llama 4 全系列深度解析)。

2. 蒸馏与能力差距

蒸馏(distillation) 指用更强模型的输出训练另一个模型,是行业标准技术,在中国 AI 产业尤为普遍。据 Interconnects 分析,蒸馏大约能把中国公司相对美国前沿的差距缩小 1–2 个月(The current balance of power in open models)。2026 年 2 月,Anthropic 披露三家中国实验室(DeepSeek、Moonshot、MiniMax)的「工业化规模」蒸馏活动,称其通过约 24,000 个欺诈账号产生了超过 1600 万次交互,以抽取 Claude 的推理、编码与智能体能力;Anthropic 与 OpenAI 随后将此类抽取定性为国家安全关切(Everyone's Watching the Wrong Benchmark — Gradient)。围绕此事的争论在于:闭源 API 本身可被系统性「挖矿」,而开放权重则让蒸馏变得「无需服务条款」即可进行(What Is AI Distillation?、In Defense of Open Models — IDC)。

3. 本地部署与量化

llama.cpp(MIT 许可,GitHub 星标 85,000+)是本地推理生态的基石:纯 C/C++、无外部依赖,可在 NVIDIA CUDA、AMD ROCm、Apple Metal、纯 CPU 乃至 Raspberry Pi 上运行 GGUF 量化模型(The Complete Guide to Local LLM Inference Tools in July 2026)。典型量化档位的质量/体积权衡(以 7B 模型为例):F16 14GB(基准)、Q8_0 8.5GB(约 99% 质量)、Q4_K_M 5.0GB(约 97%)、Q3_K_M 4.1GB(约 94%)(Running LLMs Locally in 2026)。Ollama 与 LM Studio 则封装了 GGUF 的选择与运行,降低使用门槛(GGUF Quantization Benchmarks)。

工具选型上,GGUF(Q4_K_M、Q5_K_M、Q6_K、Q8_0 等「K-quants」按层混合位深,单文件自包含)最适合 CPU、消费级 GPU 与 Apple Silicon,是通用且可移植的默认;AWQ(INT4) 与 GPTQ 面向 GPU 服务,在多数基准中 AWQ 的质量保持略优于 GPTQ(Running LLMs Locally in 2026 — DEV)。在吞吐与多用户服务场景,vLLM 支持最广的格式范围(safetensors、GPTQ、AWQ、FP8、NVFP4、bitsandbytes),在 NVIDIA 硬件上 GPU 优化的量化格式(如 AWQ)通常比 GGUF 吞吐更高,但生产环境仅支持 Linux 且需要独立 NVIDIA/AMD GPU,配置复杂度高于 Ollama(Local LLM Inference in 2026)。

4. 开放权重 vs 闭源:主权、合规与成本

选择开放权重的常见动机有三:数据主权(提示、文档与输出不离开自有服务器,无跨境传输与第三方保留策略)、合规(对受 HIPAA 约束的医疗数据、PCI-DSS/SOC 2 约束的金融数据,自托管可让 PHI 留在合规范畴内;在欧盟 AI Act 语境下,本地部署便于保留审计痕迹)(Open-Weight vs. Closed-Source AI Models in 2026、Open-Source AI Deployment for Enterprises (2026 Guide)),以及成本可预测(没有按 token 计费,高并发重复负载的边际成本低)(Best Open-Weights AI Models for Business in 2026)。相应地,自托管也意味着企业需自行承担硬件、运维与安全责任。

5. 许可与能力的「口径之争」

「开放权重已追平闭源」这一判断高度依赖所选的基准与版本:同一族模型在不同评测快照中的排名可能不一致。例如 DeepSeek-V4-Pro 在 SWE-bench 上为 80.6%、LiveCodeBench 93.5%、原生 1M 上下文(Best Open Source AI Models in 2026),而 GLM-5.2 在开源模型中 GPQA Diamond 最高(91.2%),Kimi K2.6 以 90.5% 紧随(Best Open Source LLMs in 2026 — Onyx)。因此引用任何「领先」结论时都应同时标注基准、版本与时间。

6. 「完全开放」模型:OLMo 3 与训练流程透明化

「开放权重」之外还有一类更彻底的路线:完全开放(fully open),即不仅公开权重,还公开训练数据、代码、中间 checkpoint 与训练流程。代表是 Allen Institute for AI(Ai2)的 OLMo 3:2025 年 11 月 20 日发布,包含 7B 与 32B 两个参数规模的稠密 decoder-only Transformer,每个规模各有 Base、Think、Instruct、RL Zero 四个后训练变体,其中 32B Think 被称为首个「完全开放的 32B 思考模型」(Ai2 Announces Olmo 3 Family of Open Frontier Language Models、Ai2 Introduces Olmo 3 — MarkTechPost)。其预训练使用全新的 Dolma 3 数据集,约 9.3 万亿 token,来源涵盖网页、经 olmOCR 处理的科学论文 PDF、代码仓库与数学题(Completely Breaking Down the AI Black Box: Ai2 Releases Olmo 3)。这类项目价值在于可复现与可审计,与商业「开放权重」形成对照。

7. 开放权重的安全风险:护栏移除(abliteration)

开放权重带来便利的同时也带来一类结构性风险:护栏可被后训练移除。一项由 University of Waterloo 与 FAR.AI 合作的 TamperBench 基准测试发现,21 个热门开放权重模型(包括经过防御加固的版本)全部可借微调或激活编辑(activation editing)攻击剥除其安全调优(TamperBench: All 21 Tested Open-Weight LLMs Had Guardrails Stripped)。Anthropic CEO 亦对立法者表示,开源模型构成系统性安全风险,理由是任何拥有适度 GPU 资源的行为者都能微调移除 RLHF 与 Constitutional AI 对齐层,且研究多次显示用不到 1000 条恶意样本即可显著削弱安全对齐,从而把「越狱」从提示工程问题变成无防御对策的模型修改问题(Anthropic CEO: Open-Source AI Models Pose Systemic Safety Risk)。西点军校 CTC 的评论称之为 abliteration 问题:由于开放权重模型的护栏很可能对所有人可移除,模型一旦发布就可能「不可逆」,因此建议在开源前做 abliteration 抗性测试(Guardrails Under Test: Terrorist Misuse of AI Models and the Open-Weight 'Abliteration' Problem)。相关研究进一步表明,现有开放权重安全防护对 abliteration 与 prefilling 两类低成本、非梯度优化攻击同样脆弱(Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks)。也有观点认为,抗移除设计无法根除滥用,但能显著抬高攻击成本、改变滥用经济学(What Does Safe AI Mean for Open-Weight LLMs When Fine-Tuning Strips Guardrails?)。

四、代表性项目 / 产品

模型系列开发者代表版本官方链接
LlamaMetaLlama 4(Scout / Maverick)https://www.llama.com/
DeepSeek深度求索V4-Pro / V4-Flash / V4.1-Flashhttps://api-docs.deepseek.com/news/news260424
Qwen阿里巴巴Qwen3.8 / Qwen3.5 / Qwen3-VL / Qwen3-Omnihttps://qwen.ai/
GemmaGoogle DeepMindGemma 4https://deepmind.google/models/gemma/
MistralMistral AIMistral Large 3https://mistral.ai/
gpt-ossOpenAIgpt-oss-120b / 20bhttps://openai.com/index/introducing-gpt-oss/
GLM智谱 AIGLM-5.3 Flash / GLM-5.2 / GLM-5.1https://www.zhipuai.cn/
MiniMaxMiniMaxM2.5 / M3 / H3https://www.minimax.io/
Kimi月之暗面Kimi K3 / K2.6 / K2.5https://www.moonshot.cn/
MiMo小米MiMo-V2-Flashhttps://github.com/XiaomiMiMo
Phi微软Phi 系列https://azure.microsoft.com/en-us/products/phi

五、关键数据与评测结果

Onyx 开放 LLM 排行榜快照(更新于 2026-03-12):

模型提供方许可参数(总/激活)SWE-benchGPQA DiamondAIME 2025HumanEvalArena Elo
Kimi K2.5MoonshotMIT1T / 32B76.8%87.6%96.1%99.0%1,447
GLM-5Zhipu AIMIT744B / 40B77.8%86.0%84.0%90.0%1,451
Qwen 3.5QwenApache 2.0397B / 17B76.4%88.4%N/AN/AN/A
MiMo-V2-FlashXiaomiMIT309B / 15B73.4%83.7%94.1%84.8%1,401
DeepSeek V3.2DeepSeek无标准许可685B / 37B67.8%79.9%89.3%N/A1,421
GPT-oss 120BOpenAIApache 2.0117B / 5.1B62.4%80.9%97.9%88.3%1,354

(数据来源:Best Open Source LLMs in 2026 — Onyx;该快照中「无单一赢家」——Kimi K2.5 领先 HumanEval 与 AIME,GLM-5 领先 SWE-bench,Qwen 3.5 领先 GPQA Diamond。)

生态规模与份额(多口径并列):

六、趋势与争议

  1. 开源 vs 闭源的边界之争:支持者认为开放权重降低推理成本、增强数字主权与可审计性(Google 称 Apache 2.0 发布 Gemma 4 是「巨大里程碑」,赋予开发者数字主权)(Gemma 4 韩文博客);反对者(如 Anthropic、OpenAI)担忧滥用与知识产权问题。Mozilla 报告则从产业侧指出,主权与控制权需求正推动开放权重进入企业主流部署(Mozilla State of Open Source AI Report 2026)。
  2. 蒸馏的合法性与安全叙事:IDC 指出闭源厂商本就控制着被「蒸馏」系统的访问权、条款与自动化行为模式,把开放模型一律限制并不合理(In Defense of Open Models)。开放权重使蒸馏「无需服务条款」即可进行,这一特性既是其生态优势,也成为安全争议焦点(What Is AI Distillation?)。
  3. 许可证合规风险:Llama 社区许可的 7 亿 MAU 门槛、命名与署名要求,使「开源」在法务上并非无约束;同类风险也存在于各家的自定义许可(如 Gemma Terms of Use、部分无标准许可的权重发布),企业采用前需评估(Llama 4 许可说明、Best Open Source LLMs in 2026 — Onyx)。
  4. 中国模型的全球博弈:模型出海伴随云厂商分成等商业机制变化,分析师提醒当多个同质化中国模型供应商竞争同一分销渠道时,议价地位可能反转(每日经济新闻)。
  5. 部署门槛与「本地」的现实边界:多数前沿开放权重模型仍需企业级硬件(如 4×H100 80GB 或同等)才能全精度推理;真正可在单卡运行的替代品有限,例如 GPT-oss 120B(1×H100)与 DeepSeek R1 蒸馏版(DS-R1-Distill-Qwen-32B、DS-R1-Distill-Llama-70B,可跑在单张 RTX 4090 或 H100)(Best Open Source LLMs in 2026 — Onyx)。这使「开放权重=人人可本地运行」的叙事需要更细的硬件前提。
  6. 「开放即不可逆」的安全争论:TamperBench 等研究表明护栏可被微调/激活编辑剥离,西点 CTC 由此提出开放权重一旦发布可能「不可逆」,主张在开源前进行 abliteration 抗性测试;而开放阵营则强调可审计性与防滥用设计能改变攻击经济学(TamperBench、Guardrails Under Test — West Point CTC、What Does Safe AI Mean for Open-Weight LLMs)。这一争论把「开放 vs 闭源」从商业模式问题推向安全治理问题。
  7. 生态汇聚与单点依赖:Hugging Face 与 OpenRouter 的多份统计都显示 Qwen 生态与部分中国实验室已形成高度集中的下载与用量份额(Hugging Face Hub State 2026、China Leads Open AI Models)。集中化在降低使用门槛的同时,也带来供应链与治理上的单点依赖风险。

参考来源

  1. Open-Weight AI Models 2026: Complete Guide to the Best
  2. Open-Weights LLM Release History and Timeline
  3. DeepSeek V4 Preview Release — DeepSeek API Docs
  4. DeepSeek V4 Technical Documentation (Model Card)
  5. DeepSeek API 更新日志(V4.1-Flash)
  6. Build with DeepSeek V4 Using NVIDIA Blackwell
  7. Qwen 3.5: The Next Generation of Open AI
  8. qwen3.8-2.4t-a95b Model Info — Alibaba Cloud Model Studio
  9. Alibaba Unveils Qwen3.8-27B and Releases Weights of Qwen3.8 Flagship Model
  10. qwen3.8-2.4t-a95b 模型信息 — 阿里云百炼
  11. Gemma 版本 — Google AI for Developers
  12. Gemma 4: Byte for byte, the most capable open models — Google Blog
  13. Gemma 4 — Google DeepMind
  14. Gemma 4 소개 (Apache 2.0) — Google Blog
  15. Llama 4 — howaiworks.ai
  16. Llama 4 License 说明 — The Planet Tools
  17. Meta AI — aiwiki.ai
  18. Meta Llama 4 全系列深度解析 — CSDN
  19. MiniMax M2.5宣布全球开源并支持本地化部署 — 经济参考网
  20. MiniMax H3来了 — 上观新闻
  21. 中国AI大模型调用量连续十九周领跑 — 每日经济新闻
  22. 事关AI,中国首次超越美国 — 中新网
  23. 北美云分成破冰,Kimi K3落地亚马逊Bedrock — 每日经济新闻
  24. The current balance of power in open models — Interconnects
  25. Everyone's Watching the Wrong Benchmark — Gradient
  26. What Is AI Distillation? — ExplainX
  27. In Defense of Open Models: Kimi K3, Distillation — IDC
  28. Open Source Models Closed the Gap
  29. The Complete Guide to Local LLM Inference Tools in July 2026
  30. GGUF Quantization Benchmarks: Q4_K_M vs Q8_0 vs F16 (2026)
  31. Running LLMs Locally in 2026: Ollama, LM Studio, llama.cpp
  32. GGUF - llama.cpp 的量化格式 — ModelScope
  33. Best Open Source LLMs in 2026 — Onyx
  34. Onyx Open LLM Leaderboard
  35. Best Open-Source LLMs — aiwiki.ai
  36. Best Open-Source LLM 2026: Llama 4, DeepSeek V4, Qwen, Kimi — Codersera
  37. Best Open Source AI Models in 2026, Ranked and Compared — Fello AI
  38. React-ing to Grace Hopper 200: Five Open-Weights Coding Models
  39. Provider Landscape 2026-07 (Qwen family)
  40. OpenAI open-weight models (gpt-oss) — OpenAI Help
  41. Mozilla State of Open Source AI Report 2026
  42. Open-Weight vs. Closed-Source AI Models in 2026 — Sabaoon
  43. Open-Source AI Deployment for Enterprises (2026 Guide) — Fleece AI
  44. Best Open-Weights AI Models for Business in 2026 — Layer3 Labs
  45. Running LLMs Locally in 2026: Benefits, Trade-offs — DEV
  46. Local LLM Inference in 2026: Tools, Hardware & Open-Weight Models — Starmorph
  47. Open Weights AI: Your Strategic Compliance Hedge — FluxHuman
  48. Best Local & Open-Weight LLMs (2026) — AIToolTier
  49. Ai2 Announces Olmo 3 Family of Open Frontier Language Models — HPCwire
  50. Allen Institute for AI (AI2) Introduces Olmo 3 — MarkTechPost
  51. Completely Breaking Down the AI Black Box: Ai2 Releases Olmo 3
  52. OLMo 3 — aiwiki.ai
  53. 美艾伦AI研究所发布Olmo 3系列AI模型 — 中国科学院网信工作网
  54. TamperBench: All 21 Tested Open-Weight LLMs Had Guardrails Stripped
  55. Anthropic CEO: Open-Source AI Models Pose Systemic Safety Risk
  56. Guardrails Under Test: Terrorist Misuse of AI Models and the Open-Weight 'Abliteration' Problem — West Point CTC
  57. Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks
  58. What Does Safe AI Mean for Open-Weight LLMs When Fine-Tuning Strips Guardrails?
  59. Hugging Face Hub State 2026: Qwen Leads, Apache 2.0 Wins — Zentor
  60. Hugging Face's 2026 Open-Model Report: Qwen Hits 3B Downloads
  61. China Leads Open AI Models With 3.2B Downloads, Congress Told
  62. [Open Source AI Model Download Statistics 2026 [Llama, Mistral And DeepSeek]](https://commandlinux.com/statistics/open-source-ai-model-downloads/)
← 开源 AI 工具链后训练与对齐方法 →