🧊 前沿科技知识库
全部 / 人工智能(AI)

通用大模型前沿格局(2025–2026)

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:人工智能·大语言模型 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

截至 2026 年 9 月,通用大模型(frontier LLM)的竞争格局已从"单一旗舰迭代"演变为"多厂商、多层次、按月刷新"的密集竞赛。头部厂商包括 OpenAI、Anthropic、Google DeepMind、xAI(后并入 SpaceX 体系)、Meta,以及中国的 DeepSeek、阿里云 Qwen、月之暗面 Kimi、字节跳动豆包、智谱 GLM 等。共同趋势是:旗舰模型普遍走向混合专家(MoE)稀疏架构、原生多模态、百万 token 级上下文窗口,以及把"思考(thinking)"能力内建为可按档位调节的推理模式,而非外挂的提示技巧。

进入 2026 年下半年,格局又出现两个新特征:其一是分层发布,同一厂商同时推出面向不同负载的多个型号(如 OpenAI 的 GPT-6 Sol 与 Luna),厂商公开建议按任务复杂度在多档模型间路由,而非只用单一旗舰(GPT-6 Luna vs Gemini 3.8 Flash vs Claude Opus 5.5);其二是开放权重阵营的实质性逼近,Kimi K3、GLM-5.2、DeepSeek V4 等以 MIT 系许可开放权重,在部分榜单上已与闭源旗舰同处第一梯队。与此同时,API 定价持续下探,前沿能力的获取门槛显著降低。

从发布事件的密度看,2026 年 9 月尤为集中:OpenAI 于 9 月 3 日发布 GPT-6 Astra,Anthropic 与 OpenAI 于 9 月 22 日几乎同日推出 Claude Opus 5.5 与 GPT-6 Sol/Luna,xAI 则于 9 月 21 日发布 Grok 4.7(GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」-36氪)。

2025–2026 最新进展

OpenAI GPT 系列

OpenAI 于 2025 年 12 月 11 日发布 GPT-5.2,被视为针对 Gemini 3 的市场反击,主打专业知识工作,即编程、数据分析与复杂推理(Strategic Analysis of Frontier AI Models: GPT-5.2 vs. Gemini 3)。随后 GPT-5.5 于 2026 年 4 月 23 日推出(GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro: The Frontier Model Showdown),其官方对比表显示在 GDPval(胜或平)达 84.9%、OSWorld-Verified 达 78.7%、Toolathlon 达 55.6%(Presentamos GPT‑5.5)。2026 年 6 月 26 日,OpenAI 开始对 GPT-5.6 系列(代号 Sol)进行有限预览,强调更强的网络安全能力与分层防护(预览 GPT‑5.6 Sol:新一代模型)。

关于 GPT-6,OpenAI 官方研究索引给出两条时间线:一条标注"研究 2026 年 9 月 3 日 GPT-6 Astra:新一代智能",另一条标注"产品 2026 年 9 月 22 日 隆重推出 GPT-6 Sol 和 Luna"(OpenAI 研究);而 OpenAI 中文页面对 Astra 的发布页则为《GPT-6 Astra:新一代智能》(GPT-6 Astra:新一代智能)。由于不同页面口径存在差异,Astra 的准确首发日期应以官方索引与其新闻页为准,不宜单一采信。Astra 被描述为"迄今智能程度最高、最符合人类意图的模型,在计算机操作、编程、网络安全和科学领域具备前沿能力"(OpenAI 研究)。据 NVIDIA CEO 黄仁勋 9 月 6 日透露,GPT-6 Astra 的训练动用了约 10 万块 Grace Blackwell 系列 GPU,并计划再追加 40 万块用于后续阶段(GPT-6 Astra : 100 000 GPU Nvidia pour entraîner le modèle)。

多个第三方来源把 Astra 的发布时间记为 2026 年 9 月 3 日:ThursdAI 的记录称 OpenAI 在直播中发布 GPT-6 Astra,总裁 Greg Brockman 对记者表示"欢迎来到 AGI 时代",并报告 ARC-AGI-3 为 99.9、FrontierMath Tier 4 为 97.6%(Frontier Models);howaiworks 给出 97.6%(FrontierMath Tier 4 v2)与 ExploitBench 100%(OpenAI Launches GPT-6 Astra With Record Benchmarks)。DataCamp 补充称,Astra 在 FrontierMath Tier 4 v2 得 97.6%,高于 Claude Fable 5.1 与 Fable 5 的 87.8% 及 Claude Opus 5 的 73.2%,OpenAI 把这一水平描述为"饱和"(GPT-6 Astra: Features, Benchmarks, and Pricing)。需注意一个重要的口径警示:ARC-AGI-3 的高分是在 OpenAI 自有 Provider Adapter 测试框架下取得,该框架会在请求间保留推理状态;独立报道指出在标准公开 ARC-AGI 框架下分数明显更低(GPT-6 Astra Review: Benchmarks, Pricing, Safety)。至于 9 月 22 日的分层发布,36氪 报道称 GPT-6 Sol 与 GPT-6 Luna 脱胎于 GPT-6 Astra 底座,重点是把 Astra 的核心推理与多模态优势下放(GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」-36氪)。

Anthropic Claude 系列

Anthropic 的旗舰迭代尤为密集。Claude Opus 4.8 于 2026 年 5 月 28 日发布,定位严肃编程与 AI agent,配备 100 万 token 上下文窗口(Claude Opus \ Anthropic)。2026 年 6 月 25 日,Anthropic 同时推出 Claude Fable 5(面向全体客户的最强模型)与 Claude Mythos 5(仅限 Project Glasswing 参与者),两者默认支持 100 万 token 上下文、128k 最大输出,并采用"always-on adaptive thinking"(Claude Platform release notes)。Fable 5.1 与 Mythos 5.1 共享同一底层模型,Fable 侧保留针对网络安全与生物领域的更精确防护(Claude Mythos 5)。

2026 年 9 月 22 日,Claude Opus 5.5 发布,面向长时间运行的 agentic 编程与知识工作,100 万 token 上下文、128k 最大输出,定价为输入 $4/百万 token、输出 $20/百万 token(Claude Opus 5.5 - Claude Platform Docs)。据 Anthropic 官方,Opus 5.5 在默认 effort(medium)下即可超过 Opus 5 在 max effort 的水平,成本约为其五分之一,并以约 40% 的成本追平 GPT-6 Astra(Introducing Claude Opus 5.5)。同期 Claude Opus 4.1 正式退役(Claude Platform release notes)。关于安全分流机制,第三方报道提到当生产防护被触发时,部分任务会被改由较早模型完成:网络安全类任务交给 Opus 4.8,生物与"前沿 LLM 开发"类请求交给 Opus 5,常规的 bug 查找与修复仍在 Opus 5.5 上执行(GPT-6 Luna vs Gemini 3.8 Flash vs Claude Opus 5.5)。

Google Gemini 系列

Google 于 2025 年末发布 Gemini 3 系列后,Gemini 3.1 Pro 于 2026 年 3 月 13 日登陆 VS Code 与 IntelliJ 的 Gemini Code Assist(Gemini for Google Cloud release notes)。2026 年 7 月 21 日,Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,主打面向大规模 agent 的效率、延迟与可靠性,并透露 Gemini 3.5 Pro 正在与合作方测试(Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber)。Gemini 3.8 Flash 与 Flash-Lite TTS 也已进入正式可用(GA)阶段(版本说明 | Gemini API)。定价方面,Gemini 3.1 Pro Preview 输入 $2、输出 $12(每百万 token),Gemini 3.8 Flash 输入 $0.75(Agent Platform Pricing | Google Cloud)。

xAI Grok

xAI 的 Grok 4.5 于 2026 年 7 月 8 日发布,是首个基于 V9(1.5 万亿参数)基座构建的旗舰,并且是与 Cursor 协同训练而非事后适配编程;其 API 定价为输入 $2、输出 $6(每百万 token)(xAI and Grok、Release Notes)。此后 Grok 4.6 于 2026 年 8 月 12 日、Grok 4.7 于 2026 年 9 月 21 日相继发布;Grok 4.7 保持 $2/$6 定价,上下文 500K,在 DeepSWE v1.1 得 71.0%、CursorBench 4.0 得 46.3%、Terminal-Bench 4.0 得 38.0%(Grok 4.7 Drops, OpenAI Cracks Math、Grok 4.7 — SpaceXAI's September 2026 Grok Flagship)。备受期待的 Grok 5 被推迟至 2026 年,候选方案为约 6 万亿参数的 MoE 模型,运行于 Colossus 2(Grok 5: Release Date & All We Know So Far)。在更早的 HLE-Diamond 榜单上,Grok 4.7 报告 25.4%(Introducing HLE-Diamond)。

Meta Llama

Meta 于 2026 年 9 月 3 日发布 Llama 4 Maverick 2,取消了此前对月活超 7 亿运营者的商业授权限制,并即时上线 HuggingFace(Meta "Llama 4 Maverick 2" — All Commercial Restrictions Lifted)。Llama 4 系列采用 MoE 架构,面向多模态理解、多语言与代码任务优化(Meta Llama 4 Maverick)。相较 OpenAI/Anthropic 的闭源旗舰,Meta 仍以开放权重为差异化路线。

DeepSeek

DeepSeek 于 2025 年 12 月 1 日发布 V3.2 与 V3.2-Speciale,后者在 IMO 2025、CMO 2025、ICPC World Finals 2025 与 IOI 2025 上均达到金牌水平,成绩分别相当于人类选手第二名与第十名(DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models)。2026 年 4 月 24 日发布 DeepSeek V4(含 V4-Pro、V4-Flash),沿用 DeepSeekMoE 与多 token 预测(MTP),并引入混合注意力(CSA+HCA)、流形约束超连接(mHC)与 Muon 优化器(DeepSeek V4 Technical Documentation)。2026 年 9 月 10 日发布 DeepSeek-V4.1-Flash,为新架构族中最小尺寸、具备原生多模态视觉理解,GPQA Diamond 达 90.9(Change Log | DeepSeek API Docs)。定价上,V4-Pro 为缓存未命中输入 $0.435、输出 $0.87 每百万 token,V4-Flash 为 $0.14/$0.28(DeepSeek V4 Pro: specifications, pricing, benchmarks)。需要澄清的是,外界长期传闻的"DeepSeek R2"从未发布(DeepSeek R2: The Most Anticipated Model That Never Shipped)。第三方评测把 DeepSeek V4 Pro 的 DeepSeekMoE 配置记为总参 1.6T、激活约 49B,并指出其自托管需要严肃的硬件投入(DeepSeek V4 and V4 Flash vs. Kimi K3、DeepSeek V4 vs GLM-5.2 vs Kimi K3: Which to Deploy)。

阿里 Qwen

阿里巴巴于 2026 年 2 月 16 日开源 Qwen3.5 系列首款模型 Qwen3.5-397B-A17B(又称 Qwen3.5-Plus),为原生多模态基础模型,覆盖推理、编程、agent 与多模态理解(Alibaba Open-Sources Qwen3.5、Qwen3.5: Towards Native Multimodal Agents)。其 API 定价为输入 ¥1.2、输出 ¥7.2 每百万 token(128k 输入以内)(qwen3.5-397b-a17b 模型信息)。此后 Qwen 快速迭代出 3.5-Plus、3.6-Plus、3.7-Plus 与 3.7-Max 等,均带"Thinking"开关,Qwen3.8-Max 则保留 low/medium/extra high 三档推理强度(Qwen Code Weekly Update)。需注意,截至 2026 年年中,阿里最强的编程模型 Qwen3.7-Max 为 DashScope 上的 API-only 模型($2.50 / $7.50 每百万 token),并未公开权重;可自托管的最强 Qwen 为更小尺寸版本(GLM-5.2 vs DeepSeek V4 vs Qwen3)。

月之暗面 Kimi

Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3,为 2.8 万亿参数模型,基于 KDA 混合线性注意力(Kimi Delta Attention)与注意力残差技术,原生支持视觉理解,上下文 100 万 token,号称全球首个开源的 3 万亿级模型(Kimi K3:智能的新前沿)。2026 年 7 月 27 日,K3 完整权重按承诺上传 HuggingFace,采用需对大型"模型即服务"业务单独签约的 Kimi K3 License(moonshotai/Kimi-K3)。K3 在 8 项真实 agentic 基准中的 4 项排名第一(Kimi K3),API 定价约输入 $3、输出 $15 每百万 token(Qwen 3.8 Max vs. Kimi K3)。2026 年 9 月 11 日,Kimi K2.8 预览版上线(What's New | Kimi Code Docs)。

字节豆包

字节跳动 Seed 团队于 2026 年 6 月 23 日发布 Seed 2.1 系列,面向真实生产力场景(Seed2.1 正式发布,深入 AI 生产力)。Doubao-Seed-2.1-pro 上下文窗口与最大输出均为 256k,最大思维链长度 256k,定价为输入 ¥6、输出 ¥30 每百万 token(AI Hub-豆包大模型API服务平台)。2026 年 9 月 16 日,Doubao-Seed-2.1-pro 升级至 0915 版本并全量上线火山方舟,强化 agent 专业任务交付、多模态编程与 3D/专业图文理解,同时进一步降低综合使用成本(豆包大模型2.1 Pro更新)。

其他:智谱 GLM

智谱于 2026 年 6 月 16–17 日上线并开源 GLM-5.2,主打长程任务,支持真正可用的 100 万 token 上下文,基于 7440 亿参数 MoE(每 token 约激活 400 亿参数),以 MIT 许可开放权重(Z.ai - GLM-5.2上线并开源、Zhipu AI)。第三方汇总则把 GLM-5.2 记为约 7530 亿总参数、400 亿激活(Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2),两处口径略有差异。

开放权重阵营横向对比

2026 年年中,开放权重前沿模型的规模与许可已形成明确梯队(Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2):

模型总参数 / 激活上下文许可权重状态
Kimi K32.8T / 约 50B1M改良 MIT2026-07-27 上线
DeepSeek V4 Pro1.6T / 约 49B1MMIT已上线
GLM-5.2约 753B / 约 40B1MMIT已上线

三者的 Artificial Analysis Intelligence Index 分别约为 57(Kimi K3,总榜第 4)、44(DeepSeek V4 Pro,Max reasoning)与 51(GLM-5.2)(Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2)。Kimi K3 在 Terminal-Bench 2.1 上厂商自报 88.3%(Top 5 Open Weight Models That Matter to Developers in 2026)。

不同来源的规格口径并不统一。MarkTechPost 在 2026 年 7 月 18 日的对比表中,把 Kimi K3 的激活参数标注为"未披露(16/896 专家)"、模态记为 Text + vision + video;DeepSeek V4 Pro 为总参 1.6T、激活 49B、1M 上下文(最大输出 384K);GLM-5.2 为总参 744B(Artificial Analysis 口径 753B)、激活约 40B、1M 上下文(最大输出 131K)(Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2 — MarkTechPost)。自托管门槛方面,第三方给出 Kimi K3 需多节点 H100/MI300(≥8 卡、vLLM 或 SGLang),GLM-5.2 可单节点 8×H100 或 4×MI300 运行(Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash (2026));一份面向落地选型的对比则总结 Kimi K3"能力最强但体量巨大、API 更贵且为自定义许可",GLM-5.2"独立编程测试成绩领先、MIT 许可,但自托管仍需严肃硬件"(DeepSeek V4 and V4 Flash vs. Kimi K3)。

核心技术与关键概念

代表性项目/产品(带官方链接)

关键数据与评测结果

趋势与争议

一是迭代节奏空前加快:同一厂商在数周内连发旗舰或改版(Grok 4.5→4.6→4.7;Claude Opus 4.8→Fable 5→Opus 5.5),用户与评测机构难以持续跟踪。二是基准可信度受质疑:ARC-AGI 等出现"过拟合担忧",GPT-6 Astra 的 ARC-AGI-3 高分被指依赖自定义测试框架、与标准框架结果不一致(GPT-6 Astra Review: Benchmarks, Pricing, Safety、Gemini benchmark gains, ARC overfit concerns);而 MMLU 等老基准已被多家模型刷至饱和。三是降本与"降价内卷":前沿 token 价格大幅下探,前沿价格指数较 2023 年 3 月下跌约 84%,DeepSeek V4 Pro 借 MoE 效率实现约 75% 降价(LLM API Pricing Trends — BenchLM、4 Best Frontier AI Models);高盛研究指出,具备前沿性能与多模态能力的模型仍保有较强定价能力,但低端 API 市场已进入价格战,预计 2026 年下半年低端 API 价格约每百万 token $0.1–0.2,部分资金充裕的中国厂商可能短期以零甚至负毛利率补贴(大模型价格战持续升温 — 观察者网)。四是开源与闭源的分层:Kimi K3、GLM-5.2、Qwen3.5 以开放权重冲击前沿,但许可证对大规模商用设限(如 Kimi K3 License 要求大型 MaaS 业务单独签约),围绕"open weights vs. open source"的界定仍存争议(Kimi K3 Open Weights、moonshotai/Kimi-K3)。五是同一模型的"档位化"与跨厂路由成为采购常态:分析建议企业按任务同时路由 2–3 档模型,以兼顾成本与能力上限(GPT-6 Luna vs Gemini 3.8 Flash vs Claude Opus 5.5)。六是监管进入可执行阶段:欧盟 AI Act 于 2024 年 8 月 1 日生效,其中通用人工智能(GPAI)模型的义务自 2025 年 8 月 2 日起适用,而 AI Office 与成员国主管机关的执法权限自 2026 年 8 月 2 日起开始适用,同日部分透明度等条款也进入可执行状态(AI Act — European Commission、FAQ — EU AI Act Service Desk)。

参考来源

  1. Strategic Analysis of Frontier AI Models: GPT-5.2 vs. Gemini 3
  2. GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro: The Frontier Model Showdown
  3. Presentamos GPT‑5.5
  4. 预览 GPT‑5.6 Sol:新一代模型
  5. GPT-6 Astra:新一代智能
  6. OpenAI 研究(发布时间索引)
  7. GPT-6 Astra : 100 000 GPU Nvidia pour entraîner le modèle
  8. Claude Opus \ Anthropic
  9. Claude Platform release notes
  10. Claude Mythos 5
  11. Claude Opus 5.5 - Claude Platform Docs
  12. Introducing Claude Opus 5.5 \ Anthropic
  13. Gemini for Google Cloud release notes
  14. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
  15. 版本说明 | Gemini API
  16. Agent Platform Pricing | Google Cloud
  17. xAI and Grok
  18. Release Notes
  19. Grok 4.7 Drops, OpenAI Cracks Math
  20. Grok 4.7 — SpaceXAI's September 2026 Grok Flagship
  21. Grok 5: Release Date & All We Know So Far
  22. Meta "Llama 4 Maverick 2" — All Commercial Restrictions Lifted
  23. Meta Llama 4 Maverick
  24. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
  25. DeepSeek V4 Technical Documentation
  26. Change Log | DeepSeek API Docs
  27. DeepSeek V4 Pro: specifications, pricing, benchmarks
  28. DeepSeek R2: The Most Anticipated Model That Never Shipped
  29. Alibaba Open-Sources Qwen3.5
  30. Qwen3.5: Towards Native Multimodal Agents
  31. qwen3.5-397b-a17b 模型信息
  32. Qwen Code Weekly Update
  33. GLM-5.2 vs DeepSeek V4 vs Qwen3: The Open-Weights Coding Model Showdown (2026)
  34. Kimi K3:智能的新前沿
  35. moonshotai/Kimi-K3
  36. Kimi K3
  37. Qwen 3.8 Max vs. Kimi K3
  38. What's New | Kimi Code Docs
  39. Seed2.1 正式发布,深入 AI 生产力
  40. AI Hub-豆包大模型API服务平台
  41. 豆包大模型2.1 Pro更新
  42. Z.ai - GLM-5.2上线并开源
  43. Zhipu AI
  44. Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2: Open-Weight AI Model Comparison
  45. Top 5 Open Weight Models That Matter to Developers in 2026
  46. What Is Mixture of Experts?
  47. GPT-6 Luna vs Gemini 3.8 Flash vs Claude Opus 5.5: Which Tier Fits Your Workload?
  48. Frontier AI Benchmarks Compared: Opus 5.5, GPT-6 & More (September 2026)
  49. Claude Opus 5.5: Specs, Benchmarks, Pricing and How It Stacks Up
  50. Introducing HLE-Diamond | Humanity's Last Exam
  51. LMArena Leaderboard, August 2026
  52. AI Model Leaderboard — Elo Rankings (2026)
  53. Announcing the Artificial Analysis Intelligence Index v4.3
  54. Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index
  55. GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1: The Ultimate July 2026 Comparison
  56. Abstraction and Reasoning Corpus for AGI v2 (ARC-AGI-2)
  57. Gemini benchmark gains, ARC overfit concerns
  58. 4 Best Frontier AI Models
  59. Kimi K3 Open Weights
  60. GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」-36氪
  61. Frontier Models — ThursdAI
  62. OpenAI Launches GPT-6 Astra With Record Benchmarks — howaiworks
  63. GPT-6 Astra: Features, Benchmarks, and Pricing — DataCamp
  64. GPT-6 Astra Review: Benchmarks, Pricing, Safety — aitoolsreview
  65. Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2: Open Trillion-Scale MoE Models Compared — MarkTechPost
  66. Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash (2026) — a2aprotocol
  67. DeepSeek V4 and V4 Flash vs. Kimi K3 — softmaxdata
  68. DeepSeek V4 vs GLM-5.2 vs Kimi K3: Which to Deploy — andrew.ooo
  69. Artificial Analysis Intelligence Index — datalearner
  70. Claude Fable 5.1 Scores Tops Artificial Analysis Intelligence Index With Score Of 66 — OfficeChai
  71. Artificial Analysis Intelligence Index — BenchLM
  72. LLM API Pricing Trends — BenchLM
  73. LLM Pricing Statistics (2026) — BenchLM
  74. LLM API Pricing Comparison, September 2026 — DEV
  75. The 2026 LLM API Pricing Comparison — DEV
  76. 大模型价格战持续升温,智谱市值跌至3000亿港元 — 观察者网
  77. AI Act — European Commission
  78. Frequently Asked Questions — EU AI Act Service Desk
  79. Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet — arXiv 2509.06861
  80. Scaling of Capability and Efficiency at Inference Time in Large Reasoning Models — arXiv 2609.27166
  81. Test-Time Compute: How Reasoning Models Are Changing AI Agent Architecture in 2026 — skillgen
← 可解释性与机制分析长上下文技术:位置外推、稀疏注意力与状态空间模型 →