🧊 前沿科技知识库
全部 / 人工智能(AI)

推理模型与测试时计算(Test-Time Compute)

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:人工智能·推理模型 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

推理模型(reasoning model)与测试时计算(test-time compute,TTS)是 2024 年以来的核心范式转变:模型不再「一次性作答」,而是在给出最终答案前生成一段可见或隐藏的长链推理(chain of thought),并允许通过增加推理时的算力来换取更高的正确率。OpenAI 在 2024 年 9 月推出 o1,用大规模强化学习训练模型生成「长的内部思维链」(Aprender a razonar con los LLM),开启了这一路线。

到 2026 年,思考能力已成为前沿旗舰的标准配置——OpenAI 的 GPT-5 于 2025 年 8 月发布时即被描述为「内置了思考能力」,并明确其面向所有人可用(GPT-5 正式发布)。这一范式进一步演化为两条工程化主线:一是「可控推理深度」,即用 effort 档位或 token 预算显式约束思考量;二是「自适应推理」,即由模型按任务难度动态决定思考多少。围绕这两条主线,评测、成本控制、训练算法(RLVR/GRPO 及其变体)与失败模式研究共同构成了 2025–2026 年的技术图景。

从系统角度看,测试时计算把「推理算力」从训练阶段部分解耦出来:训练时的规模定律回答「用多少算力训练」,测试时的扩展则回答「在单次推理中投入多少算力、以何种结构投入」。其直接后果是,同一个模型可通过对齐思考预算在「快速廉价」与「深思昂贵」之间连续滑动,而推理成本更多随任务难度而非请求数量变化。也正因如此,成本控制、延迟管理与评测口径成为 2026 年产品化落地的核心议题。

2025–2026 最新进展

OpenAI o 系列到 GPT-5/6 的延续。 2025 年 4 月 16 日发布的 o3 与 o4-mini 系统卡显示,两者把推理与完整工具链(浏览、Python、图像与文件分析、图像生成、记忆等)结合,并首次让模型「在思维链中使用工具」来增强能力(OpenAI o3 and o4-mini System Card)。o3 在 ARC-AGI 上以高算力配置取得 87.5%,AIME 2025 取得 88.9%,GPQA Diamond 取得 87.7%(Understanding and Benchmarking Artificial Intelligence: OpenAI's o3 Is Not AGI、OpenAI o3)。2025 年 8 月,OpenAI 发布 GPT-5,内置思考能力(GPT-5 正式发布);此后 GPT-5 系列与 GPT-6 Astra 均默认内置思考模式并支持 effort 档位(Claude vs ChatGPT vs Gemini)。有分析指出,GPT-5.2 的 Thinking 模式在 agentic 编程任务(规划、执行、调试、验证)上表现突出,被视为「真正的结对程序员」(Strategic Analysis of Frontier AI Models: GPT-5.2 vs. Gemini 3)。

DeepSeek-R1 与开源复现浪潮。 DeepSeek 于 2025 年初发布 R1 技术报告,证明可以仅用强化学习(无需人工监督推理轨迹)激励出长链推理行为(DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning)。其发布后 100 天内催生大量复现研究(100 Days After DeepSeek-R1: A Survey on Replication Studies)。2025 年 12 月 1 日,DeepSeek V3.2-Speciale 在 IMO 2025、CMO 2025、ICPC World Finals 2025、IOI 2025 上均达金牌水平,被官方描述为「对标 Gemini-3.0-Pro」(DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models)。开源阵营中,Kimi K3 等模型参数规模已达万亿级(DeepSeek-V3.2 (Thinking) vs Kimi K3),Kimi-K2-Thinking 等推理模型在 MMLU、SWE-bench、MATH-500 上接近专有 SOTA(Best Open Source LLMs in 2026)。

Claude 的 extended / adaptive thinking。 Anthropic 在 Claude 4.7 时代以「Extended Thinking」参与推理竞争(AI Reasoning Models Compared May 2026),并在后续新模型中把思考升级为默认开启的「自适应思考」,用 effort 参数控制思考深度,Claude Sonnet 5 的默认 effort 为 high(Claude Sonnet 5 - Claude Platform Docs)。以 Claude Opus 4.6 为例,自适应思考意味着模型评估每个任务后决定投入多少推理,可用 low、medium、high、max 等级别微调「智能—速度—成本」的权衡,简单查询快速响应、复杂问题充分思考(Anthropic Claude Opus 4.6: Is the Upgrade Worth It?)。该 effort 参数被放在 output_config 对象中(而非 thinking 内),并接受 low、medium、high、xhigh 等取值(Adaptive thinking)。

Gemini Deep Think。 Google 把最强推理做成独立的 Deep Think 模式:Gemini 3.1 Deep Think 在 ARC-AGI-2 上达到 84.6%(经 ARC Prize 验证)、HLE 无工具 48.4%(Gemini 3.1 Deep Think)。该模式被划分为数分钟级的「深推理档」,延迟 1–15 分钟,成本约为标准输出率的 3–5 倍(Gemini 3.1 Pro Review)。

Qwen 与 GLM 的推理开关。 Qwen 的推理模型提供两种模式:hybrid(按请求用 enable_thinking 开关思考)与 thinking-only(始终推理),输出以 reasoning_content 或 reasoning_text 返回(Thinking)。GLM 家族中 glm-5.3 为 thinking-only,glm-5.2/5.1/5/4.7/4.6 为默认开启思考的 hybrid(Deep thinking)。

测试时扩展被系统化梳理。 一项针对 test-time scaling 的综述从「扩展什么、如何扩展、在哪里扩展、效果如何」四个维度对该领域做了梳理,并把主流做法归纳为平行扩展(采样多份候选用投票或验证器聚合)、顺序扩展(沿单一轨迹延长思考)以及二者的混合(What, How, Where, and How Well? A Survey on Test-Time Scaling)。在此基础上,s1 以 budget forcing 强制模型「再想想」并控制思考 token 预算,实现可控的测试时扩展,在 AIME24 上取得当时最佳成绩(s1: Simple test-time scaling)。这些工作共同把「思考多少、怎么思考」从经验技巧变成可参数化的工程问题。

多智能体推理与算力效率。 对 self-consistency、self-refinement、multi-agent debate、mixture-of-agents 等策略的系统比较显示,不同测试时计算策略在 MMLU-Pro、BBH 等基准上的「性能—算力」帕累托前沿差异显著,应按预算选择最优策略而非默认使用最强配置(Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling)。这说明「多智能体」并非总能换来更好的性价比,其收益高度依赖任务结构与预算区间。

开源推理模型加速追赶。 2026 年,开源权重的推理模型已在多个推理基准上接近专有前沿:例如 DeepSeek v3.2 在 SWE-Bench Verified 达 73.1%,MiniMax-M2.5 达 80.2%、GPQA-Diamond 85.2%,Kimi K2 Thinking 为 71.3%/85.7%,Kimi K2.5 为 76.8%/87.6%(Best Open Source LLMs of May 2026)。与此同时,有研究发现 SWE-Bench 排名并不能预测某些真实软件工程任务的表现,说明单一基准的排序能力有限(React-ing to Grace Hopper 200)。

RL 训练算法的持续演进。 RLVR(Reinforcement Learning with Verifiable Rewards,以可自动判定的奖励训练)成为 R1 之后的主导范式,但研究开始系统揭示其奖励噪声问题:验证器(verifier)几乎从不「干净」——单元测试只探测有限边界情况,人类与合成标签并不完美,LLM judge(如 RLAIF)既有噪声又可能被利用,且这一问题在更难领域(尤其编程)更严重(Rate or Fate? RLVR: Reinforcement Learning with Verifiable Noisy Rewards)。与此同时,对 GRPO 的理论分析不断深入:IBM 的研究证明,对可验证奖励做均值+方差校准会在损失中诱导出一个对比损失,其对比样本来自旧策略生成的合成数据(RLVR: GRPO's Loss, Dynamics, and Success Amplification);另有工作给出理论证明,GRPO 会隐式激励基座模型产生正确推理(RLVR Implicitly Incentivizes Correct Reasoning in Base LLMs)。在此之上出现了多种改进:Off-Context GRPO 使用含特权指导的 rollout,但以重要性校正的目标把更新拉回原始无指导目标,避免未校正的引导训练失稳(Off-Context GRPO);SciencePRM 则在科学领域用过程级奖励到科学有效性的多个奖励层级来训练(SciencePRM%20Ma%20submission_416288476/cs224r_final_report_2026.pdf))。

核心技术与关键概念

代表性项目 / 产品(附官方链接)

关键数据与评测结果

趋势与争议

成本与延迟的权衡成为焦点。 思考 token 按输出计费,属于「昂贵」的那一类——2026 年 7 月前沿输出价约 $25–30/百万 token,而输入约 $5/百万;一个难题可能消耗 1 万以上不可见推理 token,且成本分布有厚尾,99 分位查询的成本可达中位数的 100 倍(Thinking Tokens: How Test-Time Compute Rewrote the AI Scaling Playbook)。由此催生了 per-request 思考预算上限、effort 档位等控制手段,厂商也把「自适应思考」作为默认策略以减少对简单任务的过度推理(Anthropic Claude Opus 4.6)。

自适应推理深度。 2025 年末至 2026 年一季度,CogRouter(2026 年 2 月)、ARES(2026 年 3 月)等方法证明,逐步动态调整推理深度的 agent 可在保持 SOTA 任务表现的同时减少 50–62% 的 token 消耗(Adaptive Reasoning Depth in AI Agent Systems)。

评测可复现性争议。 有研究指出,「test-time scaling」一词覆盖了沿单轨迹延长、采样后投票/验证、部分状态搜索等结构截然不同的算法,若只报准确率而不说明推理协议、或把它们笼统归为「预算」,结果难以跨研究比较(Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility)。此外,「蒸馏/压缩推理」方向(如 CRISP 最多减少 56% 推理长度同时提升准确率)也在挑战「越长越强」的假设(CRISP: Compressed Reasoning via Iterative Self-Policy Distillation)。

RLVR 的奖励噪声与可持续性。 随着研究深入,可验证奖励的「不干净」被反复强调:验证器覆盖不足、标签不完美、LLM judge 可被利用,都会使训练信号偏离真实目标,且在编程等稀疏反馈领域尤为突出(Rate or Fate?)。这使得「如何设计更稳健的奖励与验证器」成为 RLVR 之后的关键议题。

预训练算力与测试时算力的权衡。 既然正确率可随测试时算力提升,就自然出现「更小的模型 + 更多思考」与「更大的模型 + 更少思考」之间的取舍;前者在可验证、可分解的任务上往往更划算,但其收益受制于验证器质量与推理延迟,且并非普遍成立(What, How, Where, and How Well?、The Art of Scaling Test-Time Compute for Large Language Models)。多份研究同时提示,「更多算力不一定更好」,需按任务与预算做帕累托选择(Multi-Agent Reasoning Improves Compute Efficiency)。

思考内容是否可见、可监督。 推理模型的产品化还带来「思考是否对用户隐藏」的问题:Qwen 等以 reasoning_content/reasoning_text 字段返回思考内容(Thinking),而部分产品仅展示思考摘要。这在可调试性、可监督性、成本透明与安全审计之间形成张力,也影响用户对模型结论的信任方式。

参考来源

  1. Aprender a razonar con los LLM
  2. GPT-5 正式发布(OpenAI)
  3. OpenAI o3 and o4-mini System Card
  4. Understanding and Benchmarking Artificial Intelligence: OpenAI's o3 Is Not AGI
  5. OpenAI o3
  6. OpenAI's O3: Features, O1 Comparison, Benchmarks & More
  7. Strategic Analysis of Frontier AI Models: GPT-5.2 vs. Gemini 3 (January 2026)
  8. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
  9. 100 Days After DeepSeek-R1: A Survey on Replication Studies
  10. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
  11. DeepSeek-V3.2 (Thinking) vs Kimi K3
  12. Best Open Source LLMs in 2026
  13. AI Reasoning Models Compared May 2026
  14. Claude Sonnet 5 - Claude Platform Docs
  15. Anthropic Claude Opus 4.6: Is the Upgrade Worth It?
  16. Adaptive thinking
  17. Gemini 3.1 Deep Think
  18. Gemini 3.1 Pro Review
  19. Thinking (Qwen)
  20. Deep thinking (Model Studio)
  21. Rate or Fate? RLVR: Reinforcement Learning with Verifiable Noisy Rewards
  22. RLVR: GRPO's Loss, Dynamics, and Success Amplification (IBM)
  23. RLVR Implicitly Incentivizes Correct Reasoning in Base LLMs
  24. Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information
  25. SciencePRM%20Ma%20submission_416288476/cs224r_final_report_2026.pdf)
  26. Reinforcement Learning with Verifiable Rewards for Small Search Agents
  27. Rewards as Labels: Revisiting RLVR from a Classification Perspective
  28. Process reward model (PRM)
  29. Let's Verify Step by Step
  30. What, How, Where, and How Well? A Survey on Test-Time Scaling
  31. s1: Simple test-time scaling
  32. Inference-Time Distillation
  33. Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning
  34. The Art of Scaling Test-Time Compute for Large Language Models
  35. Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling
  36. Anthropic - promptfoo docs
  37. Thinking Tokens: How Test-Time Compute Rewrote the AI Scaling Playbook
  38. Adaptive Reasoning Depth in AI Agent Systems
  39. Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
  40. CRISP: Compressed Reasoning via Iterative Self-Policy Distillation
  41. Claude vs ChatGPT vs Gemini
  42. Best Open Source LLMs of May 2026
  43. React-ing to Grace Hopper 200
← RAG 与上下文工程(Context Engineering)与智能体记忆推荐系统与 AI(Recommender Systems & AI) →