测试时计算革命:推理阶段的Scaling Laws正在形成

资讯1周前更新 muybien
12 0 0

测试时计算革命:推理阶段的Scaling Laws正在形成

预训练的盛宴之后,推理阶段开始”长出”新的Scaling Laws

2024年,OpenAI o1的发布像一个信号弹,把AI社区的注意力从”训练时堆多少算力”转向了一个更微妙的问题:推理时,我们愿意为一次回答花多少算力?进入2026年下半年,这个问题的答案正在重塑整个行业的资源分配、硬件路线和模型设计哲学。

如果说2022年到2024年是大模型”预训练Scaling Laws”的鼎盛期——堆参数、堆数据、堆GPU,那么2026年正在发生的,是一次静悄悄的范式转移:在推理阶段,模型可以通过”思考更久”来换取能力提升,而且这种提升的曲线,呈现出可预测、可度量的幂律形态。换句话说,继训练之后,推理侧的Scaling Laws正在形成。

这个变化不是某个实验室的孤立发现。OpenAI在o3上验证了”延长思考”对ARC-AGI等高难度基准的显著增益;Anthropic在Claude 4.5中默认开启”Extended Thinking”模式;Google的Gemini 3系列把”深度推理”作为标配;DeepSeek R2和Kimi K2系列在国内掀起了”长思考链”的工程化竞赛。从硅谷到中关村,从闭源API到开源权重,“Thinking Models”已经从一个产品名词,变成了一种新的模型范式

推理侧Scaling Laws是怎么”长”出来的

理解这场革命,需要先理解一个反直觉的事实:同一个模型,思考得越久,表现可以越好,而且这种提升有规律可循

从Pass@1到”计算最优推理”

2024年底,Snell等人提出Inference Scaling Laws,论证了推理时计算与模型性能之间的幂律关系。这一框架的核心洞见是:测试时的算力投入,本质上可以替代一部分预训练参数带来的能力。一个较小的模型,如果允许它在推理时”想”得更深入,可能超过一个不思考的大模型。

到2026年,这条规律已经在多个维度被反复验证。一个被广泛引用的工程经验是:在数学竞赛(USAMO级别)和博士级科学问答(GPQA Diamond)这类任务上,把推理token从8K扩展到128K,配合过程奖励模型(PRM)做best-of-N采样,准确率能继续爬升一个台阶。OpenAI o3在内部测试中展示的”高算力模式”在FrontierMath上达到75%以上的成绩,正是这条曲线的高位样本。

更精细的研究还揭示了策略最优性:并不是所有任务都值得”死磕”。Snell团队的后续工作区分了”易验证易优化”的任务(数学、代码)适合用搜索+验证器做并行探索;”难验证”的任务(开放式写作、复杂规划)则更适合顺序式的”长链思考”。这种区分让”推理时计算怎么花”变成了一门有方法论的工程学科。

三种主流的”思考路径”

2026年的推理时计算,主要沿着三条技术路径展开:

  • 纯长链思考(Long CoT):模型在内部生成数千甚至数万token的推理轨迹,再输出答案。代表是DeepSeek R1、Kimi K2的”慢思考”模式。它的优势是单次推理可解释性强,工程实现相对简单;代价是延迟高,对token吞吐量敏感。
  • 搜索+验证(Search with Verifier):模型生成多个候选解,用过程奖励模型或结果验证器打分筛选。这是o系列在数学和代码任务上的核心打法。Noam Brown在Meta领衔的团队持续推动这条路线,强调算力要花在”验证”上,而不是”无脑采样”上。2026年的新进展是,验证器本身也变成了可以被扩展的对象——用更多算力训练更好的PRM,再用更好的PRM去指导推理时的搜索,形成正反馈循环。
  • 自适应计算(Adaptive Compute):模型学会”什么时候该想,什么时候该直接答”。Anthropic的Claude系列一直强调这种”恰当时机的思考”,2026年发布的Claude 4.5在内部评测中展现了更细腻的”思考预算”分配能力——简单问题几乎不消耗额外token,难题则自动延长思考链路。

这三条路径并非互斥。最先进的生产系统往往是混合的:先做难度估计,再决定走”快路径”还是”慢路径”,慢路径内部又调用搜索+验证。这种”推理时调度”本身,正在变成一个新的研究子领域。

经济账变了:推理成本第一次反超训练成本

这场技术革命最直接的影响,是AI公司的成本结构正在被改写

从”训练一次性投入”到”推理持续消耗”

过去几年,”训练一个大模型要几千万美元”是行业共识,但训练是一次性事件,模型上线后单次推理成本边际递减。2026年的故事不一样了。

一家中型AI应用公司的CTO在近期访谈中透露:他们的产品接入推理模型后,单用户日均token消耗是上一代非推理模型的20倍以上,但客单价只提高了3-4倍。这导致在用户量突破百万级之后,推理算力支出迅速从”可控”变成”主导”——他们现在每月的推理账单,已经超过了当初训练模型摊销的成本

这并非个例。Anthropic CEO Dario Amodei在2026年初的一次公开对话中承认,公司在推理算力上的资本支出增速,”已经显著超过训练基础设施”。他提到了一个让行业警醒的数字:头部AI公司2026年花在推理上的总算力,预计会达到训练算力的3-5倍。这是历史上第一次,推理侧的”算力消耗”在体量上超过训练侧。

硬件路线因此被重新书写

成本结构的变化直接传导到硬件层。2026年的GPU市场出现了一个有趣的分叉:

  • 训练侧的H100/B100/下一代B200依然重要,但增长曲线明显放缓;
  • 推理侧出现了专门优化的ASIC——Google的TPU v6/TPU v7,AWS的Trainium 3,以及多家初创公司的”低精度高吞吐”推理芯片,都瞄准了长序列、低延迟、确定性输出的推理场景。

NVDA虽然仍是最大赢家,但GTC 2026上黄仁勋的演讲主题,已经从”训练更大模型”转向了“Inference Factory”(推理工厂)——他用了一个比喻:未来AI的能耗会像电网,每个token的生成都是一次”发电+输电”的过程。这个叙事转换,背后是推理时计算Scaling的硬需求。

能力的边界:哪些任务受益最大,哪些仍是难题

不是所有任务都能从”思考更久”中获益。2026年的实践正在勾勒出推理时Scaling的”能力地图”。

受益最显著的领域

数学、代码、形式化证明这类“有标准答案且可验证”的任务,是推理时Scaling的最大受益者。DeepMind的AlphaProof在2024年IMO上拿到接近银牌水平后,到2026年新一代系统已经在多个国际数学竞赛的模拟测试中稳定达到金牌线。在代码领域,推理模型配合测试时搜索,能够在HumanEval+、SWE-bench Verified等基准上把成绩再推高10-20个百分点。

更让人兴奋的是多步规划与工具使用。当模型被允许在推理时”思考-调用工具-观察-再思考”时,能完成的任务复杂度显著上升。OpenAI的Operator、Anthropic的Computer Use,在2026年下半年都进入了商用阶段,背后正是推理时Scaling对”长视野任务”的能力注入。

仍然棘手的领域

另一方面,“难以验证”或”无标准答案”的任务,推理时Scaling的收益开始边际递减。

开放式创作(小说、营销文案)的质量评估本身就主观,多采样加验证器在这里很容易陷入”自我偏好循环”。长篇研究综述、跨学科综合分析这类需要”广度+深度”的任务,单纯延长思考链路收效有限,更需要外部知识检索与人类反馈的介入。

更关键的是“推理时幻觉”问题。当模型思考了100K token,它可能在中间步骤就”偏航”,但因为整个链条自洽,最终输出了一个自信的错误答案。过程奖励模型(PRM)部分缓解了这个问题,但2026年MIT和斯坦福的几项独立研究都指出,推理时Scaling并不天然降低幻觉率,反而可能放大”系统性偏航”的风险。这是当前最棘手的研究开放问题之一。

未来12-18个月:推理时Scaling的三条延伸方向

站在2026年7月这个时间点,推理时Scaling Laws仍在快速演化。几个值得密切关注的趋势:

1. 训练-推理联合Scaling

过去训练和推理是两套独立的算力预算。2026年出现的新思路是联合优化:模型在训练时就被设计成”能更好利用推理时算力”——比如更长的内部表征、更强的自我验证能力。Ilya Sutskever领导的SSI在2026年公开的零星信息显示,他们的核心假设之一就是”真正的智能需要训练和推理的协同扩展”。这条路线如果走通,可能比单纯堆预训练参数更经济。

2. 推理时记忆(Test-time Memory)

当模型被允许”长期思考”(比如跨多个会话的持续推理),会出现“推理时记忆”的雏形——把一次深度思考的产物存储、压缩、再利用。这与传统的RAG不同:RAG检索的是外部知识,而推理时记忆检索的是过去自己的思考痕迹。Anthropic在Claude 4.5中引入了”项目级思考”功能,可视为这条方向的早期工程探索。

3. 个体化的计算-智能权衡

最终的落点,是让每个用户、每个任务都能定制自己的”算力-智能”权衡曲线。2026年下半年已经出现的产品形态是”推理档位订阅”:用户可以为单个问题选择”快速回答”(1秒、200 token)还是”深度研究”(10分钟、500K token)。这不只是UX创新,而是把推理时Scaling Laws变成了可定价的商品

从预训练Scaling到推理时Scaling,本质上是从”造一个聪明的模型”转向”让一个模型变得能花时间去变聪明”。后者的资源消耗看似更高,但带来的能力上限也更开放——因为思考的时间,没有自然的天花板。

这场革命的终局还远未到来。但可以确定的是,未来一年,”如何让模型在推理时花得值”,会比”如何让模型在训练时堆得大”,更值得每一位AI从业者投入精力

整理自 公开资料 | 2026年07月16日

📊 常见问题解答

❓ OpenClaw 是什么?

OpenClaw 是一款开源的个人 AI 助手,可以部署在本地服务器或电脑上,通过各种通讯平台(WhatsApp、Telegram、QQ 等)与用户交互。

❓ OpenClaw 安全吗?

OpenClaw 支持多种安全配置,包括 allowFrom 白名单、沙盒模式、数据本地存储等,可以根据需求选择合适的安全等级。

❓ 如何开始使用 OpenClaw?

访问 OpenClaw 官方文档,按照快速入门指南操作,5分钟即可完成基础配置。

📈 相关数据

  • ⭐ GitHub 星标:270,000+
  • 📚 支持平台:20+
  • 🌐 全球用户:数百万

🔗 参考资料: OpenClaw 官方文档 | GitHub

© 版权声明

相关文章

暂无评论

none
暂无评论...