10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI智能体

模型如何获得更好的推理表现:8 种测试时计算机制详解

5小时前 AI智能体 34 0

让大语言模型(LLM)获得更强推理表现的方法,主要可以归为两类:

  • 并行扩展(parallel scaling):对同一个提示多次采样,再从多个候选结果中进行选择。
  • 顺序扩展(sequential scaling):在给出最终答案前,延长单条推理轨迹,让模型执行更多推理步骤。

树搜索类方法同时结合了这两种方式,因此也会继承两者的局限。

这些方法都不会改变模型权重,所有额外计算都发生在推理调用阶段。这也是模型准确率不理想时,团队通常会优先尝试测试时计算(test-time compute)的原因:它不需要重新训练模型,但会持续增加每次请求的成本。

训练成本通常只需支付一次,随后可分摊到大量调用中;推理计算则按请求持续付费。不过,额外计算往往能够换来更好的结果。一些研究发现,在 FLOPs 相当的比较中,对于较小模型本就具有较高成功率的问题,增加测试时计算的效果可能优于直接使用参数规模大 14 倍的模型。

测试时计算不是越多越好。不同方法都有适用边界:简单问题可能被过度优化,困难问题也未必能靠增加搜索预算解决。

下面介绍 8 种常见的推理机制。

1. 思维链(Chain of Thought,CoT)

图片 1

思维链引导模型逐步推理,在得出答案前生成中间步骤。推理模型通常已经具备这种能力,使用时主要增加的是推理 Token 消耗。

2. 多数投票(Majority Voting)

在温度不为 0 的条件下,多次运行同一个提示,然后把出现次数最多的答案作为最终答案。这种方法不需要奖励模型,因为多个样本之间的一致性本身就是一种信号。

图片 2

多数投票能够修正随机错误,却无法解决系统性错误。如果模型每次都以相同方式误判,所有样本仍会得出一致结果,投票反而会以更高置信度返回错误答案。

此外,这种方法要求不同答案之间能够进行等价性判断,因此不太适合开放式文本生成。

3. Best-of-N

Best-of-N 会生成 N 个完整答案,再使用奖励模型逐一评分,最终保留得分最高的答案。

图片 3

随着对代理奖励的优化压力不断增加,真实奖励可能先上升、达到峰值,再开始下降。当 N 超过某个阈值后,搜索可能更倾向于找到“奖励模型喜欢的答案”,而不是真正正确的答案。

另一个难点是:奖励模型必须具备比生成模型更可靠的判断能力,而这往往是整个方案中更困难的一部分。

4. 扩展思考(Extended Thinking)

模型在回答前先使用一定数量的 Token 进行内部推理。调用方通常可以通过 budget_tokens、thinkingBudget 或 reasoning_effort 等参数设置推理预算。

图片 4

DeepSeek-R1-Zero 在 AIME 2024 上的准确率仅通过强化学习就从 15.6% 提升到 71.0%,推理阶段没有使用外部搜索框架。

但思考越多并不总是越好。Anthropic 的逆尺度分析构造了一些任务:随着推理轨迹变长,模型准确率反而下降。例如,预先注入无关数字的计数问题,以及模型反复重新审视已经解决的约束推理过程。

5. 自我改进(Self-Refinement)

模型先写出答案,再批判自己的答案并进行重写,如此循环迭代。

图片 5

不过,自我改进的证据相对较弱。在 GSM8K 测试中,GPT-3.5 虽然纠正了 7.6% 的错误答案,却也改坏了 8.8% 的正确答案,导致整体净收益为负。

6. 思维树(Tree of Thoughts,ToT)

多数投票只在多个完整答案之间做选择,而思维树会改变每一步的推理过程,再从多条路径中选择整体最优方案。

图片 6

在每个推理步骤中,模型都会探索多个可能方向。这些分支共同构成一棵树,另一个独立过程则评估在当前时间步,哪条路径最有希望。

可以把它理解为一种搜索算法:沿着多条推理路径寻找最合理、最连贯的解决方案。它需要更多计算,但在部分任务中会明显优于基础 CoT。

7. 使用过程奖励模型的束搜索

这种方法保留 K 个部分解,并在生成过程中对每一步进行评分,而不是等到完整答案生成后再统一评价。

图片 7

在计算预算较小时,它可能优于 Best-of-N;但随着预算增加,其表现又可能落后于 Best-of-N。过度优化时,推理过程可能出现步骤重复,甚至退化为只剩一两个步骤。

它通常更适合中等难度问题:在简单问题上容易过度优化,而面对最困难的问题时,增加搜索本身也未必有效。

8. 蒙特卡洛树搜索(Monte Carlo Tree Search,MCTS)

MCTS 会选择一条有希望的部分路径,对其进行扩展,运行至完整答案,再把评分沿路径向上回传,并重复这一过程。

图片 8

DeepSeek 在 R1 的研发过程中尝试过这种方法,但最终放弃了。语言模型下一 Token 的候选空间远大于棋盘游戏中的合法动作空间,因此,训练一个足够可靠的价值模型来指导搜索非常困难。

DeepSeek 也因类似原因放弃了过程奖励模型(Process Reward Model,PRM):推理步骤的正确性难以定义,标注难以规模化,而且策略模型还可能利用评分器的漏洞。最终,DeepSeek 选择把搜索能力内化到模型权重中,并采用基于规则的奖励。

小结:先判断错误类型,再选择扩展方式

  • 如果错误主要来自采样随机性,可以尝试多数投票或 Best-of-N。•如果任务需要探索多条中间路径,可以考虑思维树、束搜索或 MCTS。•如果模型本身已经具备较强推理能力,可以增加扩展思考预算。•如果模型存在稳定的系统性误判,单纯增加采样或推理长度通常无法从根本上解决问题。

💡 实践建议

推理预算应根据任务难度动态分配。先用低成本方案建立基线,再逐步增加采样数、推理长度或搜索宽度,并同时监控准确率与单位请求成本。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:模型如何获得更好的推理表现:8 种测试时计算机制详解
#LLM推理 # 测试时计算 # 思维链 # 树搜索 # AI训练 
收藏 1
Chrome 本地 4GB AI 模型一键关闭教程:官方下载条件更新详解
MiniMax 开源 MV 生成 Skill:用歌词和音乐自动生成分镜脚本
推荐阅读
  • LangChain Deep Agent 全流程评估方案:解决 Agent 上线前的核心痛点
  • 5 个真实业务场景用lark-cli直连飞书,200+ 命令、19 个 Skill 即装即用
  • 即梦CLI:如何用OpenClaw搭建AI工作流实现24小时自动化生图、生视频创作
  • browser-harness 部署指南:5 分钟让 AI 自动操作浏览器,结合 Hermes Agent 实现本地 AGI
  • 龙虾(OpenClaw)装好别松懈,教你五步给电脑装上龙虾安全防护
评论 (0)
请登录后发表评论
分类精选
Multi-Agent(多智能体)实战:OpenClaw x 飞书机器人,为每个业务场景打造专属多Agent项目协作群
7394 5月前
微信 iLink Bot 协议深度拆解:开发者必备实战手册
6692 5月前
即梦CLI:如何用OpenClaw搭建AI工作流实现24小时自动化生图、生视频创作
5977 4月前
微信官方 ClawBot 插件多Agent如何绑定多个微信号?让全家人都用上了OpenClaw!
5601 4月前
OpenClaw 升级到 2026.3.24 后,微信 ClawBot 插件更新指南
4844 4月前
腾讯系 WorkBuddy :一键部署 OpenClaw 并接入微信,扫码即用,体验丝滑
4454 5月前
Star-Office-UI:用像素办公室实时可视化 OpenClaw(小龙虾)的工作状态
4401 5月前
7 个高质量前端UI设计的 Skills(技能包),让 AI 编程生成高质量UI代码
3934 4月前
OpenClaw 飞书多 Agent 实战:一只龙虾不够用?教你养一池子龙虾
3932 5月前
新手入门小龙虾(OpenClaw)完整配置指南
3660 5月前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 模型如何获得更好的推理表现:8 种测试时计算机制详解
2 DeepSeek Harness 架构与执行 Loop 深度全解:模型之外的可靠执行系统
3 构建 Agent Harness 的 7 个关键设计决策:从单智能体到权限控制
4 2026 年 RAG Embedding Model 选型指南:六类场景与三条过时经验
5 Agent Skills 沉淀企业 SOP:从静态文档到可调度知识资产
6 具身智能 7 个核心概念通俗讲解:从 VLM、VLN 到世界模型
7 LangChain、AgentScope、Mem0 深度横评:谁才是 Agent 的真正记忆系统?
8 10 个 Claude Code Skill 帮你跑通一人公司创业链路
9 WorkBuddy 生图 Skill 怎么选?7个工具和 5大模型一次讲清
10 marketingskills:3.8 万 Star 的开源营销技能库,给 AI Agent 装上营销专家大脑
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联