AI Agent 的上限看模型,底线看什么?这个问题我找了张图来说明——AI 应用技术栈金字塔:最吃劲的一块是中间的 Web Search。

从下往上看:底层是通用大语言模型(LLM),上面是检索增强(RAG),再上面是工具调用(MTC),最尖是 Agent 智能体。但真正最吃劲的是夹在中间那个蓝色小方块——AI 搜索 Web Search。
Agent 的搜索能力不是简单搜一下关键词。当用户说"帮我查一篇关于某某的文章"时,它得自己拆问题、把问题改写成若干关键词去查,再一轮轮搜索、筛选信息源、再整合。

但现在有个严峻问题:互联网上充斥着 AI 生成的垃圾信息和洗稿文,通用搜索稍不留神就会把 Agent 带进沟里。

最近注意到豆包搜索,是因为火山引擎把它做成了支持 Agent 接入的基础设施。它最让我意外的一点是:给每条搜索结果标注发布时间和信源等级。权威公告是一档,主流媒体是一档,自媒体又是一档。

给来源分等级这件事,其实跟之前分享的"AI 事实核查方法论"思路一致:

- 一级信源(结论锚点):公司公告、监管披露、官方财报、法律判决
- 二级信源(交叉验证):主流通讯社、行业权威媒体
- 三级信源(参考补充):自媒体深度分析,需与一二级交叉验证
- 四级信源(禁止进入底稿):匿名爆料、无法追溯的内部消息、强广告内容

豆包搜索支持 API、MCP 和官方 Skill 三种方式接入 Agent。我通过 MCP 方式接入做了测试。

开通服务后,把帮助文档和 API Key 喂给 Agent 即可。然后设置研究指令,让它先建证据再谈分析。

具体指令示例:要求 Agent 检索时标注检索日期和信源等级,找不到可靠证据时明确写"无法核实",禁止根据常识补全。

经过数轮调研后,Agent 给出一份事实底稿结果。为了方便展示,看三组实验对照图。


图里最能说明问题的是"字节跳动占营业收入比例"这个问题。挂 Tavily 回答"约 20%",但挂豆包搜索后以官方年报为一级信源,核对出第一大客户其实约占 26%。

每条结果都做信源验证和权威性分级,这不是偶然的。

换天孚通信(300394)按同样流程测试:豆包搜索把深交所互动易的官方回应"并未开会"作为高优信源递上来,Agent 拿到后在底稿里如实标了"传闻不实"。

AI 搜索的分水岭不在于"能不能搜到",而在于把海量信息捞回来之后,搜索能不能提前给信源排好座次,直接告诉你到底该信谁。

换个赛道再测试:世界杯决赛
阿根廷对法国这种全民话题,官方通报、媒体报道和自媒体小道消息全搅和在一起,泥沙俱下,最考验搜索的成色。

挂 Tavily 答核心事实确实快,但对于一些细节问题回答得比较模糊。挂豆包搜索后,它会把官方通报作为一级信源优先展示,媒体解读作为二级信源补充,自媒体猜测明确标注为低等级信源。
底层模型
跑测底层模型用的是 Doubao-Seed-Evolving,豆包 Seed 系列里保持周更迭代的版本,1M 上下文,主攻 Coding 和 Agent 场景。

Agent 的上限取决于模型能力,但底线取决于搜索和信源验证能力。当互联网信息质量持续下降时,谁能帮 Agent 筛掉噪音、锁定可靠信源,谁就掌握了 Agent 应用的核心竞争力。