能搜到,就等于是对的?真正的分水岭,是该信谁给 Agent 喂对数据
信源分级 · 三轮实测 · 豆包搜索 vs Tavily
豆包搜索 · Web Search for Agent
📦 3 Parts + Conclusion👉 滑动
大家好啊,我是甲木。不管是之前在企业做培训,还是做分享的时候,经常会有朋友问到:AI 搜索出来的结果,其准确性该怎么保证?以及 AI 搜索的信息源又是怎么生成的?今天这篇文章,就给大家聊一聊关于 AI 搜索Web Search。这话题我之前做过一期内容,今天来接着聊,我找了张图:
— AI 应用技术栈金字塔:最吃劲的一块,是中间那个蓝色小方块 Web Search
从下往上看这座塔:电、数据中心、芯片、Linux、云,再往上,才是你天天在用的 AI 应用。全塔最吃劲的一块,是中间那个蓝色小方块:Web Search。对于时效性信息,AI 给出的每个答案、每份研报、每条投资逻辑,都得打它这儿过一遍。
脆弱在哪?看左边那列原料:新闻站、公司公告、年报,还混着博客、论坛和来路不明的截图、营销号。真真假假、新旧不一,全都灌入这一块。开头那个问题,答案就藏在这儿。经常会有朋友说,我喜欢用豆包去查找东西,问豆包已经成为了本能,而且效果也不错,现在它也把这个能力开放给企业和开发者,那我们可以在自己的 Agents 上去调用这个豆包搜索。我现在用的比较多的就是「豆包搜索」来提供的 Web Search 服务,免费够用。这篇文章刚好拿它为例,和你分享:
2「信源分级」及 AI 搜索实战横评(对比 Tavily 效果如何)
供你选择,为自己的 Agent 选择一个好用的 Web Search 服务。
搜索的对象,悄悄从人换成了 AgentFROM HUMAN TO AGENT · 搜索对象之变
要回答这个问题,我们先来看看搜索这门生意的变化历程。过去它服务的是人:敲几个词,挨个挨个搜索结果,自己判断真伪。AI 搜索往前走一步,直接给人一个综合答案。可 Agent 接到的压根不是单个问题:「研究一家公司」「核查一篇文章」这种活,它得自己拆问题、把问题改写成若干个关键词去查,再一轮轮搜索、筛选信息源、再整合。
— Agent 的搜索:拆问题、改写关键词、多轮搜索与整合
要说找得到、读得全,现在确实有人做得挺漂亮。可有个问题始终没人答:搜回来的这一堆,到底哪条能信?通用搜索眼里,网页不分高低:一份公司公告和一篇公众号,分量差不多。更麻烦的是,这堆原料还在加速变质:如今互联网上充斥着 AI 生成的垃圾信息和洗稿文,通用搜索稍不留神就会把 Agent 带进沟里。
— AI 生成的垃圾信息与洗稿文,正让搜索原料加速变质
最近注意到豆包搜索,就是因为火山引擎把它定位成「为 Agent 构建的信息获取引擎」。用人话说:它不仅是个搜索引擎,还是个信息质检员。它搜回来的每条结果,都标好了发布时间和确定信息源,甚至还把信源分了等级:权威公告是一档,主流媒体是一档,XX 自媒体又是一档。
— 豆包搜索给每条结果标注发布时间与信源等级
巧了不是,给来源分等级这件事,去年那篇「AI 事实核查方法论」的文章就给大家讲过,整套办法就两张图:
— 去年「AI 事实核查方法论」里的信源分级思路
一级信源 · 结论锚点公司公告、监管披露、政府统计、权威学术期刊、国际组织数据和顶级机构正式报告。
二级信源 · 专业补充行业协会、知名咨询机构、主流媒体与专业出版物。核心数字仍要追到原始材料。
三级信源 · 线索池公众号、博客、论坛和社交媒体。适合发现争议,不能单独支撑结论。
四级信源 · 禁止进入底稿匿名爆料、无法追溯的「内部消息」、强广告内容和无证据判断。
— 信源四级分层:从一级结论锚点到四级禁入底稿
那会儿这套全凭自己一双手,点击一条、查看一条、判断一条,累得够呛。所以看到豆包搜索给来源分等级的思路竟跟我这套对上了,我一下就来了精神。
重做一遍调研:先看证据,再谈分析EVIDENCE FIRST · 证据优先
是骡子是马,拉出来遛遛为了测试这套方法到底顶不顶用,我拿「寒武纪」把整套调研重做了一遍。
演示环境:Claude Code + Doubao-Seed-Evolving 模型,大家也可以按需搭配。PS:Doubao-Seed-Evolving 模型是豆包 Seed 每周保持迭代的模型版本,1M 上下文。火山方舟的 Agent Plan 订阅用户,套餐内同时包含 Evolving 模型和豆包搜索 API 额度。
✦ 顺带一提豆包搜索每个账号每月提供500 次免费额度,个人使用绰绰有余。它支持 API、MCP 和官方 Skill 三种方式接入 Agent,本文是通过 MCP 的方式接入的。
— 豆包搜索支持 API、MCP、官方 Skill 三种方式接入 Agent
为了看清不同搜索源对 Agent 的影响,在同一条指令、同一家公司的前提下,我设计了三组对比实验:
第二遍 · 挂载 Tavily一款通用的 Agent 聚合搜索。
整个复现过程并不复杂。在火山引擎开通相关服务后,直接把帮助文档和 API key 喂给自己的 Agent 即可。豆包搜索的官方文档:console.volcengine.com/search-infinity/web-search-exp
— 开通服务后,把帮助文档和 API key 喂给 Agent 即可
你是一名上市公司基本面研究 Agent。请围绕寒武纪(688256),完成一份截至 2026-07-27 的公司研究事实底稿。> 本任务不预测股价,也不直接给出买卖建议。> 请先建立一套及时、权威、可追溯的事实基础。> 执行规则(共 8 条,摘 4 条):> 1. 先拆解研究问题,再调用搜索,不要直接生成结论。> 2. 信源优先级:公司公告年报和交易所披露 > 政府监管 和行业协会 > 权威数据库券商研究和主流财经媒体 > 其他网页。> 3. 每个关键 Fact 必须保留标题、发布日期、原始 URL、 检索日期和信源等级。> 4. 找不到可靠证据时,明确写「无法核实」,禁止根据常识补全。
— 把研究指令喂给 Agent,让它先建证据、再谈分析
— 经过数轮调研后给出的事实底稿结果
— 三组实验对照:不挂搜索 / 挂 Tavily / 挂豆包搜索
挂 Tavily极其自信地给出了错误答案:「字节是第一大客户、2024 年占近 80%」。它塞给 Agent 的全是自媒体的猜测文和转载稿,完全忽略了公司官方年报里压根没具名客户的事实。
挂豆包搜索结果完全不同。因为有「官方年报」作为一级信息源,AI 核对出官方未具名客户,第一大客户其实约占 26%。
— 豆包搜索以官方年报为一级信源,核对出第一大客户约占 26%
你想要的内容,豆包搜索都会给你进行信源验证,并且进行权威性分级。
— 每条结果都做信源验证与权威性分级
为了验证这不是偶然,我又换了天孚通信(300394)按照同样的方法跑了一遍:最能说明问题的是那条「6 月沟通会说 Q2 持平」的坊间传闻:
挂 Tavily它其实也搜到了公司否认的消息,但因为信源杂乱,大模型在生成答案时被自媒体带了节奏,竟然顺手引申成了「Q2 仍增长」。
挂豆包搜索它一路溯源,直接把深交所互动易上官方那句「端午假期并未开会」作为高优信源递了上来。Agent 拿到这记「实锤」后,果断在底稿里如实标了「传闻不实」。
— 天孚通信:深交所互动易官方回应成为高优信源,判定「传闻不实」
虽然 Tavily 找得其实也又快又全,连巨潮资讯网的年报原文都能扒出来。但是对于现在的 AI 搜索来说,它的使命就是给 Agent 这个精炼机提供高纯度的矿石。如今各家的差距早已不在于「能不能搜到」,而在于把海量信息捞回来之后,搜索能不能提前给信源排好座次,直接告诉你到底该信谁。
— AI 搜索的分水岭:能不能提前给信源排好座次
换个赛道,再遛一遍:世界杯决赛夜WORLD CUP NIGHT · 热点压力测试
投研只是我拿来讲道理的例子,这套核查流水线,放到全民吃瓜的热点事件上照样好使。比如刚踢完的 7 月 19 日世界杯决赛,西班牙对阵阿根廷。这种全民话题,官方通报、媒体报道和自媒体小道消息全搅和在一起,泥沙俱下,最考验搜索的成色。
— 世界杯决赛夜:官方通报、媒体报道与小道消息泥沙俱下
挂 Tavily答核心事实确实快——1 比 0 加时、托雷斯进球、大都会(MetLife)球场。可一到争议话题就露馅:前脚刚说金球奖是罗德里,后脚就把「赛事最佳」安给了梅西,左右互搏;甚至还把「FIFA 拒绝重赛请愿」写成了板上钉钉的定论,但其实官方压根还没理这茬。
挂豆包搜索比分、进球分钟、恩佐的红牌、80663 名观众、裁判名单……每条数据都挂着具体时点和一手出处。最绝的是,它像个判官一样把坊间传闻逐条过了堂:「决赛延期」被证伪、「梅西拿金靴」不实(实际是姆巴佩)、「裁判受贿」尚无确凿证据,而「6 万多球迷请愿重赛」确有其事。最打动我的是一个细节:在扒不到银球、铜球奖的一手信源时,Agent 老老实实地在底稿里标了一句「无法核实,建议不写」。
给不给得出细节是其次;给出的细节带不带出处、敢不敢认账,才是工具好坏的分水岭。
对了,这里再补充一句,豆包搜索分着「Global 版」和「Custom 版」,满足不同需求。Global版本:开箱即用的通用搜索,内置搜索规则无需额外配置,覆盖广;Custom版本是基于企业场景打造的规则版本,能够更好的适配企业复杂场景。
上述三个 case,我拿「豆包搜索」跟「Tavily」作对比,Tavily 就是只搜搜,不对新闻质量负责,豆包搜索的信源做的是真不错,质量也会更好,所以拿出来给大家分享。而如果提到价格,国外 Tavily 等,有月免费额度,但付费区间定价基本在 0.03 元/次以上。「豆包搜索」给了每人每月 500 次免费搜索,超额后单次定价 0.02 元/次……还有包月套餐模式,能低至 0.005 元/次(不过包月有日限额)。免费额度已经足够个人开发者的使用,字节大善人!
Agent 的「聪明」看模型,但它的「靠谱」只能看事实。
再强的模型,一旦被喂了带毒的原料,也只会以更系统的方式把错误无限放大。顺带交代一下这次的跑测环境:这几轮测试,我用的底层大模型都是Doubao-Seed-Evolving——这是豆包 Seed 系列里保持周更迭代的版本,1M 上下文,主攻 Coding 和 Agent 场景。
— 跑测底层模型:Doubao-Seed-Evolving,1M 上下文,主攻 Coding 与 Agent
想上手试试的同学,目前豆包搜索已经正式面向企业和开发者开放。配合火山引擎的 Agent Plan,基本可以一键把搜索和模型同时打包塞进你自己的 Agent。说了这么多,它最核心的价值其实就一句话:
在 AI 开口说话之前,逼着它先把事实找对,把出处留下,把不知道的盲区老实交代。
让搜索提供高纯度的矿石,把盲目信任变成有据可查,这才是 AI 搜索该有的样子。以上。
我是甲木,热衷于分享一些 AI 干货内容,同时也会分享 AI 在各行业的落地应用。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下期再见 👋
THANKS FOR READING