我动手做这次测评的起因不算新鲜——年底要给团队整理一份AI Agent生态的调研报告,涉及开源框架、商业产品线、落地案例和最近三个月的动态变化。照以前的做法,这个任务足够让我在浏览器里开二十个标签页,连刷三天。这次我决定换一种方式:把市面上标着Deep Research、深度研究、Research Agent的工具挨个用一遍,看它们到底能不能把“搜索、阅读、归纳、溯源、成稿”这条链子一次性走通。
整个测试持续了一周多,前前后后替换了十几款产品,把免费额度、订阅档位、单轮时长、引用质量全都记录了一遍。这篇文章不是简单贴个榜单就完事,我会把筛选标准、横向实测结果、成本边界和踩坑经验都摊开来讲,希望能帮你省下我当初踩过的那些坑。
1. 先说清楚:为什么“Deep Research”不能等同于“多搜几轮网页”
1.1 判断一款工具是否真在做深度研究,我只看三个硬指标
市面上很多产品把“联网搜索”包装成深度研究,这是最大的认知误区。普通的AI搜索,本质上是“搜索关键词→拼接摘要”,它仍然是传统搜索引擎的用户体验,只是把你从点开十个网页变成了读一段话。而Deep Research类工具的核心差异,在于它把研究过程拆成了“规划—执行—验证—组织”四步,并且由Agent自主循环执行。
我在评估时只看三个硬指标,达不到就不放进榜单:
- 任务规划能力:能否在开始检索之前,自动拆解出子问题、确定检索方向、排列执行顺序。比如调研“AI在专利分析中的应用”,它应该先拆成专利数据源、主流模型方法、实际产品、法规边界等子模块,再分头去检索。
- 多源交叉验证:普通搜索找到一个答案就停,深度研究工具会从多个独立来源获取信息,并比较冲突结论。这一点决定报告有没有可信度。
- 落盘产物质量:最终是否交付结构化的研究报告,而不是一段信息密度很低的聊天回复。好的工具会生成带小标题、分章节、有出处的文档,甚至允许导出成Markdown或文档格式。
拿这三个指标去卡,很多号称“深度搜索”的产品立刻出局。它们更像“加强版问答”,没有规划,没有验证,更谈不上产出结构。
1.2 为什么值得花一整篇文章做对比
原因很现实:工具之间的差距大到足以影响你的工作效率,而且这个差距不是看厂商宣传就能分辨的。
同一个调研问题,我用某款大厂工具跑出来的是真正可以交给领导的报告,带引用、带反方观点、带数据表格;换另一款工具,输出可能就是七八段话拼起来的长文,没有参考文献,论点之间逻辑断裂。两者花的时间可能都差不多,但质量差着一个量级。
更关键的是,Deep Research不是一个“一个工具打天下”的品类。大厂的原生功能适合通用型调研,开源项目适合成本敏感和隐私敏感的团队,中文工具则在实际工作中对本地资料的理解明显更强。选错了方向,买再贵的订阅也白搭。所以我决定把它做成一篇文章,尽可能把不同定位的工具放在同一视角下比较,而不是像厂商发布会那样只夸自己。
2. 入围名单是怎么来的:筛选标准、淘汰逻辑、最终分类
2.1 我用来过滤工具的五条标准
市面上和深度研究沾边的工具实在太多,如果不设边界,榜单可以写到三十个。为了控制篇幅和可参考性,我定了五条硬性标准:
- 必须存在“多轮自主研究”机制,而不是简单的搜索增强回答问题。单轮搜索后直接给结果的一律排除。
- 输出需要是结构化报告,至少包含章节层次、核心结论和引用来源。只有聊天对话框式的输出不作考虑。
- 近一年内仍然活跃迭代。有些学术项目做完就停更了,虽然理念超前,但无法用于实际工作。
- 有可验证的公开渠道启动,无论网页端、App、API还是本地部署,至少普通人能接触到。
- 在真实调研任务中重复可用。有些工具第一次用惊艳,第二次就卡死或超时,稳定性不达标也不考虑。
五条标准执行下来,剔掉了一批“演示品”。最典型的是一些开源Demo,论文发了GitHub也开源了,但依赖环境配置复杂,跑通需要一整天,属于研究原型,不适合放进实际使用榜单。
2.2 最终入榜的十款工具
这份榜单最终分成了三个梯队:大厂原生、中文专用、开源学术。不是说大厂一定最好,而是在不同场景下各有各的长处。
第一梯队:大厂原生深度研究(OpenAI Deep Research、Gemini Deep Research、Perplexity Deep Research、NotebookLM深度研究模式)
这四个的共同点是背靠成熟的基座模型,有足够的推理能力做任务规划,同时接入了自家的搜索生态或文档生态。它们适合处理“从零开始、领域相对通用”的调研任务。
第二梯队:中文场景与信息聚合入口(秘塔AI搜索研究模式、Kimi探索版、纳米AI搜索)
这三款的主要场景是中国大陆互联网内容、中文论文、公众号、知乎等信源。它们对中文语义的理解明显比大厂原生工具更好,特别适合做本地市场、政策法规、行业动态类调研。
第三梯队:开源与本地化部署(斯坦福STORM、GPT Researcher、OpenDeepResearch)
这一档适合有技术能力、注重数据隐私、或者需要把研究能力集成到自己系统中的团队。它们不依赖厂商服务器,可以接自己的模型API,也能把检索范围限定在内部知识库。
2.3 三个梯队的定位差异,一张表看清
| 维度 | 大厂原生 | 中文聚合入口 | 开源本地化 |
|---|---|---|---|
| 强项 | 通用知识广、推理链路完整 | 中文内容理解、本土信源覆盖 | 数据私有化、可自由定制 |
| 弱项 | 海外信源为主,中文细节常出错 | 跨语言深度稍弱、生态较封闭 | 搭建成本高、交互体验粗糙 |
| 适合谁 | 技术研究、学术综述、行业报告 | 中国市场分析、中文文档整理 | 研发团队、数据敏感项目 |
| 启动成本 | 20美元级月费起 | 免费或百元级年费 | 服务器成本+模型API费用 |
3. 横评实测:同一个调研任务,十款工具的真实表现
3.1 测试任务的设计思路
为了让对比尽量公平,我设计了一个所有工具都必须完成的统一任务:“调研AI Agent在软件开发领域的应用现状与主要开源框架对比,给出结论性报告,附带至少十个独立引用来源,时间范围限定在最近六个月。”
这个任务有三个特点:第一,它是真实工作中最常见的调研类型,不是那种故意刁难工具的冷门话题;第二,它要求结论必须是时新的,能测试工具抓取近期信息的能力;第三,开源框架的对比天然涉及多信源交叉,如果一款工具只抓官网和新闻稿,产出的报告就会有明显偏向。
评分维度权重分配如下:报告结构完整度占20%,信息时效性占20%,引用质量和来源多样性占30%,结论可落地性占30%。每个维度按1到5分打分,最后加权。
3.2 大厂原生四款工具的实际表现
OpenAI Deep Research给出的报告是我见过最接近“研究员水准”的。它在开始输出前会在界面上展示“思考过程”,会拆出七个子任务:先定位框架清单,然后逐一看GitHub Star趋势、社区活跃度、各自的技术架构、许可证差异,甚至主动对比了同一生态内的竞争关系。最终报告有四千多字,分五章,每个论点都有出处,引用来源超过二十个,覆盖GitHub仓库、官方文档、技术博客和少数论文。缺点是耗时太长,单次运行在5到10分钟之间,期间不能关闭页面。
Gemini Deep Research的强项在于跨信源的组织能力。它的报告有侧边栏目录、核心摘要、背景说明、影响分析、争议点讨论,还能一键导出到Google Docs。在这次测试中,它选到了几篇英文技术社区的质量算高的分析贴,这点很难得。但它对GitHub的具体数据掌握不够细,框架的Star数据明显滞后于实际值,时效性上打了折扣。
Perplexity Deep Research给我的感觉是“效率优先”。同样是这个任务,它三分钟出头就可以交付,报告结构包括执行摘要、主要发现、分章节分析和参考列表。它的引用标注做得很细,每一段都有出处,适合快速生成初稿再人工补充。缺点是分析深度有限,更多是信息的有效整合,缺少独立的判断和洞察。
NotebookLM的深度研究玩法跟前面三个完全不一样。它可以先上传资料,比如我提前放入的几篇行业报告和技术文档,然后基于这些资料加联网搜索一起生成。它产出的报告对给定材料的依赖性很强,也正因此,在“基于内部资料的对外调研”场景下,它反而是最合适的选择。它还有一个杀手锏:能自动生成音频概览,适合通勤时听调研结果,这是独一份的使用体验。
3.3 中文聚合入口的表现
秘塔AI搜索的研究模式在国内工具里属于最能打的一档。测试中它呈现的搜索结果混排了官网、知乎、微信公众号和技术博客,来源类型很丰富。最后生成的报告用了表格来汇总各类框架的功能对比,这在中文工具里很少见。它的引用脚注在报告正文里直接标注,读者一眼能确认信息来源,这体验已经追平海外头部产品。最让我意外的是它对“最近六个月”这个时间约束的执行力,它能相对准确地在搜索时过滤旧内容,这在中文搜索里其实很难。
Kimi探索版的长处在于长上下文处理。它能一次性读取大量页面内容,最终的输出有一种“把几十篇文章消化成一篇综述”的感觉。但问题也出在这里:它的回答更像综述,缺少明确的观点和行动建议。如果你需要快速了解一个领域全貌,它很合适;如果要拿去做决策参考,还需要自己再提炼。
纳米AI搜索更侧重结果的聚合效率。它会先给我一个简短结论,再展开详细的报告内容,适合领导催得急的情况。它的搜索范围对国内信源覆盖不错,但海外技术社区的抓取深度一般。在这个任务里,它产出的框架对比内容明显偏少,更侧重“AI Agent在开发中的应用场景”这类泛内容。
3.4 开源与学术派的表现
斯坦福STORM在这场测试里是“理念最强,体验最原始”的代表。它的设计思路是:先通过预搜索生成大纲,再模拟不同视角的提问者向检索系统提问,最后整合出一篇长文。这个思路和商业化产品很接近,但它产出的报告受限于底层搜索引擎的质量,引用质量不稳定,有些来源是内容农场。对普通用户来说,我建议直接试用它的在线Demo就好,不必花时间去自己部署。
GPT Researcher严格说不是一个产品,而是一个编排框架。你把它部署好、接上模型API、配置好搜索接口之后,它会按“生成研究计划—逐个子任务执行—汇总所有发现—生成完整报告”四步走。这次测试中,我把它的子任务数量调到了6个,最终报告有结构也有引用。只是它跑在本地,速度受资源限制明显,一份报告跑了将近十五分钟,而且期间API费用也肉眼可见地增加。
OpenDeepResearch是一个偏学术味道的开源项目,定位是复刻商业Deep Research的流程,整个运行过程非常透明:规划、搜索、阅读、再规划、再搜索,直到信息饱和后生成报告。对于研究者来说,这种透明性极有价值,因为它能让人类实时介入纠正方向。但它绝不是普通用户能轻松上手的工具,安装配置需要一定的开发能力。
3.5 加权评分结果与我的解读
| 工具 | 结构 | 时效 | 引用 | 可落地 | 加权总分 |
|---|---|---|---|---|---|
| OpenAI Deep Research | 5 | 4 | 5 | 5 | 4.85 |
| Gemini Deep Research | 5 | 3 | 4 | 4 | 4.00 |
| Perplexity Deep Research | 4 | 4 | 4 | 3 | 3.70 |
| NotebookLM | 4 | 4 | 4 | 4 | 4.00 |
| 秘塔AI搜索 | 4 | 4 | 4 | 4 | 4.00 |
| Kimi探索版 | 3 | 4 | 3 | 3 | 3.20 |
| 纳米AI搜索 | 3 | 4 | 3 | 3 | 3.20 |
| 斯坦福STORM | 3 | 3 | 2 | 2 | 2.45 |
| GPT Researcher | 4 | 3 | 3 | 2 | 2.95 |
| OpenDeepResearch | 4 | 3 | 3 | 2 | 2.95 |
必须说明的是,这个分数只代表这个特定任务下的表现。笔记类工具和开源框架的适用场景本来就不同,分数低不代表产品不行,只说明它在“这类型任务”上优势不明显。比如STORM的学术设计如果换成“梳理某一领域三十年研究脉络”,分数会完全不同。
4. 成本、速度和实用边界:决定你日常使用频率的隐藏参数
4.1 不同档位的实际花费
深度研究工具的计费模式和普通AI聊天有本质区别。普通聊天可以按次计费,但深度研究一次要消耗大量搜索和推理资源,厂商要么限次数,要么单独设高价位档。在实际体验中,我把它们的成本大致归纳为三个档位:
| 档位 | 典型产品 | 大致费用 | 单轮时长 | 高频可用的程度 |
|---|---|---|---|---|
| 高价专业档 | OpenAI Deep Research | 20美元级以上订阅中有限次数 | 5-10分钟 | 每天几次,不适合高频 |
| 中价日常档 | Gemini、Perplexity、NotebookLM | 20美元级月订阅 | 2-5分钟 | 相对够用,需规划次数 |
| 免费/低价档 | 秘塔、Kimi、纳米搜索 | 免费额度或低价会员 | 1-5分钟 | 可以随便跑,但深度有限 |
| 开发自建档 | STORM、GPT Researcher、OpenDeepResearch | 服务器+模型API费用 | 视资源而定 | 完全掌控,但成本不低 |
一个容易被忽略的点是“时间成本”。OpenAI Deep Research单轮动辄十分钟,如果任务拆解得不够好,一次跑完发现方向错了,再改提示词重新跑,半小时就没了。而Perplexity虽然快,但结论深度不足,后续人工修改的时间也很可观。我在实际使用中总结出的一个规律是:如果是陌生领域的技术调研,宁可花十分钟等深度工具,也不要图快用轻量工具,因为后续要补的课更多。
4.2 订阅限制是最大的隐形坑
我在测试中发现,所有商业深度研究工具都对使用次数做了严格限制。OpenAI的深度研究按订阅档位给数量额度,用完之后当月不能再跑;Gemini也有短时间内的请求上限;Perplexity的深度研究同样卡次数。如果你把深度研究作为日常高频刚需,这些限制会直接卡脖子。
我的应对方案是组合使用:重要的、需要交付的深度报告用OpenAI Deep Research或Gemini跑;日常快速了解一个新话题用Perplexity或秘塔跑;等到付费额度快用完时,把轻量工具当主力,把额度留给最关键的任务。这种“高低搭配”的策略,比死磕一款工具实用得多。
4.3 踩过的三个值得提醒的坑
第一个坑是引用幻觉依然存在。不要因为Deep Research工具给出了引用编号就完全信任。我在测试中专门抽查了部分引用,发现GPT Researcher会生成不存在的论文标题,Gemini对GitHub数据的引用也有失真情况。所以每次拿到报告,我一定会抽查至少三个引用是否真实存在。
第二个坑是工具的自带信息截止时间不一致。同一个问题,不同工具给出的“近期动态”差别很大,有的能抓到上月发布的技术公告,有的只能搜到半年前的内容。如果你的调研对时效要求很高,需要多留一个心眼,在交报告前自己手动确认信息是否是最新的。
第三个坑是研究报告不代表可以直接投稿或直接汇报。我在初试阶段曾经把一份OpenAI Deep Research生成的行业报告整理后直接发给同事,结果被指出一个关键数据与行业共识存在偏差。深度研究工具适合做初稿和框架参考,它最大的价值是帮你节省前80%的资料收集时间,但最后20%的判断和校准必须由人来完成。
5. 普通人怎么选:按场景而不是按排名
5.1 四个典型场景的选型建议
如果你完全不知道从哪入手,这里是我总结的四套“懒人方案”,可以直接对号入座:
场景一:学术综述、技术趋势调研、行业全景分析首选OpenAI Deep Research,备选Gemini Deep Research。这两个工具的推理链路和信息组织能力目前仍是第一梯队,最适合从零散的原始信息中构建结构化认知。前提是你能接受较长的等待时间。
场景二:快速了解一个陌生概念或写文章初稿用Perplexity Deep Research就够了。三分钟出报告,引用清晰,信息密度足够。它的报告虽然不是深度分析的级别,但作为起点非常合适。
场景三:调研对象以中国大陆市场为主、信源集中在中文互联网使用秘塔AI搜索或Kimi探索版。它们对中文内容的抓取和理解深度明显优于海外工具,免费额度也比较大方,适合日常大量使用。
场景四:内容涉及公司内部资料和商业机密,不能上传到外部平台只能走开源路线。在GPT Researcher和OpenDeepResearch之间,我更推荐前者,它的文档更完善、社区更活跃、更容易二开。你需要自行配置模型API,数据不会出你的服务器。
5.2 关于“AI工具排行榜”的一点反思
做这个测试之前,我原本以为差距会集中在“谁更能搜”,结果发现头部工具之间的差距已经不在搜索环节,而在“判断”环节。同样是搜索引擎,为什么有的工具能主动过滤低质营销内容,有的工具会搬来一堆SEO垃圾?这与模型的推理能力直接相关,也与产品在Agent设计上的投入深度相关。所以排名前十的名单只是表面,真正值得关注的是各个工具在“判断力”上的取舍。
大厂原生工具倾向于把控制权交给用户,OpenAI会让用户看思考过程、可以中途修改计划;开源项目倾向于让用户直接干预每一步;中文工具倾向于在界面和易用性上做文章。这些差异不是简单的优劣之分,背后反映的是每个团队对“深度研究”这件事的不同理解和产品哲学。
5.3 最后分享一点我的个人使用心得
经过这一轮密集测试,我做了一个比较重要的调整:把“用哪款工具”从每周思考的问题变成了按任务分类的固定动作。我的原则是,重活累活交给大厂深度研究,日常轻量搜索交给中文工具,开源项目只在有定制需求时启用。这个搭配思路,比逢新产品就换、逢榜单就看的习惯节省了大量时间。
如果让我给新手一个最直接的起点,我建议从秘塔AI搜索和Perplexity这两个免费或低成本的工具先上手,用一周时间积累使用感觉后,再决定要不要升级到高价位档。工具永远在更新,榜单很快会过时,但你对“好报告应该长什么样”的判断力,才是真正不会被淘汰的东西。