让 Claude 像博士一样做研究
斯坦福的 STORM 如何将一个主题变成一篇有引用、多视角的简报,以及如何在 Claude 中运行它。
AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
把"研究"拆解到本质,其中并没有什么神秘之处。
优秀的研究者不会只问一个问题。他们会从多个角度审视同一个话题。
实践者想知道它能否经受住未来几个月或几年的考验。怀疑论者在寻找可能出错的地方。经济学家关注资金流向。历史学家追问我们是如何走到这一步的,因为这些工具有其历史。
每个角度都会揭示其他角度看不到的问题。问问你的团队是否应该把编码工作交给 AI Agent,生活在 Cursor 中的工程师和实际测量过它的怀疑论者,甚至不会问同一个问题。
然后他们追踪后续问题。他们将每一个主张都建立在可以明确引用的来源之上。他们会关注来源之间存在分歧的地方,因为分歧正是真正洞察力所在之处。
单次提示词做不到这些。它将每个角度折叠成一个平均化的答案,然后平滑地交给你。
这就是方法:多个角度,每个都扎根于来源,保留分歧。

1、有人已经将这个方法封装成了产品
2024 年,斯坦福的一个团队发布了一个名为 STORM 的系统。该系统可以撰写长篇、有引用、维基百科级别的文章,主题是它从未见过的,而且输出质量经得起检验。
证据就在那里:NAACL 2024 论文,截至 2026 年中,约 29,000 个 GitHub 星标,超过 70,000 人运行过公开演示(均来自 stanford-oval/storm 仓库)。
重要的是 STORM 改变了工作发生的方式。
STORM 的工作方式分为三步,不包括底层机制:
首先,它发现视角。 在写一个字之前,STORM 会调查相关主题,弄清楚一篇好文章应该涵盖哪些角度。
然后它运行访谈。 每个视角都会采访一位专家——另一个语言模型,该模型必须基于实时网络搜索来回答,如果第一个答案单薄,还会追问后续问题。
然后它列提纲并撰写,附带引用,基于这些访谈浮现出的所有内容。
回过头来读,你就能看出其中的诀窍。魔法在于问题本身——从多人同时提问,扎根于真实来源,并带有后续追问。
STORM 并不是更努力地研究。它像一个专家小组一样研究。
拿本文开头的 AI 编程问题来说。将这个方法指向它,仅第一步就值回票价。在任何搜索之前,它会决定谁应该在房间里:
- 工程师——每天用 Cursor 交付代码:它真的节省了时间,还是只是感觉如此?
- 怀疑论者——它在哪些方面会让事情变得更糟,却没人注意到?
- 经济学家——除了 token 费用,审查和清理的成本是多少?
- 历史学家——我们以前也被"开发者生产力"忽悠过。那些工具后来怎样了?
- 团队负责人——初级开发者是否提速了,而高级开发者却变慢了?
- 安全审查员——更多代码,更快交付。影响范围有多大?
六个问题,没有一个是"列出优缺点"。你能感受到它们会发生碰撞。工程师和怀疑论者会在"更快"到底意味着什么上争论不休。
这种碰撞正是这个主题下任何值得一读的内容的脊梁。平均化的答案把它埋没了。专家小组让你直面它。
STORM 有真实的局限性,假装没有就是本文一直在反对的那种"平滑化"。它的输出读起来仍然平淡、百科全书式,和任何维基百科页面一样的干巴巴。
而且 STORM 不会自我批判。它不会告诉你哪个主张最薄弱。记住这一点。后面还会回来。

2、深度研究工具是引擎,不是方法
现在把 STORM 和那些著名的名字放在一起看:OpenAI 和 Gemini 的 Deep Research,以及开源的 GPT-Researcher。很容易把它们当作竞争对手来比较。但它们服务于不同的工作。
深度研究工具是引擎。它们被训练或配置为自主地在网络上挖掘:计划、搜索、阅读、循环、重复,直到覆盖所需内容。
但引擎是一个按钮,不是一种技术。
STORM 的构建方式恰恰相反。它是一种方法,可移植的,你可以阅读和引导的。 你可以在工具内部运行它,在提示词内部运行它,甚至在法律便笺本上用头脑运行它。
引擎在原始覆盖范围和速度上获胜,在截止日期紧迫时价值巨大。方法在结构和判断力上获胜。你两者都想要——引擎负责跑量,方法负责引导。

3、偷走这个方法,指向 Claude
按顺序手动运行这三个提示词,替换成你自己的主题。
第一,先获取视角。
"在研究 [主题] 之前,列出一个专家小组会带来的六个不同视角:实践者、怀疑论者、经济学家、历史学家、最终用户、监管者。为每个视角写出该视角最关心的一个问题。"
然后做引擎做不到的事。阅读这个列表并编辑它。删掉一个视角,添加它遗漏的那个——在任何搜索开始之前。这个编辑就是你判断力介入的地方,它承载了大部分价值。
第二,采访每个视角,扎根于事实。
"取视角 #X。提出它关于 [主题] 会提出的三个最尖锐的问题。搜索网络来回答每个问题,然后为每个答案提出一个后续问题并解决它。引用每一个主张。标记来源存在分歧的地方。"
第三,综合。
"从所有访谈中,为一个对该主题一无所知的聪明读者构建一个无冗余的提纲。用 [n] 个引用写出来。标记任何仅依赖单一来源的主张。"
差异不是微妙的。单次问 AI 编程问题,你会得到平均化的粘贴:
"AI 编程工具可以提高生产力,尽管结果因团队和环境而异。许多开发者报告工作流更快,而一些人面临学习曲线。"
正确,但没用。对同一个问题运行这三个提示词,视角访谈会带回你能握住的东西:
- 爱好者的证据:在一项受控的 GitHub 研究中,有 Copilot 的开发者完成编码任务的速度比没有时快约 55%。
- 怀疑论者的发现:当 METR 在大型成熟代码库上对有经验的开发者进行随机试验时,这些开发者使用 AI 后反而慢了 19%,而他们自己感觉快了 20%。
- 将一切串联起来的细节:大约 84% 的开发者现在使用这些工具,而不到三分之一的人信任输出结果。
4、可选升级:让它成为你自己的技能
把这个方法交给 Claude Code 或 Codex,让它把提示词变成一个可复用的技能。它会为你写一个 storm-research 技能,你可以通过名称在任何主题上触发它,而且你拥有它:可读、可编辑、无第三方依赖。
运行 storm-research ai coding agents,它会在第一步停下来:这是你的六个视角,在我花任何搜索之前,先删减或添加。 你删掉历史学家,添加一个需要向董事会汇报的 CTO,然后让它继续。十分钟后,你得到了一份基于你自己选择的专家小组的有引用简报。那三十秒的编辑就是租用和拥有之间的全部区别。

5、可选升级:安装预构建的插件
如果你不想费这些事,有人已经打包好了。社区 claude-storm 插件一行命令即可安装,将整个循环作为单个命令运行,无需克隆、无需 API 密钥,使用 Claude 自己的网络搜索和子代理。它运行完整的管道,并以自我同行评审结束。
一个诚实的说明:claude-storm 是社区项目,不是斯坦福发布的,而且还很年轻。这就是为什么手动版本排在第一位。方法是基础。插件是便利。
6、什么仍然是你的
方法自动化了研究的劳动。它没有自动化判断。
这里没有任何东西——无论是提示词、技能,还是背后运行的任何引擎——能告诉你哪个问题值得首先问,或者哪个发现对你面前的决策重要。它会就错误的主题采访六个视角,然后交给你一个有引用的答案,而这个问题你根本就不该问。
学位奖励的是问题品味,而不是阅读速度。 那部分无法外包。
改变的是你现在可以将整台机器指向你选择的问题,在几分钟内得到以前需要一周才能完成的东西。你得到了有观点的研究——那种你自己引导的研究。
原文链接:How to make Claude research like a PhD in minutes
汇智网翻译整理,转载请标明出处