让AI Agent 做真正会思考,有判断的深度调研,而不是会摆信息的汇总报告。一个即插即用的 skill 文件。
# Add to your Claude Code skills
git clone https://github.com/SeanEllyJames/deep-research-skillGuides for using ai agents skills like deep-research-skill.
deep-research-skill is an open-source ai agents skill for AI coding assistants such as Claude Code, Codex CLI, and ChatGPT, built by SeanEllyJames. 让AI Agent 做真正会思考,有判断的深度调研,而不是会摆信息的汇总报告。一个即插即用的 skill 文件。. It has 52 GitHub stars.
deep-research-skill's catalog security scan is still queued. You can run an instant dependency and prompt-injection check now with the "Scan for vulnerabilities" button above.
Clone the repository with "git clone https://github.com/SeanEllyJames/deep-research-skill" and add it to your Claude Code skills directory (see the Installation section above). deep-research-skill ships a SKILL.md manifest, so compatible agents can discover and load it automatically.
Yes. SkillsLLM lists many other AI Agents skills you can browse and compare side by side. Open the AI Agents category from the badge at the top of this page, or use the Related Skills and comparison links further down to weigh deep-research-skill against similar tools.
No comments yet. Be the first to share your thoughts!
Unlocks once the catalog security scan passes (runs nightly).
⚠️ Third-Party Software Notice
This skill is third-party open-source software developed and hosted independently on GitHub. SkillsLLM is an informational directory and does not control or maintain the underlying repository.
Any security checks, ratings, or warnings displayed by SkillsLLM are automated and limited in scope. They do not constitute a security certification or guarantee that the software is safe, error-free, or free from malicious code, vulnerabilities, compromised dependencies, or prompt-injection risks.
Review the source code, permissions, dependencies, and configuration before installing or running any third-party skill. Use is at your own risk. To the maximum extent permitted by applicable law, SkillsLLM is not liable for losses arising from third-party software.
The deep catalog scan for this skill is still queued. Run an instant dependency check now instead.
🚦 硬上限:任意时刻并行 subagent ≤7 个。 维度多就分批,不要抬高上限。子 agent 禁止再派子 agent——递归 fan-out 是最烧钱的失败模式(见错误 6)。如果你的平台自带一个 fan-out 到几十个 agent 的"deep research"模式,不要用它,用本流程做受控并行。
Wide Research(信息搬运):搜索多个来源 → 按主题分类摆放 → 输出 checklist。这是 LLM 的默认模式,产出的是"正确的废话"。
Deep Research(分析):精读一手源 → 提炼矛盾和张力 → 用分析框架产出独特判断。深度来自认知维度(你用什么框架看问题),不是信息维度(你覆盖了多少个角度)。
本 workflow 的目标是后者。
调研 subagent(Phase 1/2 的信息搜索、抓取、摘要)使用便宜/快速的模型。这类任务判断密度低、信息密度高,小模型质量持平且成本低得多。
主 agent 保持最强模型执行 Phase 0(元思考)、Phase 3(交叉验证)、Phase 4(写作)。这些步骤需要综合判断力。
所有搜索和网页抓取操作,无论主 agent 还是 subagent,遵循以下优先级:
目标: 质疑问题本身,定义"好答案"的标准,确定分析视角
Step 0a: 质疑问题。动手搜索之前,先回答三个问题:
Step 0b: 定义好答案的标准。明确写出这篇报告要满足什么条件才算"好",通常包括:
Step 0c: 框架选择与假设形成
输出: 分析框架、初始假设、"好答案的标准"(在内存中,用于指导后续 agent prompt 和最终报告自检)
目标: 找到 3-5 篇最重要的原始文献,提炼核心论点和矛盾
这一步的目标不是广度覆盖,而是对少数源文献的深度理解。
每个调研类 subagent 的 prompt 末尾必须附加的搜索工具指令:
## 搜索工具规则(硬性约束,违反即失败)
搜索和抓取必须优先使用专用搜索/抓取工具(搜索 MCP 或等价工具)。
只有首选工具不可用(连接失败或工具未加载)时才降级到 WebSearch/WebFetch。
降级时说明原因。
目标: 通过对比产生洞见,用广度搜索补充数据和反例
每个 subagent 的 prompt 必须包含:Phase 0 确定的分析框架和假设;明确的对比维度或反例搜索方向;要求返回 URL 和原文摘录(不是总结);不需要将结果写入文件,只需返回给主 agent。
目标: 从原始材料中构建论证链,发现矛盾,形成独特判断
写作原则:
格式要求:
重要: 只生成一个最终报告文件;撰写必须由主 agent 完成(sub-agent 缺乏整体论证的上下文);不保存中间结果。
必须保留 URL 的情况:直接引用他人原话或观点;任何数字/统计/评分;正面或负面评价的出处;产品/课程/公司的官方描述。
格式:
**来源描述**(URL)
> 原文摘录
避免:"有人评价说..."(没有 URL)、"网上有文章批评..."(没有 URL)、只总结不引用原文(无法验证)。
以下是实际执行中反复犯的错误。每次启动调研前,先检查自己有没有在犯这些错。
最常见、最致命。跳过元思考意味着 subagent 在没有假设引导的情况下做广度搜索,返回的是信息碎片而非论证素材。正确做法:主 agent 先独立思考,写出假设和"好答案标准",然后带着这些假设去设计 subagent 的 prompt。
检测信号:如果你的 subagent prompt 里没有包含"假设"或"待验证的论点",说明你跳过了 Phase 0。
subagent 返回的信息按搜索维度组织(功能、定价、用户评价),直接沿用这个结构写报告,产出的一定是主题分类式的信息汇总。正确做法:把 subagent 返回的所有信息打散,重新按论证链组织。报告的每一章推进一个论点,信息只是论点的证据。
检测信号:如果报告的章节标题可以直接用作搜索关键词("定价对比"、"功能对比"、"适合谁"),结构大概率是信息分类而非论证链。好的章节标题应该包含判断("能力趋同之后,竞争的新维度是什么")。
表格是速查工具,不是论证工具。如果一个洞见可以用表格传递,那它大概率不是真正的洞见。正确做法:表格只用于读者需要反复查阅的参考数据(定价、参数),论证部分全部用段落展开。
检测信号:如果删掉报告中所有表格和 bullet points 之后,剩下的段落不能独立成文,说明思考量不够。
"A 适合 X 人群,B 适合 Y 人群"这种结论任何人都能说,不需要调研就知道。报告的价值在于给出读者此前没有的判断,这意味着结论必须有被反驳的可能性。
检测信号:把你的核心结论发到一个相关领域的专业群里,如果没有人会出来反驳或讨论,这个结论太安全了。
覆盖 10 个维度每个维度 3 句话,不如深入 3 个维度每个维度 3 段论证。深度来自认知维度(你用什么框架看问题),不是信息维度(你覆盖了多少个角度)。
检测信号:如果报告超过 5000 字但核心论点可以用 3 句话总结,大概率是广度过多、深度不足。
一次真实事故:主 agent 派 3 个 agent → 这 3 个拆成 13 个 → 13 个拆成 50+ → 最终 149 个 agent,一笔意外的 API 账单。子 agent 拿到宽泛的研究命题后,会自然地继续拆维度、继续派 agent,形成递归爆炸。
检测信号:如果你发现自己在给子 agent 的 prompt 里写了"你可以用 Agent 工具进一步搜索"之类的话,stop。马上要炸。
正确做法:
如果有 3 条以上不通过,报告需要重写核心论证部分。
| 陷阱 | 对策 |
|---|---|
| 只搜到正面信息 | 专门搜索 "criticism", "negative review", "scam", "overpriced" |
| 信息来源单一 | 强制要求 subagent 找多个独立来源 |
| 过度总结丢失细节 | 要求保留原文摘录,不只是总结 |
| 维度划分太干净没有 overlap | 设计维度时故意让边缘模糊 |
| Subagent 返回的信息太浅 | 在 prompt 中强调"深度"、"具体"、"原文" |
| 中间文件堆积 | 只生成一个最终报告,不保存中间结果 |
| 跳过 Phase 0 | 主 agent 必须先写出假设和"好答案标准"再派 subagent |
| subagent 结构 = 报告结构 | 打散 subagent 返回结果,按论证链重组 |
| 表格驱动代替思考驱动 | 表格只放参考数据,论证全用段落 |
| 子 agent 递归派 agent | 子 agent prompt 里禁止使用 Agent 工具;平台层硬限流每会话派发次数 |
逼 AI Agent 做「会下判断」的调研,而不是「会摆信息」的调研。
一个即插即用的 Markdown 文件 · 无需安装 · 粘进去就能用
市面上绝大多数所谓的「AI 深度调研」,本质是 Wide Research:并行搜一堆来源,按主题分好类,给你一份工整的 checklist。看起来很全,事实也没错,但没用——它只有目录,没有判断。
这个 skill 把 Agent 掰到另一条路上:Deep Research。精读一手源,把它们之间的矛盾挑出来,最后落到一个业内人真的会跟你争论的判断上。
| Wide Research(默认模式) | Deep Research(本 skill) | |
|---|---|---|
| 方法 | 搜多个来源 → 按主题分类 → 出 checklist | 精读少数一手源 → 提炼张力 → 论证出判断 |
| 结构 | 主题分类:市场 / 竞争 / 趋势 | 论证链:观察 → 分析 → 判断 → 局限 |
| 产出 | 「A 做了 X,B 做了 Y」 | 「A 和 B 从相反前提出发却收敛了,为什么」 |
| 深度来自 | 你覆盖了多少角度 | 你用哪个框架在看 |
| 读起来像 | 排版整齐的维基词条 | 真动过脑子的人写的备忘录 |
Wide Research 是 LLM 的出厂设置,产出的是「正确的废话」。这个 skill 就是一套护栏,把它从默认模式里拽出来。
一套四阶段工作流,以及比工作流更重要的东西:不让 Agent 跳过 Phase 0 的纪律。
Phase 0 元思考 — 绝不外包
一次搜索都还没发起,先拷问问题本身:为什么问这个?隐藏假设是什么?有没有一个「显而易见但其实不对」的标准答案,而这篇报告的全部价值就是说清它为什么不对?然后写下「好答案」该长什么样:核心论点摆到一屋子业内人面前得能吵起来,而不是集体点头。
Phase 1 一手源精读
找到那 3 到 5 篇真正的原始文献(财报、创始人自己写的博文、电话会议逐字稿、论文原文),完整读完。二手总结每转一手,洞见就蒸发一层。
Phase 2 对比与反例
选 2 到 3 个案例做深度对比,专门去挖失败案例和批评声音。收敛本身是发现,分歧背后的原因是更大的发现。
Phase 3 交叉验证
多源印证的可信,单源的标注存疑,互相矛盾的——这才是最有意思的地方,去分析这个矛盾意味着什么。
Phase 4 把论证写出来
段落优先于表格,每一章只推进一个论点,诚实标注不知道的部分。最后一道自检:如果核心结论放到业内不会引发任何争论,重写。
这个文件最值钱的部分是「翻车目录」:把 Agent 最容易走的捷径一条条写下来,每条都配一个检测信号,让你(或 Agent)当场判断是不是正在犯。
1 · 跳过 Phase 0 直接搜 没有假设引导,subagent 返回的是信息碎片,不是论证素材。
检测信号:subagent 的 prompt 里没有「假设」或「待验证的论点」。
2 · 拿 subagent 的返回结构当报告骨架 你会得到一个伪装成分析的主题目录。
检测信号:章节标题拿去当搜索关键词刚好合适(「定价对比」「适合谁」)——那是文件柜,不是论证。
3 · 用表格和 bullet 替代思考 一个洞见如果能塞进表格,它大概率不是洞见。
检测信号:删掉所有表格和 bullet 后,剩下的段落撑不起一篇文章。
4 · 结论太安全 「A 适合新手,B 适合老手」这种话不用调研就能说。
检测信号:核心结论发到专业群里,没人会出来反驳或讨论。
5 · 把「全面」当「深度」 10 个维度各 3 句,输给 3 个维度各 3 段。
检测信号:报告过万字,但核心论点三句话就能说完。
6 · 子 agent 递归 fan-out 一次真实事故就是这条规则的由来:主 agent 派 3 个 → 变 13 个 → 变 50+ → 最终 149 个 agent,一笔意外的 API 账单。
检测信号:你在给子 agent 的 prompt 里写了「你可以用 Agent 工具进一步搜索」。停,马上要炸。
1. 把 SKILL.md 放进 Agent 的 skills 目录,或直接粘进系统提示词 / 项目指令
2. 要做正经报告时,让 Agent「按深度调研 skill 来」处理你的题目
3. 看着它在搜索之前先停下来做 Phase 0 —— 那个停顿,就是全部意义所在
任何能读 skill 文件、能派 subagent 的 Agent 都能用(Claude Code、Cursor、Cline 等)。搜索那一步默认你手上有一个搜索 / 抓取工具(比如 Tavily 这类搜索 MCP,或 Agent 自带的联网搜索),有什么用什么,skill 会自动降级适配。
SKILL.mdSKILL.en.md因为它是对着一堆真实的翻车记录写出来的,不是在书房里空想的。文件里每一条反模式,都是真实调研过程中犯过、并且烧钱或丢脸到值得为它立一条规矩的错误。那个 149 个 agent 的失控故事是真的,「你的章节标题就是搜索关键词」那个信号也是真的。这是踩过的坑结成的疤,写成了提示词。
部分脱胎自 grapeot/context-infrastructure(MIT),核心框架与内容为本人原创扩展。 以 MIT License 发布