首页
/ DeerFlow `academic-paper-review` 学术论文审稿技能全解:按顶会评审规范完成结构化论文评估

DeerFlow `academic-paper-review` 学术论文审稿技能全解:按顶会评审规范完成结构化论文评估

2026-09-07 09:59:43作者:俞予舒Fleming

本文以 DeerFlow 内置公开技能 academic-paper-review 的 SKILL.md 文档为骨架,系统讲解"如何让 Agent 对论文链接、上传的 PDF 或 preprint 执行接近人工同行评审水准的结构化审阅"。文章会先说明该技能在 DeerFlow 技能体系中的定位与触发方式,再完整展开它的三阶段评审方法论、可直接套用的审稿输出模板、审稿原则与质量自检清单,并结合 backend/packages/harness/deerflow/skills 下的源码说明技能元数据如何被模型发现、加载与执行,让你既能直接照单使用这套审稿工作流,也能理解它在 SuperAgent 技能系统中的底层机制。

一、技能定位:DeerFlow 公开技能集中的论文评审专家

academic-paper-review 是随 DeerFlow 发行、位于 skills/public/academic-paper-review/SKILL.mdPUBLIC(内置只读)技能,与 deep-researchsystematic-literature-reviewdata-analysis 等技能一同放在 skills/public 目录下。它面向需要"按学术规范评价一篇论文"的任务,产出结构化、可媲美同行评审质量的评估意见。

技能自身的 YAML frontmatter 定义了它的名称与描述,这决定了它的自动触发场景

---
name: academic-paper-review
description: Use this skill when the user requests to review, analyze, critique, or
  summarize academic papers, research articles, preprints, or scientific publications.
  Supports comprehensive structured reviews covering methodology assessment, contribution
  evaluation, literature positioning, and constructive feedback generation. Trigger on
  queries involving paper URLs, uploaded PDFs, arXiv links, or requests like "review
  this paper", "analyze this research", "summarize this study", or "write a peer review".
---

name 是该技能在 <skill_index> 中的唯一标识,description 则是对模型的"使用说明书"——它明确告诉模型:用户给出论文 URL(arXiv、DOI、会议/期刊链接)、上传论文 PDF、或提出"review this paper / analyze this research / summarize this study / write a peer review"类请求时,应当加载并使用本技能。

从 DeerFlow 的技能运行时实现来看,这套元数据并非摆设:

  • frontmatter.py 规定了 SKILL.md 头部的合法字段白名单(namedescriptionlicenseallowed-toolsargument-hintrequired-secrets 等),并负责把 YAML 与正文分离解析;
  • types.py 中的 Skill 数据类把 name/description/categorypublic 为只读内置)等建模为运行时对象;
  • describe.py 生成的 describe_skill 工具与 <skill_index> 提示段,让模型可以先看到技能名,再决定是否调用 read_file 加载完整 SKILL.md。

技能覆盖的核心能力

依据文档,该技能具备以下能力集合(每条都可在实际操作中落地为一次完整审稿):

  • 解析并理解来自上传 PDF 或抓取 URL 的学术论文;
  • 依据顶会审稿模板(NeurIPS、ICML、ACL、Nature、IEEE 等所采用的评审规范)生成结构化评审;
  • 评估方法学严谨性(实验设计、统计有效性、可复现性);
  • 评估贡献的新颖性与重要性;
  • 通过定向文献检索,将工作定位在更广的研究版图内;
  • 识别局限性、空白点与潜在改进方向;
  • 同时产出详细评审与精简的 executive summary 两种形式;
  • 支持任意科学领域(计算机、生物、物理、社会科学等)的论文。

何时应该使用该技能

文档中明确写着 Always load this skill when(以下任一条件满足即应加载):

  • 用户给出论文 URL(arXiv、DOI、会议论文集、期刊链接);
  • 用户上传研究论文或 preprint 的 PDF;
  • 用户要求 "review"、"analyze"、"critique"、"assess" 或 "summarize" 某篇研究论文;
  • 用户希望理解某研究的优势与不足;
  • 用户请求对学术工作进行同行评审风格的评估;
  • 用户希望为会议或期刊投稿准备评审意见。

技能在 DeerFlow 中的两种加载路径

describe.py 的系统提示可见,技能加载遵循"发现—描述—读取"链路:模型先在 <skill_index> 中看到 academic-paper-review 这个名字,调用 describe_skill("academic-paper-review") 获取元数据(描述、可用工具、SKILL.md 在沙箱中的路径),再通过 read_file 读取完整指令执行。

此外,DeerFlow 还支持 显式 slash 激活:以 /<skill-name> 开头发起请求时,运行时直接注入技能正文。slash.py^/([a-z0-9]+(?:-[a-z0-9]+)*) 解析命令名,并保留 bootstrapgoalhelp 等控制命令不与技能混淆。因此,你可以直接以 /academic-paper-review <论文链接或任务描述> 的形式快速唤起该技能。

二、审稿方法论:三阶段递进式评审流程

技能文档把一次严谨的学术评审组织为三个阶段:论文理解(Paper Comprehension)→ 批判性分析(Critical Analysis)→ 评审综合(Review Synthesis)。这是该技能的灵魂,任何审稿都必须先读透论文,再作判断,最后落到结构化输出。

Phase 1:论文理解 —— 在形成任何判断之前彻底读完论文

Step 1.1:识别论文元数据(Paper Metadata)

字段 说明
Title 完整论文标题
Authors 作者列表与所属机构
Venue / Status 发表venue、preprint 服务器或投稿状态
Year 发表或投稿年份
Domain 研究领域与子领域
Paper Type Empirical、Theoretical、Survey、Position、Systems 等类型

Step 1.2:系统性精读(Deep Reading Pass)

按以下顺序通读全篇,而不是只扫摘要:

  1. 摘要与引言——识别其声称的贡献与动机;
  2. 相关工作——注意作者如何相对已有工作定位自己的贡献;
  3. 方法论——深入理解所提出的方法、模型或框架;
  4. 实验 / 结果——检查数据集、基线、指标与报告的结果;
  5. 讨论与局限——记录作者自我指出的局限;
  6. 结论——把结论中的宣称与实际呈现的证据做比对。

Step 1.3:显式抽取核心论断(Key Claims Extraction)

把论文的主要论断逐条列出,并为每条标注证据与强度,防止"只凭印象评审":

Claim 1: [关于贡献或发现的特定论断]
Evidence: [论文中支持该论断的证据]
Strength: [Strong / Moderate / Weak]

Claim 2: [...]
...

Phase 2:批判性分析 —— 评估方法学、贡献与利弊

Step 2.1:文献版图检索(Literature Context Search)

用网络检索理解研究所在版图,文档给出可直接套用的检索 query 模板:

Search queries:
- "[paper topic] state of the art [current year]"
- "[key method name] comparison benchmark"
- "[authors] previous work [topic]"
- "[specific technique] limitations criticism"
- "survey [research area] recent advances"

随后对关键相关工作或综述使用 web_fetch(DeerFlow harness 中确实提供该类网络抓取能力,见 backend/packages/harness/deerflow/community/crawl4ai/tools.py 等社区工具模块)全文抓取阅读,而非只看摘要片段,以判断该工作在整个领域中的落点。

Step 2.2:方法学评估框架(Methodology Assessment)

评估准则 需要回答的问题 评分
Soundness(正确性) 方法技术上是否正确?是否存在逻辑漏洞? 1-5
Novelty(新颖性) 哪些是真正的新东西,哪些只是增量改进? 1-5
Reproducibility(可复现性) 细节是否足以复现?代码/数据是否公开? 1-5
Experimental Design(实验设计) 基线是否公平?消融实验是否充分?数据集是否恰当? 1-5
Statistical Rigor(统计严谨性) 结果是否统计显著?是否报告误差棒?是否多次运行? 1-5
Scalability(可扩展性) 方法能否扩展?是否讨论计算成本? 1-5

Step 2.3:贡献显著性分级(Contribution Significance Assessment)

级别 描述 判据
Landmark(里程碑式) 从根本上改变领域 新范式、被广泛应用的突破
Significant(显著) 强贡献,推进了 state of the art 有清晰改进与扎实证据
Moderate(中等) 有一定局限的有用贡献 增量但有效的改进
Marginal(边缘) 相对已有工作的最小推进 收益小、适用面窄
Below threshold(低于门槛) 未达到发表标准 存在根本性缺陷、证据不足

Step 2.4:优点与缺点分析(Strengths & Weaknesses Analysis)

对每一条优点或缺点,都必须给出结构化三段式:

  • What:具体的观察;
  • Where:论文中的章节/图表引用位置;
  • Why it matters:它如何影响论文论断或实用价值。

这一设计保证了评审意见"可定位、可复核",不会停留在空泛感受层面。

Phase 3:评审综合 —— 组装结构化评审

在完成理解与批判性分析之后,将上面所有阶段的结果填入下面的审稿输出模板,形成最终交付物。

三、审稿输出模板:可直接复制的同行评审格式

这是技能交付的核心产物。文档规定最终评审使用下面的 Markdown 模板组装(标题内 [Paper Title] 替换为真实论文标题):

# Paper Review: [Paper Title]

## Paper Metadata
- **Authors**: [Author list]
- **Venue**: [Publication venue or preprint server]
- **Year**: [Year]
- **Domain**: [Research field]
- **Paper Type**: [Empirical / Theoretical / Survey / Systems / Position]

## Executive Summary

[2-3 paragraph summary of the paper's core contribution, approach, and main findings.
State your overall assessment upfront: what the paper does well, where it falls short,
and whether the contribution is sufficient for the claimed venue/impact level.]

## Summary of Contributions

1. [First claimed contribution — one sentence]
2. [Second claimed contribution — one sentence]
3. [Additional contributions if any]

## Strengths

### S1: [Concise strength title]
[Detailed explanation with specific references to sections, figures, or tables in the paper.
Explain WHY this is a strength and its significance.]

### S2: [Concise strength title]
[...]

### S3: [Concise strength title]
[...]

## Weaknesses

### W1: [Concise weakness title]
[Detailed explanation with specific references. Explain the impact of this weakness on
the paper's claims. Suggest how it could be addressed.]

### W2: [Concise weakness title]
[...]

### W3: [Concise weakness title]
[...]

## Methodology Assessment

| Criterion | Rating (1-5) | Assessment |
|-----------|:---:|------------|
| Soundness | X | [Brief justification] |
| Novelty | X | [Brief justification] |
| Reproducibility | X | [Brief justification] |
| Experimental Design | X | [Brief justification] |
| Statistical Rigor | X | [Brief justification] |
| Scalability | X | [Brief justification] |

## Questions for the Authors

1. [Specific question that would clarify a concern or ambiguity]
2. [Question about methodology choices or alternative approaches]
3. [Question about generalizability or practical applicability]

## Minor Issues

- [Typos, formatting issues, unclear figures, notation inconsistencies]
- [Missing references that should be cited]
- [Suggestions for improved clarity]

## Literature Positioning

[How does this work relate to the current state of the art?
Are key related works cited? Are comparisons fair and comprehensive?
What important related work is missing?]

## Recommendations

**Overall Assessment**: [Accept / Weak Accept / Borderline / Weak Reject / Reject]

**Confidence**: [High / Medium / Low] — [Justification for confidence level]

**Contribution Level**: [Landmark / Significant / Moderate / Marginal / Below threshold]

### Actionable Suggestions for Improvement
1. [Specific, constructive suggestion]
2. [Specific, constructive suggestion]
3. [Specific, constructive suggestion]

注意模板中几个容易被忽略却关键的强制要求:Executive Summary 必须先给总评再展开细节(先说自己认为论文哪里做得好、哪里不足、贡献是否足以支撑所声称的 venue/影响力级别);每个 S/W 都要带论文内具体引用位置;Questions for the Authors 针对真实歧义而非修辞性诘难;末尾必须给出可执行的改进建议。

两种交付形态

文档同时强调该技能支持"深浅两档"输出:

  • 精简快评(brief assessment):用于快速 triage,判断某篇论文是否值得深入阅读或采用;
  • 完整评审(full review):用于投稿前的 peer review 准备。

具体选择取决于用户需求,但即便是快评,也遵循同一套评判框架,只是行文密度不同。

四、审稿原则:建设性、客观、合乎学术伦理

模板只是外壳,评审质量取决于三个贯穿始终的原则。

建设性批评(Constructive Criticism)

  • Always suggest how to fix it——不要只指出问题,要提出解决方案;
  • Give credit where due——即使在有缺陷的论文里,也要承认其真实贡献;
  • Be specific——引用确切的章节、公式、图表与表格;
  • Separate minor from major——区分致命缺陷与可修复问题。

客观性标准(Objectivity Standards)

文档用一正一反两个例子强调"具体可操作"与"空泛抱怨"的差别:

  • ❌ "This paper is poorly written"(含糊、无帮助)
  • ✅ "Section 3.2 introduces notation X without formal definition, making the proof in Theorem 1 difficult to follow. Consider adding a notation table after the problem formulation."(具体、可执行)

伦理审稿实践(Ethical Review Practices)

  • 不得因作者声誉或单位而否定其工作;
  • 只依据工作本身的价值进行评价;
  • 对潜在伦理关切(数据集偏见、双重用途影响)给出建设性提示;
  • 对未发表工作保密。

五、按论文类型的评审适配策略

不同类型的论文,评审关注点截然不同。文档给出的适配表是把方法论落地到具体论文类型的关键:

Paper Type(论文类型) Focus Areas(评审侧重)
Empirical(实证型) 实验设计、基线公平性、统计显著性、消融实验、可复现性
Theoretical(理论型) 证明正确性、假设合理性、界(bound)的紧致性、与实践的关联
Survey(综述型) 全面性、分类体系质量、近期工作的覆盖度、综合洞察
Systems(系统型) 架构决策、扩展性证据、真实部署、工程贡献
Position(立场型) 论证连贯性、论断的证据支撑、潜在影响力、对他人工作的刻画是否公允

六、评审中需要警惕的常见陷阱

文档明确列出了审稿人(无论人类还是 Agent)最常见的六类偏差,使用本技能时应主动规避:

  • ❌ 评审"你希望看到的那篇论文",而不是"实际提交的那篇论文";
  • ❌ 索要不合理范围之外的额外实验;
  • ❌ 因论文没有解决另一个不同的问题而扣分;
  • ❌ 写作质量过多影响对技术贡献的判断;
  • ❌ 把"没有与你自己的工作做比较"当作缺点;
  • ❌ 只提供摘要式复述而缺乏批判性分析。

这条清单与模板中的"Summary of Contributions"节形成呼应:贡献总结是基础,批判性分析才是评审价值所在。

七、交付前的质量检查清单

在最终定稿评审前,逐项核验(这是文档指定的收尾动作):

  • [ ] 论文被完整阅读(而不只是摘要和引言);
  • [ ] 所有主要论断都已被识别,并对照证据逐条评估;
  • [ ] 至少提供 3 条优点与 3 条缺点,且均带具体引用;
  • [ ] 方法学评估表完整,每项都有评分与理由;
  • [ ] Questions for the authors 针对真实歧义,而非修辞性诘难;
  • [ ] 已进行文献检索以将贡献置于语境中;
  • [ ] 建议是可执行且建设性的;
  • [ ] 总体结论与列出的优缺点保持一致;
  • [ ] 评审语气专业且尊重;
  • [ ] 次要问题与主要关切分开呈现。

八、评审产物输出与交付

技能文档对最终交付格式有硬性要求:

  • Markdown 格式输出完整评审;
  • 在沙箱环境中工作时,将评审保存到 /mnt/user-data/outputs/review-{paper-topic}.md
  • 使用 present_files 工具把评审文件展示给用户。

这与 DeerFlow 沙箱与文件呈现体系相契合:沙箱将技能挂载到固定的容器路径(默认 skills/{category}/<name>/SKILL.md,见 types.pyget_container_file_path),评审结果写回 /mnt/user-data/outputs/ 用户数据区,再由 present_files 类工具(harness 中确有对应实现,见 backend/packages/harness 下的工具与 backend/app/gateway/routers/thread_runs.py 等网关侧的产物承载)提交给用户查看。

九、技能的扩展协同与使用边界

文档在 Notes 部分给出几条重要的实操提示,让技能与 DeerFlow 生态衔接得更顺:

  1. deep-research 互补:当用户希望"在更广领域背景下评审论文"时,同时加载 deep-research 与本技能。前者负责多角度、多来源的深度网络调研,后者负责把调研对象(论文本身)按审稿标准结构化评判;
  2. 处理付费墙论文:对于无法完整获取的论文,基于可获得的内容开展工作(摘要、公开版本、preprint 镜像);
  3. 评审深度适配用户需求:快速 triage 用简评,投稿准备用全评;
  4. 多论文比较评审:对多篇论文进行对照评审时,所有论文必须保持一致的评审准则,避免标准漂移;
  5. 如实披露局限:在评审中说明自身盲区(例如"I could not verify the proofs in Appendix B in detail"),与文档要求的客观性标准保持一致。

此外,如果你需要"写综述 / 做系统文献综述"而非单篇评审,仓库内还提供了同族的 systematic-literature-review 技能,两者在使用场景上可视为姊妹技能——一个聚焦单篇深评,一个聚焦领域综述。

十、把技能落到 DeerFlow 运行时:一次完整评审的幕后调用链

最后,从源码视角把整条链闭合。当模型判定"需要审稿"并选中 academic-paper-review 时,实际发生的机制是:

  1. 索引可见:运行时在系统提示中渲染 <skill_index>(技能名清单)与 <skill_system> 提示段,见 describe.py
  2. 描述获取:模型调用 describe_skill("academic-paper-review"),得到包含 description、allowed tools 与容器内位置的回包(同一文件 describe.py,其 select: / 关键词 / +name 三种查询形式与 tool_search 对齐);
  3. 正文加载:模型按返回的位置用 read_file 读取完整 SKILL.md,获得上文全部方法论;
  4. 执行与交付:模型遵循 Phase 1-3 完成评审,按模板组装 Markdown,写入 /mnt/user-data/outputs/review-{paper-topic}.md 并调用 present_files 呈现。

而如果你以 /academic-paper-review 显式发起,则会走 slash.py 的解析与解析与白名单校验路径,技能正文被直接注入,无需模型自行发现——两种方式殊途同归,最终都执行同一套审稿工作流。

从技能格式源头看,frontmatter.py 负责把本文档开头那 4 行 YAML 从 Markdown 中剥离并校验为元数据字典,保证 name/description 能被可靠索引;这意味着你编辑任何自定义技能(放入 custom 类别)时,只要严格维护好 frontmatter 的字段格式与描述措辞,模型就能在同类触发场景中把它识别出来。

小结academic-paper-review 不是"摘要生成器",而是一套可执行、可复现、可审计的学术同行评审流水线。它用显式分阶段的阅读与批判分析约束 Agent 不跳步,用固定模板保证输出结构完整、章节之间彼此印证,用客观性/伦理/建设性原则把评审语气校准到专业水准。把它与 deep-researchsystematic-literature-review 组合使用,即可在 DeerFlow 中搭建从"领域调研 → 文献定位 → 单篇评审 → 综述产出"的完整科研辅助闭环。

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
33
18
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
1.14 K
2.75 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
857
1.35 K
docsdocs
暂无描述
Markdown
898
5.82 K
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
921
1.84 K
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.8 K
1.02 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
531
596
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
1.02 K
519
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.36 K
1.46 K
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
548
391