复现跑三天还卡着?斯坦福把论文变成能直接调用的 MCP 服务器:45 分钟 22 个工具,14 美元

复现跑三天还卡着?斯坦福把论文变成能直接调用的 MCP 服务器:45 分钟 22 个工具,14 美元

复现跑三天还卡着?斯坦福把论文变成能直接调用的 MCP 服务器:45 分钟 22 个工具,14 美元 封面

读论文最痛的,从来不是读不懂

说实话,读论文最痛苦的时刻,不是看不懂公式。是你看懂了,兴冲冲去跑代码,然后卡在第三天。

环境装不上。依赖互相打架。好不容易跑通了,输出的数字和论文表格对不上。你开始怀疑人生:是我操作错了,还是这篇论文本来就跑不出那个结果。

这事儿比想象中普遍得多。计算类论文的方法写得再漂亮,读者要真用起来,得先 clone 仓库、配环境、debug。这一步,把大量好方法直接锁死在 PDF 里。

论文是写给人类看的。Agent 要的是能跑的环境和可执行的例子。中间隔着一道墙。

先搞清楚:它和你见过的论文问答工具不是一回事

Paper2Agent 来自斯坦福大学 Jiacheng Miao(苗家铖)和 James Zou(邹婕)团队,2026 年 9 月 16 日发表在 Nature 上。预印本 2025 年 9 月就挂在了 arXiv,编号 2509.06917,共同作者还有 Joe R. Davis 和 Jonathan K. Pritchard。

它干的事很直接:把一篇论文、它的代码仓库和配套数据,自动转成一个 MCP 协议完全指南 里讲的那种 MCP 服务器。任何支持 MCP 的编码 Agent,Claude Code、Codex、Gemini CLI 都行,之后就能用自然语言调用这篇论文的方法。

这里要划个重点:能读论文和能跑论文,完全是两码事。NotebookLM 那种只会读文档的工具能帮你总结方法、列要点,但它回答不了这个问题:把这组参数在我的数据上跑一遍,结果是多少。Paper2Agent 交付的不是摘要,是一个能执行命令、返回真实结果的服务。作者把它比作虚拟通讯作者,我觉得这个比喻挺准。

六步流水线:一篇论文是怎么变成 MCP 服务器的

Paper2Agent 六步流水线:从代码仓库到可调用的 MCP 服务器
Paper2Agent 六步流水线:从代码仓库到可调用的 MCP 服务器

整个流程跑在 Claude Code 的 Agent SDK 上,一个总调度 Orchestrator 派活给一堆专门的子 Agent,六步走完:

  • 第 1 步,定位并下载代码仓库
  • 第 2 步,环境管理器建隔离虚拟环境
  • 第 3 步,教程扫描器索引可用教程
  • 第 4 步,教程执行器端到端跑一遍,记录参考输出
  • 第 5 步,工具提取器把教程转成带参数的 MCP 工具
  • 第 6 步,测试校验器验证工具,最后组装成一个 MCP 服务器

第 4 步是关键。它先把教程完整跑一遍,把输出存成标准答案,后面所有自动生成的工具都要拿来对答案。这一步设计得很聪明,它把一个模糊问题变成了可比的数值校验:什么算对,跑一遍就知道。

最终交付的服务器暴露三样东西。tools,把论文方法包装成可执行函数;resources,论文原文、代码链接、数据集和图;prompts,多步工作流,比如 Scanpy 正确的预处理顺序该是什么。熟悉 Smithery 这类 MCP 服务器聚合站的人一看就懂,这一层标准化意味着它能被整个 MCP 生态直接消费。

校验闸门才是它最硬的地方

说实话,前面六步别的团队也想得到。真正让我拍大腿的是它的校验闸门。

  • 工具必须产出预期文件,数值与参考输出的误差在 3% 以内才算通过
  • 图片用感知哈希比对,汉明距离必须小于 20
  • 每个函数最多给 6 次重试机会,反复失败的直接从最终服务器里剔除

最后一条最狠。它宁可少给你几个工具,也不给你一个会骗你的工具。说白了,这套机制承认了一件事:自动生成的科研代码,失败就是常态。

数据也确实这么说的。规模化测试里,100 篇 bioRxiv 计算生物学论文,只有 74 篇成功转成 Agent,提出的 599 个工具里有 593 个通过校验。约 26% 的论文没转成,这个失败率本身就是科研代码有多脆的直接证据。

跑得通的那部分,效率惊人。AlphaGenome 约 45 分钟建出 22 个工具,花掉约 14 美元,22 个全部一次通过校验,全程无人干预。Scanpy 约 45 分钟建出 7 个校验通过的工具,花费约 13 美元。

基准对比更能说明问题。5 次运行、2 位人类专家打分,评分者间一致率 96.7%:15 个教程衍生问题,Paper2Agent 98.7%,Claude+Repo 82.7%,Biomni 37.3%;15 个全新问题,Paper2Agent 100.0%,Claude+Repo 78.7%,Biomni 56.0%;30 个开放性问题,Paper2Agent 82.7%,Claude+Repo 56.7%,Biomni 72.2%。中位运行时间比 Claude+Repo 快 1.9 倍,比 Biomni 快 3.1 倍。

300 道题的更大样本里,Paper2Agent 91.2%,Claude+Repo 用 Sonnet 4 是 80.3%、用 Sonnet 4.6 是 86.3%。单题成本 0.20 美元、1.6 分钟,对比 0.38 美元、4.3 分钟。

它还真干出过科学发现。AlphaGenome Agent 复查一个 LDL 胆固醇变异位点 chr1:109274968:G>T,把 SORT1 排为最可能的致病基因,而原论文强调的是 CELSR2 和 PSRC1。GTEx 显示三个基因在肝脏都有显著 eQTL,这类位点的因果基因归属本来就极难。另一个例子更夸张,AlphaGenome、MPRA 耦合 scCRISPRi 筛选、CD4+ T 细胞 Perturb-seq 三个 Agent 联动分析一个银屑病相关位点,把 GPR137 排在最前。

实战:一句指令把 Scanpy 变成工具

先装 skill。手动装就是把 skill 文件夹拷进宿主目录:

git clone https://github.com/jmiao24/Paper2Agent.git
cd Paper2Agent
# Claude Code
mkdir -p "$HOME/.claude/skills/paper2agent"
cp -R skills/paper2agent/. "$HOME/.claude/skills/paper2agent/"
# Codex
mkdir -p "$HOME/.agents/skills/paper2agent"
cp -R skills/paper2agent/. "$HOME/.agents/skills/paper2agent/"

懒得动手,就直接让编码 Agent 自己装,提示词这么写:

Read https://github.com/jmiao24/Paper2Agent and install the paper2agent skill
from skills/paper2agent for this coding agent.

装完就能用。把 Scanpy 转成工具,一句话:

/paper2agent Convert https://github.com/scverse/scanpy into tested MCP tools in Scanpy_Agent.
Focus on the "Preprocessing and clustering" tutorial.

在 Codex 里把 /paper2agent 换成 $paper2agent,仅此而已。

碰到需要 API key 的论文,只告诉它环境变量名,别把密钥写进代码:

Read the API key from the environment variable ALPHAGENOME_API_KEY.

不想本地折腾也有现成的。Hugging Face 上已经托管了 AlphaGenome、Scanpy、TISSUE 三个远程 MCP:

claude mcp add --transport http alphagenome https://Paper2Agent-alphagenome-mcp.hf.space
claude mcp list

项目是 MIT 开源许可,仓库在 GitHub 的 jmiao24/Paper2Agent,9 月 17 日约 2778 star。托管版在 paper2agent.ai,团队全部应用跑在 Claude Sonnet 4 上。

它不完美:我也看到几个坑

编码 Agent 通过 MCP 直接调用论文方法,而不是读 PDF 猜
编码 Agent 通过 MCP 直接调用论文方法,而不是读 PDF 猜

坑 1:四分之一左右的论文转不出来。现象是跑到环境配置或教程执行那一步直接失败。根因是科研代码质量参差,README 缺失、依赖没锁版本、数据链接失效。解法是挑有完整教程和干净仓库的论文下手,别拿它去啃硬骨头。

坑 2:开放性问题准确率掉到 82.7%。现象是超出教程覆盖范围的问题,回答质量明显下降。根因是工具从教程里抽,教程没覆盖的方法就没有对应工具。解法是先看它生成了哪些 tools,再决定问什么。

坑 3:成本和时间不总是那么理想。45 分钟、14 美元是教程清晰的理想情况,教程混乱的仓库会反复重试,账单可能翻倍。解法是先用 HF 上托管好的三个练手,摸清节奏再说。

有个细节我愣了一下:打乱顺序的对照测试里,对超出论文范围的提问,它 100% 拒绝,不会硬答。就这一点,比很多工具强。

写在最后

回到开头那个场景。你花三天装环境,最后卡在一个对不上的数字上。

Paper2Agent 做的事情,本质是把复现这个动作从人的手上,交给了一套会自我校验的流水线。它不保证每篇论文都能转成功,74% 这个数字就摆在那。但它保证转出来的那个,是可以被信任的。

作者有个主张我很认同:期刊应该把可执行的 Agent 和论文、代码、数据一起发表。

论文的价值从来不在 PDF 里。在它被跑起来的那一刻。

关注圈圈,持续带你玩转 AI 工具。

© 版权声明
THE END
喜欢就支持一下吧
点赞134 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容