编程 三种开源自动科研 agent 的设计取舍:从 5 分钟单卡循环到 23 阶段流水线

2026-10-03 00:04:57

三种开源自动科研 agent 的设计取舍:从 5 分钟单卡循环到 23 阶段流水线

三个项目都叫「自动科研」,但动的东西完全不同:一个只让 agent 改 train.py,一个从假设一路写到 LaTeX,一个把人塞回流水线里当 gate。下面按项目拆事实,最后做取舍对照。

karpathy/autoresearch:5 分钟固定预算的单指标循环

仓库:https://github.com/karpathy/autoresearch

描述为「AI agents running research on single-GPU nanochat training automatically」,Python,MIT,2026-03 创建,约 9.7 万 stars。

思路是给 agent 一个真实但足够小的 LLM 训练环境,让它整夜自主实验:改代码 → 训练 5 分钟 → 看结果是否变好 → 保留或丢弃 → 重复。

核心只有三个文件:

  • prepare.py:固定常量、一次性数据准备(下载训练数据、训练 BPE tokenizer)、运行期工具(dataloader、evaluation)。不修改。
  • train.py:agent 唯一可编辑的文件,含完整 GPT 模型、优化器(Muon + AdamW)、训练循环。架构、超参、优化器、batch size 都可改。
  • program.md:给 agent 的基线指令,由人类编辑迭代,默认故意保持最简基线。

设计要点:

  • 训练固定跑 5 分钟 wall clock(不含启动/编译),与算力无关。
  • 指标 val_bpb(validation bits per byte),越低越好,与词表大小无关,便于跨架构公平比较。
  • 单文件可改,diff 可审。固定时间预算意味着约 12 实验/小时,睡一觉约 100 实验;代价是结果与其他算力平台不可比。
  • 自包含:除 PyTorch 和少量小包外无外部依赖,无分布式训练、无复杂配置。一块 GPU、一个文件、一个指标。

环境:单 NVIDIA GPU(测试于 H100),Python 3.10+,uv。

快速开始:

curl -LsSf https://astral.sh/uv/install.sh | sh
uv sync
uv run prepare.py        # 一次性,约 2 分钟
uv run train.py          # 单次实验约 5 分钟

跑 agent:在自己的仓库里起 Claude/Codex 等(关掉所有权限),提示让它读 program.md 开跑。

训练代码是 nanochat 的单 GPU 简化实现:https://github.com/karpathy/nanochat

其他平台(macOS/Windows/AMD)有社区 fork。作者自述背景:https://x.com/karpathy/status/2029701092347630069

v1:https://github.com/SakanaAI/AI-Scientist
v2:https://github.com/SakanaAI/AI-Scientist-v2

v1 是第一套较完整的全自动科学发现系统,让 LLM 独立做研究。提供三个模板(NanoGPT、2D Diffusion、Grokking)覆盖这些领域;社区可贡献模板但官方不维护。tree search 组件基于 AIDE:https://github.com/WecoAI/aideml

风险警告:该代码库会执行 LLM 写的代码,存在使用危险包、无控联网、spawn 进程等风险,须自行容器化并限制网络访问。

v2 是端到端 agentic 系统,生成假设、跑实验、分析数据、写论文。相比 v1 去掉对人类模板的依赖,跨 ML 领域泛化,采用 progressive agentic tree search,由 experiment manager agent 引导。用 VLM 反馈循环增强 AI 评审组件以改进内容与图表美学。评估上,向 ICLR workshop 提交三篇全自主生成论文,其中一篇得分超过平均人类接受门槛(团队出于学术伦理主动撤稿)。论文:arXiv:2504.08066

v2 官方取舍说明:v2 不一定比 v1 产出更好的论文,尤其已有强起点模板时;v1 走明确模板成功率高、产出稳,v2 更偏探索、成功率更低,适合开放式科研。

v2 流程:先生成研究想法(perform_ideation_temp_free.py,写一个含 Title/Keywords/TL;DR/Abstract 的 Markdown 主题文件,LLM 生成候选想法并调 Semantic Scholar/OpenAlex 检查新颖性,输出 JSON),再跑主流程(launch_scientist_bfts.py,BFTS 配置在 bfts_config.yaml)。

成本:主实验用 Claude 3.5 Sonnet 约 $15–20/次,写作阶段再加约 $5,ideation 几美元。CUDA OOM 的处理办法是在 ideation 提示文件里建议用更小的模型。

许可:The AI Scientist Source Code License(Responsible AI License 衍生),强制披露:论文须显著声明使用 AI。

aiming-lab/AutoResearchClaw:23 阶段 8 相位 + 引用校验 + HITL

仓库:https://github.com/aiming-lab/AutoResearchClaw

描述为「Fully autonomous & self-evolving research from idea to paper」,Python 3.11+,MIT,约 1.4 万 stars。论文:arXiv:2605.20025(AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration)。

一键流程:

pip install -e . && researchclaw setup && researchclaw init && researchclaw run --topic "Your research idea here" --auto-approve
# 或 Co-Pilot 模式
researchclaw run --topic "Your research idea here" --mode co-pilot

流水线是 23 阶段 8 相位:A 研究定界 → B 文献发现 → C 知识综合 → D 实验设计 → E 实验执行 → F 分析与决策 → G 论文写作 → H 收尾。其中 phase E 的 ITERATIVE_REFINE 自愈,phase F 的 RESULT_ANALYSIS 多 agent,RESEARCH_DECISION 做 PIVOT/REFINE 决策;gate 阶段(5/9/20)需人工批准或 --auto-approve,拒绝则回滚。

文献:多源(OpenAlex → Semantic Scholar → arXiv)真实论文,查询扩展、去重、熔断降级,无幻觉引用。4 层引用校验:arXiv ID → CrossRef/DataCite DOI → Semantic Scholar 标题匹配 → LLM 相关性打分,幻觉引用自动删除。

沙箱实验:AST 校验代码、不可变 harness、NaN/Inf 快速失败、自愈修复、迭代细化(最多 10 轮)、部分结果捕获;v0.2.0 起加固 Docker 沙箱并做网络策略感知执行。

HITL:v0.4.0 引入 6 种干预模式(full-auto / gate-only / checkpoint / step-by-step / co-pilot / custom),含 Idea Workshop、Baseline Navigator、Paper Co-Writer、SmartPause、成本护栏、pipeline 分支并行探索、CLI 命令 attach/status/approve/reject/guide。

跨平台:可在任意 ACP 兼容 agent 后端跑(Claude Code、Codex CLI、Copilot CLI、Gemini CLI、Kimi CLI),经 OpenClaw 桥接支持 Discord/Telegram/飞书/WeChat。可作 LLM provider: acp。

硬件:自动检测 GPU(NVIDIA CUDA / Apple MPS / CPU-only)并据此调整代码生成与实验规模。输出:paper_draft.md、paper.tex(NeurIPS/ICLR/ICML 模板)、references.bib、verification_report.json、charts/、reviews.md、deliverables/。

ARC-Bench:55 主题的开放式自主研究基准(ML 25、HEP 10、量子 10、生物 7、统计 3),HuggingFace:https://huggingface.co/datasets/AIMING-Lab-UNC/ARC-Bench

成本护栏:预算监控(50%/80%/100% 阈值告警),超过预算 pipeline 自动暂停。

三个系统的取舍对照

维度autoresearchAI ScientistAutoResearchClaw
目标单领域(LLM 训练)优化循环端到端论文生成,主打开放式探索端到端论文生成 + 多领域 + 人机协作
改动面agent 只改 train.py,人类改 program.mdv2 由树搜索自主生成与修改代码23 阶段自动生成代码,Docker 沙箱执行
指标/验收固定 5 分钟预算 + val_bpb,直接可比面向论文产出,靠评审面向论文产出,靠评审/一致性校验
成本与门槛单卡即可需多卡 GPU,$20+ 一次需 8G+ 显存

共同前提:三者都会执行 LLM 生成的代码,必须放进受控沙箱(容器 / microVM),并限制网络与凭据。

推荐文章

程序员茄子在线接单