630 行代码。1 块 GPU。
前特斯拉 AI 总监、OpenAI 创始成员 Andrej Karpathy,3 月初在 GitHub 上开源了一个项目。
叫 autoresearch。
你睡觉,AI agent 替你做实验。改代码,训练模型,检查结果。效果好的保留,没提升的回滚。连续跑一整夜。
两天,700 个实验。Autoresearch agent 找到了 20 个 Karpathy 自己都没发现的优化。模型训练速度快了 11%。
GitHub 5 万星。被网友称作「The Karpathy Loop」。

整个项目就三个核心文件。
prepare.py 负责数据准备,固定不动。
train.py 是完整的 GPT 模型训练代码,630 行左右,agent 唯一能改的就是它。
第三个文件
program.md,Markdown 格式,你用自然语言写研究策略,agent 照着执行。

Agent 可以是 Claude Code,可以是 Codex,只要能读代码、改代码就行。
它读指令,改代码,跑 5 分钟训练,检查一个叫 val_bpb 的指标,验证集上的比特/字节(val_bpb,bits per byte),越低越好。效果好了就 Git 提交,没改善就回滚,换个方向再来。
5 分钟一轮。一小时 12 个实验。睡一觉起来,100 个实验就跑完了。
Karpathy 在 README 开头写了一段话。
「曾几何时,前沿 AI 研究靠的是人类在吃饭、睡觉和开会的间隙里挤出来的。那个时代结束了。」

Karpathy 自己先测试了一轮。
一夜做了 126 个实验。验证损失从 0.9979 降到 0.9697。
然后让 agent 调一个更大的模型,连续两天。700 次修改,20 个有效改进。而且这些改进互不冲突,全部可以叠加。
比如 agent 发现 QK-Norm 的实现里漏了一个 scaler multiplier,导致注意力分布太分散,信号「糊」了。Karpathy 手动优化了那么久,自己都没注意到这个问题。

这 20 个改进迁移到更大的模型上依然有效。GPT-2 级别的训练时间从 2.02 小时降到 1.80 小时。
提升了 11%,还是在一个顶级 ML 研究员已经手动优化过的代码上。
Shopify CEO Tobias Lütke 看到后直接上手了。
他用公司内部数据,优化一个 8 亿参数的模型。一夜做了 37 个实验。
第二天醒来,性能直接提升了 19%。而且这个 8 亿的小模型,效果比它要替代的 16 亿大模型还好。
Lütke 后来更进一步,把同样的循环用到了 Shopify 开源的 Liquid 模板引擎上。ML 调参的思路,直接拿来优化代码。120 个自动实验,93 次提交。
解析渲染快了 53%,内存分配减少 61%。
这种自我循环,不挑领域。

SkyPilot 团队给 agent 接了一个 16 块 GPU 的集群,Claude Code 当 agent,跑了 8 小时。
910 个实验。
单 GPU 只能串行试错。16 块 GPU,agent 直接开始并行。一波同时跑 10 到 13 个实验,六种模型宽度一轮就全测完了。
val_bpb 从 1.003 降到 0.974。
agent 还自己琢磨出了资源调度,把 H200 留给最终验证,H100 用来快速初筛。没人教它,它从实验数据里自己学来的。
「The Karpathy Loop」核心就三样东西。一个 agent 能改的文件,一个客观可测的指标,一个固定的时间框。
满足这三个条件,任何领域都能套用。
比如数据库查询优化、RAG 调参、客服路由策略。
Karpathy 说:
「All LLM frontier labs will do this. It's the final boss battle.」
所有前沿实验室都会这么干。这是最终 Boss 战。
他聊到了下一步,多 agent 异步协作。
「目标不是模拟一个博士生,是模拟一整个博士生研究社区。」
造一群 agent,协作调优小模型,最优方案推到更大规模。人类在旁边参与就行。

autoresearch 不是「AI 训练 AI 自己」。
Agent 优化的是另一个更小更简单的模型训练代码,不是自身。Karpathy 自己也专门强调了这个区别。
也有人泼冷水。
Hacker News 上有网友评论,autoresearch 做的大部分改动,用贝叶斯优化可能更快。调整 batch size 和学习率,不需要大模型上场。
Karpathy 自己也承认了局限。现在只有 630 行代码、单 GPU、小模型。前沿大模型的代码库大了几个数量级,一次训练要上千块 GPU 跑几个月。
他又补充道。
「但这只是工程问题。而且一定能成。」
autoresearch 代码开源,MIT 协议。一块 NVIDIA GPU 加 Python 3.10,直接就能跑起来。
别纠结 AI 会不会替代研究员。
630 行代码,已经在重新定义 ML 工程师的日常了。
我是木易,Top2 + 美国 Top10 CS 硕,现在是 AI 产品经理。
关注「AI信息Gap」,让 AI 成为你的外挂。