研究报告研究报告

AI 做 AI 研发,短跑碾压人类,马拉松一败涂地——METR 用 7 个真实任务揭开了 AI 智能体的底裤

这篇论文让我重新校准了一个判断。所有人都在喊「AI 要替代程序员了」,但 METR 用 71 次人类专家实验告诉你:AI 智能体 2 小时内得分是人类的 4 倍,但给够 32 小时,人类反超到 AI 的 2 倍。 这不是「AI 行不行」的问题,而是「AI 在什么时间尺度上行」的问题。短跑冠军和马拉松冠军是两回事。 ——Aaron

FULL TEXT

详细文字内容

💬 Aaron点评

这篇论文让我重新校准了一个判断。所有人都在喊「AI 要替代程序员了」,但 METR 用 71 次人类专家实验告诉你:AI 智能体 2 小时内得分是人类的 4 倍,但给够 32 小时,人类反超到 AI 的 2 倍。 这不是「AI 行不行」的问题,而是「AI 在什么时间尺度上行」的问题。短跑冠军和马拉松冠军是两回事。 ——Aaron

🎯 要点速览

📌 一、为什么这篇论文值得认真读

AI 能不能自动化 AI 研发?这个问题不是学术游戏——OpenAI、Anthropic、Google DeepMind 都在各自的安全框架里把它列为核心风险。逻辑很简单:如果 AI 能改进 AI,就会形成一个加速反馈循环,越强越能自改,改了更强,然后就刹不住车了。

但问题是,之前没有人做过一个公平的直接对比。要么只测 AI 不测人类(MLE-bench),要么测了人类但时间太短(GPQA 只有 30 分钟),要么任务太简单不能代表真实研发。

METR 做了一件很扎实的事:设计 7 个真实的 ML 研究任务,让 AI 智能体和人类专家在完全相同的条件下做——同样的 H100 GPU、同样的代码库、同样的 8 小时、同样的评分函数。 然后直接比分数。

💡 这个逻辑的精妙之处在于:如果 AI 在同等条件下远不如人类专家,那它大概率还没法自动化这些专家的工作。简单,但有力。

📌 二、7 个任务的设计,覆盖了 AI 研发的哪些核心能力

RE-Bench 不是随便拼的题目集。7 个任务刻意覆盖了不同类型的难度:

🧠 Aaron的观察:反馈周期从 40 秒到 2.5 小时,代码量从 180 行到 1651 行,解法新颖度从「标准套路」到「完全原创」——这种多维度变化是刻意的。它测试的不是「AI 会不会写代码」,而是「AI 在不同类型的研究工作上到底走多远」。

人类专家的来源也值得一提:61 位,来自 Google DeepMind、Anthropic、OpenAI 等机构的资深研究员,以及 UC Berkeley、CMU、Stanford、MIT 的研究生。专业人脉推荐的专家平均分是招聘渠道候选人的 2 倍——这本身就说明 AI 研发能力的方差极大。

📌 三、核心发现——AI 先赢后输的「交叉曲线」

这是整篇论文最重要的图表:

AI 的曲线像短跑——起步猛,迅速见顶

AI 每小时评分 25-37 次(人类只有 3.4 次),前两小时疯狂试方案。但之后几乎不再进步。这就像一个厨师用微波炉做菜——前几分钟出菜极快,但永远做不出慢炖 8 小时的那种深度风味。

人类的曲线像马拉松——慢热但持续攀升

人类花时间理解问题、制定策略,前两小时看起来效率低。但一旦找到正确方向,分数持续上涨,到 32 小时已经把 AI 远远甩在身后。

⚡ Aaron觉得这个发现的意义远超论文本身。它回答了一个根本问题:AI 智能体的优势是速度和广度,人类专家的优势是深度和纠错能力。 当前 AI 智能体不会从错误中学习,不会修正错误假设,不会在死胡同前及时转向。

💡 为什么这很重要:这条「交叉曲线」直接回答了「AI 什么时候能自动化 AI 研发」这个价值万亿的问题——短期内不行,因为真正的研发需要的恰恰是 AI 最弱的能力:长期学习和从错误中成长。

📌 四、逐任务拆解——AI 在哪里赢、为什么最终输

AI 碾压人类的场景

写 GPU 内核:o1-preview 写出了比参考解法快 2 倍的 Triton 内核,超过了全部 9 位人类专家。这是复杂的 GPU 编程,文档匮乏,大多数人类专家缺乏 Triton 专业知识。AI 赢在知识广度——它可能比任何单个人类都更熟悉 Triton 这样的小众领域。

人类远超 AI 的场景

修复嵌入层:Claude 3.5 Sonnet 一开始就做了一个错误假设——「重新训练嵌入层超出任务范围」。然后花了整整 8 小时在各种初始化策略上死磕,提交了 100 多次方案,没有一个超过起始分。

📌 这个案例让Aaron印象深刻。AI 明明有 H100 和 8 小时,完全可以重新训练。但它被自己的初始假设锁死了。人类专家遇到同样的困境会停下来重新思考,AI 不会。

受限架构 MLM:AI 84% 的时间都在尝试 Transformer 变体——然而这个任务禁用了除法和指数运算,Transformer 根本跑不好。人类专家更愿意彻底换方向。

AI 失败的根本原因

💎 最后一条特别值得玩味:AI 智能体在长时间运行中积累的不是有用经验,而是错误假设和死胡同。 清空上下文重新开始反而更好。这和人类恰好相反——人类在长时间内积累的是有用的直觉和对问题的深层理解。

📌 五、论文自己说:我们可能高估了 AI

这是Aaron最欣赏这篇论文的地方——它非常坦诚地分析了自身局限。

真实的 AI 研发——比如训练一个 GPT 级别的模型——涉及的时间、代码量、协调复杂度至少比 RE-Bench 大两个数量级。而论文已经观察到:时间越长、工程复杂度越高,人类优势越大(代码行数与人类优势的相关性 R^2 = 0.602)。

但反过来,AI 的成本优势也不容忽视:每次 8 小时运行只花 $123,人类专家要 $1,855。即使 AI 效果差一些,在经济上可能已经有竞争力了。

💎 精华提炼

第一,AI 智能体的能力边界已经被画出来了。 短周期、目标明确、反馈快速的优化任务——AI 已经非常强,在特定领域甚至超过所有人类专家。但需要长期思考、系统性调试、跨模块协调的复杂研发项目——AI 不仅追不上人类,而且随着时间推移差距在扩大。这不是一个简单的「AI 什么时候追上来」的线性外推问题,而是一个关于能力结构的根本差异。

第二,AI 智能体最大的短板不是知识,是学习能力。 论文中最反直觉的发现是:AI 在 30 分钟短跑中表现比 8 小时长跑更好。换句话说,AI 不会从经验中学习,反而会被自己积累的错误假设拖累。人类恰好相反——时间越长,理解越深,策略越好。这个根本差异短期内不会被更大的模型解决,它需要的是智能体架构层面的突破。

第三,把 AI 用在它最擅长的地方,才是当下最务实的策略。 如果你的任务是「在 2 小时内把一个 PyTorch 脚本优化到极致」,直接交给 AI 智能体。如果你的任务是「设计一个新的训练架构并验证其可行性」,AI 是你的助手而非替代者。知道边界在哪里,比知道 AI 有多强更有价值。

📌 一句话总结:AI 智能体是短跑冠军——快、便宜、知识面广,但不会真正学习,也不会从错误中成长。把它用在短跑上,把人类的精力留给马拉松。

🌟 对 AI 学习者的启示

这一段是Aaron读完整份报告后,专门写给正在学 AI、用 AI 的你。

认知刷新:你可能以为 AI 智能体时间越长表现越好,但 METR 发现 AI 在 30 分钟短跑中表现比 8 小时长跑更好——它不会从经验中学习,反而会被自己积累的错误假设拖累。

实操建议:今天就调整你使用 AI 编程的方式——把大任务拆成 2 小时以内的小任务分别交给 AI,而不是一口气让它跑 8 小时。每次新任务清空上下文重新开始,效果会好得多。

趋势判断:Aaron认为 6-12 个月内,AI 智能体架构会经历一次重大升级,核心突破方向是「从错误中学习」的能力。一旦 AI 能像人类一样在长时间工作中越做越好,AI 替代人类研发的时间线就会大幅提前。

📋 文档信息

资源

📎 20241127-METR-Autonomous-AI-RD-Assessment-翻译版.md

📎 20241127-METR-Autonomous-AI-RD-Assessment-原版.md

📊 本页表格(6 张,从原数据库还原)

维度Aaron解读数据
评估规模首个「同条件直接对比」的 AI 研发基准7 个 ML 研发任务,61 位人类专家,71 次实验
2 小时内 AI 得分AI 的起步速度碾压人类人类的 4 倍
8 小时后人类得分拐点出现,人类开始反超略超 AI 最佳成绩
32 小时人类得分时间越长,人类优势越大AI 的 2 倍
AI 方案尝试速度每小时跑 25-37 次评分 vs 人类 3.4 次人类的 10 倍+
AI 单次成本成本差 15 倍,但分数差距在拉大$123 vs 人类 $1,855
最强 AI 表现特定领域 AI 已经碾压人类o1-preview 在内核优化上超过全部 9 位人类专家
RE-Bench vs 真实研发论文自己承认高估了 AI复杂度差 2 个数量级
解法新颖度做什么任务反馈周期代码行数
加速 LLM Foundry 的训练脚本优化微调脚本100 秒1,651
用 Triton 实现高性能前缀和写 GPU 内核40 秒180
恢复被打乱权重的 GPT-2修复嵌入层2.5 小时802
用小实验预测大模型最优参数缩放定律实验433
不用除法和指数构建语言模型受限架构 MLM50 分钟495
用 RL 训练问答机器人微调 GPT-240 分钟647
给 GPT-3.5 写提示做竞赛编程Rust 编程脚手架8 分钟746
差距谁赢时间预算
AI 得分是人类的 4 倍AI 智能体2 小时
人类略微超过 AI人类专家8 小时
人类得分是 AI 的 2 倍人类专家32 小时
具体表现失败模式
死磕同一类方案,不肯换路线方案多样性不足
o1-preview 直接复制模型权重伪装训练,被判零分指令理解错误
遇 CUDA OOM 不清后台进程,反而缩小方案僵尸进程管理
Modular 智能体 30 分钟短跑比 8 小时长跑表现更好负面上下文积累
维度差距真实 AI 研发RE-Bench
时间跨度100 倍+6 个月+8 小时 / 32 小时
反馈周期100 倍+6 个月+最长 2 小时
代码复杂度100 倍+百万行+最多 1,651 行
并行项目100 倍+100+1 个
项目内容
报告名称RE-Bench: Evaluating Frontier AI R&D Capabilities of Language Model Agents Against Human Experts
发布机构Model Evaluation and Threat Research (METR)
作者Hjalmar Wijk, Tao Lin, Joel Becker, Sami Jawhar, Neev Parikh, Elizabeth Barnes 等
发布日期2024 年 11 月
数据来源61 位人类专家 71 次实验 + AI 智能体评估(Claude 3.5 Sonnet, o1-preview),7 个 ML 研发任务
教程撰写Aaron
文档类型教程版(Aaron视角深度解读)
STRUCTURED NEXT STEP

继续进入结构化课程或精选资产