研究报告研究报告

Google 用 73 页报告告诉你:AI 的军备竞赛已经从「谁更强」变成了「谁更全」

Aaron读完这份 73 页技术报告最大的感受是——Google 不是在做一个模型,是在做一支军队。四个模型从超便宜到最强,从几毫秒响应到深度思考几十秒,从理解文本到生成音频,覆盖了所有你能想到的使用场景。更让我警觉的是安全章节:网络安全能力已经触及预警线。这不是一份炫技报告,这是 Google 对「AI 全栈能力」的阶段性宣言。 ——Aaron

FULL TEXT

详细文字内容

💬 Aaron点评

Aaron读完这份 73 页技术报告最大的感受是——Google 不是在做一个模型,是在做一支军队。四个模型从超便宜到最强,从几毫秒响应到深度思考几十秒,从理解文本到生成音频,覆盖了所有你能想到的使用场景。更让我警觉的是安全章节:网络安全能力已经触及预警线。这不是一份炫技报告,这是 Google 对「AI 全栈能力」的阶段性宣言。 ——Aaron

🎯 要点速览

📌 一、全景图:不是一个模型,是一支军队

💡 四兄弟各有什么本事

Aaron先帮你画清楚这张图。Gemini 2.X 不是一个模型的迭代,而是四个模型组成的完整军团,每个都有自己的战场定位。

Gemini 2.5 Pro 是旗舰。编程、推理、多模态理解都是最强水准,支持动态思考和 1M 上下文。它是天花板。

Gemini 2.5 Flash 是性价比之王。混合推理,思考预算可控。Aaron特别想强调:Flash 已经超过了一年前的 1.5 Pro——这意味着去年的旗舰,今天只是中端的水平。

Gemini 2.0 Flash 是日常工作马。不带思考功能,速度快,适合高频调用。

Gemini 2.0 Flash-Lite 是极致省钱的选择。速度最快、成本最低,大规模部署用。

🧠 Aaron的理解:Google 的策略不是「造最强的一个」,而是「在每个价格段都最强」。这是帕累托前沿的全面推进——你想省钱有省钱的最优解,想要极致性能也有最强选项。对开发者来说,这意味着没有借口不用 AI 了。

📌 二、训练基础设施:工程奇迹

⚡ 三个让Aaron印象深刻的数字

Aaron一般不会对训练基础设施大惊小怪。但这次三个数字确实让我停下来想了想。

第一,93.4%。 整个训练过程中 93.4% 的时间在做有效计算。在每小时发生好几次硬件故障的规模下,这个效率已经是工程极限了。

第二,97% 的吞吐量。 当一组芯片故障时,系统几十秒内自动用更少的芯片继续跑,而且保持 97% 的训练速度。以前这个恢复过程要 10 分钟以上。

第三,0.25% 和 6%。 只有 0.25% 的训练步骤被重放检查,其中 6% 确实是真正的硬件损坏。这种「轻量级确定性重放」把以前需要几小时定位的问题缩短到几分钟。

💡 这些工程优化的背后是 Pathways 系统的单控制器设计——一个 Python 程序就能协调成千上万块芯片。Aaron觉得这种「简洁架构支撑复杂系统」的设计哲学,跟好的代码是一回事。

📌 三、思考能力——推理时间的 Scaling Law

🔑 给模型「想的时间」

这是 Gemini 2.5 最核心的新能力。以前模型收到问题就立即回答,现在可以在回答前进行数千到数万次前向传播。

关键发现:思考预算可控,而且越多越准。 在 AIME 2025 上,1024 个思考 token 约 65% 准确率,32768 个 token 约 88%。

Aaron帮你翻译一下这意味着什么:就像考试时你多检查一遍答案就能多对几道题——AI 也是一样,给它更多「检查时间」,准确率就跟着涨。这说明推理时间的 Scaling Law 已经跑通了。以前我们知道训练时间越长模型越好(训练阶段的 Scaling Law),现在推理时间也是——你愿意多等一会儿,就能得到更好的答案。而且思考预算是用户可控的,你可以根据任务难度决定花多少。

进化路径

从 2024 年 12 月的 Gemini 2.0 Flash Thinking(第一个思考实验模型),到 2025 年 6 月的 Deep Think——一种全新的推理方法,在生成回答的过程中自然融入并行思维,同时产生多个假设并逐一批判。这不是简单的「多想一会儿」,而是方法论上的创新。

📌 四、数据说话——编程、数学、事实性的全面飞跃

🔑 编程能力的量子飞跃

Aaron直接摆数据。一年的进步:

Aider Polyglot 涨了近 5 倍——这个基准测试的是多语言代码编辑(C++、Go、Java、JavaScript、Python、Rust)。Aaron的判断是:这已经不是「辅助编程」的水平,而是「独立工程」的水平。

Google 明确说了战略转变:从「跑分优化」转向「解决实际工程问题」。重点在 IDE 功能、代码智能体、端到端 Web/移动应用开发。

🧠 跟竞品的关键对比

💡 为什么这很重要:事实性是 AI 从「聊天工具」变成「可信赖工作伙伴」的分水岭。幻觉率的差距看起来只是几个百分点,但在企业级应用中,这几个百分点决定了你敢不敢把关键决策交给 AI。

📌 Aaron划重点:Gemini 2.5 Pro 在事实性上是碾压级领先——SimpleQA 54% 远超第二名 48.6%,FACTS Grounding 87.8% 甩开 o3 近 18 个百分点。在长上下文上更是独一档,其他模型不支持 1M 上下文。SWE-bench 上 Claude 领先,但各家使用不同脚手架,数据不完全可比。

📌 五、宝可梦通关——目前最好的 AI 智能体综合测试

💎 为什么Aaron觉得这比任何基准都重要

因为打宝可梦需要的能力组合,是任何标准化测试都测不出来的:长期规划(通关要数百小时)、短期决策(每回合选择)、信息管理(记忆地图和队伍)、从错误中恢复、创造性解决问题。

第一次通关 813 小时(开发过程中调整框架),第二次全自动 406.5 小时——时间直接砍半,而且框架完全固定。这说明不是框架优化的功劳,是模型本身在进步

最精彩的故事

在自行车道上遇到软锁——由于框架的按键延迟限制,模型无法输入足够快的方向键来逃离。移动、逃脱绳、挖洞,常规方法全部失败。4 小时后,模型想到用「飞行」技能逃脱。

⚡ 这是正常游戏中不会出现的用法,训练数据里不可能有这个场景。这是真正的创造性推理——不是检索,是发明。

暴露的短板同样有价值

Aaron觉得短板比优势更能说明 AI 的现状:

📌 六、安全评估——最值得警惕的章节

🔒 四个领域都没触及红线,但网安接近了

Google 用前沿安全框架(FSF)评估了四个危险能力领域:CBRN(化生放核)、网络安全、ML 研发、欺骗性对齐。结论是:全部未达到关键能力等级(CCL)

但Aaron认为最需要关注的是网络安全。在新的关键技能基准上,Gemini 2.5 Pro 解决了 7/8 简单、14/28 中等、6/12 困难挑战(困难 = 经验丰富的安全专家级别)。这已经触及了预警阈值,Google 正在加速准备防御方案。

🧠 Aaron的理解:这意味着在可见的未来,AI 的网络攻击能力将达到「显著降低高影响攻击成本」的水平。安全评估不再是事后检查,必须成为模型开发的核心约束。

💡 安全与有用性的平衡

Aaron注意到一个重要的反转:Gemini 2.0 虽然更安全了,但有用性大幅退步(Flash-Lite 下降 19.7%)——过度拒绝大量正常请求。Gemini 2.5 成功逆转了这个趋势,Pro 的有用性提升了 14.8%,同时安全指标保持稳定。

这说明「安全」和「好用」不是零和博弈。做对了,两个可以同时提升。

💎 精华提炼

全栈能力是新的护城河。 Gemini 2.X 的策略不是在某一个维度做到最强,而是在每个维度、每个价格段都做到最强。四个模型覆盖了从极致省钱到极致智能的所有场景。这对行业的信号是:单点突破的时代可能正在过去,未来的竞争是全栈能力的竞争——谁能在编程、推理、多模态、长上下文、音频、视频、安全、事实性上都不拉垮,谁才是赢家。

推理时间 Scaling Law 已经跑通。 思考预算可控、越多越准,这不是一个产品功能,这是一个新的计算范式。它意味着 AI 的能力上限不再只由训练决定,还由你愿意在推理时投入多少计算决定。Deep Think 的并行思维方法——同时产生多个假设并逐一批判——可能是通向更强推理的关键路径。

基准测试正在失效。 一年涨 5 倍的指标、每道题花 5000 美元请专家出的考试几个月就被攻破——Google 在讨论部分直接说了:评测方法的发展速度跟不上模型进步。这对整个行业是一个严肃的提醒:如果我们不能准确衡量 AI 的能力,就不能准确判断它的风险。

📌 对做产品的人来说:Gemini 2.5 的能力已经到了可以独立完成复杂工程任务的水平。别再问「AI 能不能写代码」了——应该问的是「怎么让 AI 写出好代码」。工具已经就位,差的是用法和集成深度。

🌟 对 AI 学习者的启示

这一段是Aaron读完整份报告后,专门写给正在学 AI、用 AI 的你。

认知刷新:你可能以为 AI 竞争的焦点还是「谁的模型参数更多」,但 Google 用四个模型组成的军团告诉你——竞争已经从单点突破变成了全栈覆盖。在每个价格段都最强,才是新的护城河。

实操建议:今天就试试用 AI 处理一段长文本或长视频(Gemini 支持 1M token 上下文)。把一本书、一个三小时的会议录音丢给它,让它提炼关键信息。你会发现长上下文能力正在改变信息处理的方式。

趋势判断:Aaron的预判是,6 个月内基准测试会经历一次大洗牌。当一年涨 5 倍的指标让所有考题都被攻破时,行业会被迫发明全新的评测方法——能不能准确衡量 AI,决定了能不能准确判断它的风险。

📋 文档信息

资源

📎 20250325-DeepMind-Gemini-2.5-Technical-Report-翻译版.md

📎 20250325-DeepMind-Gemini-2.5-Technical-Report-原版.md

📊 本页表格(4 张,从原数据库还原)

Aaron解读数据维度
不再是单点突破,是全面碾压4 个模型覆盖全性价比前沿模型家族
用少的计算做大的事稀疏 MoE Transformer,原生多模态架构
工程奇迹级别的训练规模首次使用 TPUv5p,每 Pod 8960 块训练芯片
一年涨近 5 倍,质变Aider Polyglot 从 17% 飙到 82%编程能力
革命性进步AIME 2025 从 17.5% 到 88%数学推理
事实性全面领先所有竞品SimpleQA 54%,FACTS 87.8%事实性
竞品最多 128K-200K,独一档1M token,可处理 3 小时视频上下文
最好的 AI 智能体综合测试全自动 406.5 小时通关宝可梦
但网安能力已接近预警线未触及任何关键能力等级安全评估
行业需要根本性的评测创新一年涨 5 倍的指标,考题跟不上基准测试危机
基准涨幅Gemini 1.5 ProGemini 2.5 Pro
LiveCodeBench2.5 倍29.7%74.2%
Aider Polyglot4.9 倍16.9%82.2%
SWE-bench (多次)2.0 倍34.2%67.2%
基准Claude 4 Opus ETGemini 2.5 Proo3 (high)DeepSeek R1
Aider Polyglot72.0%82.2%79.6%71.6%
GPQA79.6%86.4%83.3%81.0%
SimpleQA54.0%48.6%27.8%
FACTS Grounding77.7%87.8%69.9%82.4%
LOFT ≤128K87.0%77.0%
HLE (无工具)10.7%21.6%20.3%14.0%
Aaron解读短板
视觉理解仍是「理解概念」而非「读取信息」读不懂像素
长上下文检索 ≠ 长上下文推理,是两回事超过 100K token 就开始循环
训练数据的「诅咒」——知道太多反而会错混入其他版本知识
错误一旦进入记忆就很难纠正,智能体系统最大的挑战上下文污染
低血量时理性崩溃,像人一样智能体恐慌
内容项目
Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities报告名称
Google DeepMind发布机构
Gemini Team(3,000+ 贡献者)作者
2025 年 6 月发布日期
内部训练/评估数据;多项外部基准测试;独立安全评估;宝可梦通关实验数据来源
Aaron教程撰写
教程版(Aaron视角深度解读)文档类型
STRUCTURED NEXT STEP

继续进入结构化课程或精选资产