详细文字内容
💬 Aaron点评
这份报告是Aaron近期读到的最具颠覆性的 AI 使用数据分析。a16z 和 OpenRouter 联手,用 100 万亿个 Token 的真实数据画出了一幅完全不同于行业叙事的画像。所有人都在说 AI 是生产力工具,但数据说:开源模型超过一半的使用量是角色扮演。 这份报告让你重新理解——人们真正想从 AI 那里得到什么。 ——Aaron
🎯 报告速览
这是一份基于 OpenRouter 平台 100 万亿 Token 真实交互数据的实证研究,由 a16z(硅谷顶级风投 Andreessen Horowitz)和 OpenRouter(多模型推理平台)联合发布。数据覆盖 300+ 模型、60+ 提供商、全球用户群,时间跨度 13 个月。
报告传递的根本信息:AI 的实际使用远比行业叙事复杂——不是一个模型统治一切,不是只有编程才重要,不是闭源一定赢。
📌 一、最反直觉的发现:角色扮演才是开源模型的核心战场
Aaron读这份报告,第一个被击中的数据是——开源模型超过一半的 Token 用于角色扮演。不是编程,不是写作,不是数据分析。是讲故事、玩角色、做互动小说。
具体来看:角色扮演占开源模型使用量的约 52%,编程排第二(15-20%),翻译、知识问答、教育各占小头。
💡 Aaron怎么看? 行业里所有人都在讲 AI 是生产力革命,但 100 万亿 Token 的数据告诉你:人们对 AI 最大的需求不是「帮我干活」,而是「陪我玩」。 这不是小众现象——角色扮演的 Token 消耗量几乎和编程持平,在某些维度甚至超过编程。
💡 为什么这很重要:这个发现直接改写了 AI 产品的赛道逻辑——如果你只盯着 B2B 生产力工具,你可能错过了一个和编程同等规模的消费级市场。互动叙事和 AI 伙伴是被数据验证过的刚需。
为什么开源模型在角色扮演上占优势?三个原因:
- 内容过滤更少 — 闭源模型的安全层限制了创意自由度
- 可深度定制 — 用户可以微调人格、对话风格
- 成本更低 — 长时间的角色扮演对话消耗大量 Token,开源模型的成本优势明显
这对行业的启示是什么?面向消费者的 AI 应用,不应该只盯着「办公助手」这个赛道。互动叙事、角色驱动的体验、AI 伙伴——这些才是用户用脚投票选出的刚需。
📌 二、开源 vs. 闭源:三分天下的新格局
一年前,闭源模型几乎垄断了 AI 推理市场。今天,格局完全不同了。
市场份额变迁
DeepSeek 以 14.37 万亿 Token 位居开源模型使用量第一,Qwen 5.59 万亿排第二,Meta LLaMA 3.96 万亿排第三。
🧠 Aaron的判断:开源模型的增长不是昙花一现。每次重大开源模型发布(DeepSeek V3、Kimi K2、GPT OSS 系列),使用量都出现跳升——而且跳上去就不下来了。这说明用户不是尝鲜然后回到闭源,而是真正在生产环境中切换过来了。
一年前 DeepSeek 一家独大,现在 Qwen、MoonshotAI、Minimax、Z-AI 都在抢份额。没有单一开源模型能持续占据 20-25% 以上的份额。开源生态从一家独大变成了群雄逐鹿,竞争比以往任何时候都激烈。
一个有趣的发现:中型模型崛起
报告把开源模型按参数量分为三档:小型(<150 亿)、中型(150-700 亿)、大型(>700 亿)。
结论是——小型模型在衰落,中型模型在崛起。Qwen2.5 Coder 32B 在 2024 年 11 月发布时几乎凭一己之力创造了「中型模型」这个品类,后来 Mistral Small 3、GPT-OSS 20B 接棒。用户在寻找的是能力和效率之间的最佳平衡点,而不是一味追求最大或最小。
📌 三、Agent 式推理:AI 使用方式的结构性转变
如果只能从报告中带走一个信息,Aaron选这个:AI 的使用方式正在从「问答」变成「执行」。
几个关键数据点:
- 推理模型已经占全部 Token 的 50%+——从年初的几乎为零
- 工具调用持续上升——AI 不只是回答问题,它在调用外部工具完成任务
- 平均提示长度从 1,500 Token 增至 6,000+——用户不再问简单问题,而是喂给 AI 整个代码库让它分析
- 编程相关提示经常超过 20,000 Token
- 平均序列长度从 2,000 翻了近三倍到 5,400
⚡ Aaron的解读:这些数据汇在一起说明了一件事——AI 正在从聊天机器人变成自主执行者。不是你问它一个问题它给你一个答案,而是你给它一个目标,它自己规划步骤、调用工具、推理验证、最终交付结果。报告用了一个精准的词:agentic inference(Agent 式推理)。这不是趋势,这是已经在发生的事。
编程是推动这一变化的最大力量。编程查询从年初占总 Token 的 11% 飙升至超过 50%。Anthropic 的 Claude 在编程类别中持续占据 60% 以上的份额——这个数据Aaron觉得特别值得注意。Claude 在 AI 编程领域的统治地位,比大多数人意识到的要深得多。
📌 四、灰姑娘「水晶鞋」效应:为什么先发优势如此致命
报告提出了一个Aaron觉得极其精妙的框架——灰姑娘「水晶鞋」效应。
核心思想是这样的:在 AI 领域,有大量高价值的工作负载在等待「被解决」。每次发布新的前沿模型,就像是在给灰姑娘试鞋——大多数模型「穿不上」,但偶尔某个模型恰好解决了某类此前无法完成的任务,就形成了完美契合。
一旦用户找到了这种契合,他们就不走了。
📌 数据支持:Claude 4 Sonnet 的 2025 年 5 月群组和 Gemini 2.5 Pro 的 6 月群组,到第 5 个月仍保持约 40% 的留存率——远高于后续群组。相反,Gemini 2.0 Flash 和 Llama 4 Maverick 没有任何群组表现出色——它们从未被视为任何高价值工作负载的「前沿」。
GPT-4o Mini 展示了这一效应的极端形态:2024 年 7 月的首发群组形成了极高粘性,之后所有群组都聚集在底部。窗口只有一次,而且只在模型被认为是「前沿」的那个瞬间。
DeepSeek 则展示了一个有趣的变体——回旋效应。用户流失后又回来了。这说明一些用户尝试了替代方案后发现 DeepSeek 确实更适合他们的工作负载。
💎 Aaron总结这个框架:对模型开发者来说,「水晶鞋」效应意味着发布时机和首发能力至关重要。你不需要在所有维度都最强,你需要在某个关键维度上率先做到别人做不到的事。对用户来说,这意味着一旦找到适合你工作流的模型,切换成本比你想象的高得多——不只是技术成本,还有习惯和认知的成本。
📌 五、AI 的经济学:便宜不等于赢
报告用了一张非常精彩的成本-使用量散点图,把所有 AI 工作负载分成了四个象限:
中位数成本是每百万 Token $0.73。但这个数字掩盖了巨大的分化——Claude Sonnet 系列约 $2 仍然有极高使用量,而很多接近零成本的开源模型使用量却很低。
🧠 Aaron的观点:这组数据反驳了「AI 终将商品化、价格战决定一切」的简单叙事。LLM 市场还远没有商品化。 需求对价格是非弹性的——降价 10% 只带来 0.5-0.7% 的使用量增长。用户选择模型的逻辑不是「谁便宜用谁」,而是「谁能可靠地完成我的任务」。
报告还发现了杰文斯悖论的证据:当模型变得非常便宜时,用户并没有省钱,而是用了更多——更长的上下文、更多的迭代、更多的任务。Gemini 2.0 Flash 和 DeepSeek V3 就是典型——极低价格导致了海量使用,总消耗反而暴增。
📌 六、全球化:AI 不再是硅谷独享
最后一个值得关注的维度是地理分布。
北美不再占多数——亚洲从 13% 翻倍到 31%。英语仍占 82.87% 的 Token,但中文(简体)已占 4.95%,俄语 2.47%,西班牙语 1.43%。
💬 Aaron的判断:中国的角色特别值得注意——不仅是 AI 模型的消费者,更是生产者和出口者。DeepSeek、Qwen、MoonshotAI 这些中国开源模型在全球平台上获得了真实的大规模使用。这不是实验室里的基准分数,而是用户用真金白银投票的结果。
💎 精华提炼:三个可带走的核心认知
第一,AI 的「杀手级应用」不是你以为的那个。 行业叙事是 AI = 生产力工具,但 100 万亿 Token 的数据说:角色扮演和编程并驾齐驱,娱乐需求不亚于生产力需求。 如果你在做 AI 产品,不要只盯着 B2B 赛道。消费端的互动叙事、AI 伙伴、角色驱动体验,是已经被证明的巨大需求——而且开源模型在这个赛道上有天然优势。
第二,多模型时代已经到来,押注单一模型是最大的战略风险。 没有一个模型在所有场景都最优。Claude 统治编程,DeepSeek 称霸角色扮演,Gemini 在通用场景有优势。聪明的开发者和企业应该建立多模型基础设施——根据任务类型动态路由到最优模型。这不是锦上添花,这是竞争生存的基本功。
第三,先解决一个「不可能的问题」比什么都重要。 灰姑娘「水晶鞋」效应告诉我们:在 AI 领域,持久的竞争优势不来自「什么都比别人好 5%」,而来自**「率先做到别人做不到的一件事」**。那个「水晶鞋」时刻——用户发现你的模型第一次解决了他们长期未被满足的工作需求——创造的不是一时的使用量,而是持久的锁定。这对模型开发者如此,对 AI 创业者亦如此。
📌 报告来源:a16z & OpenRouter《State of AI: An Empirical 100 Trillion Token Study with OpenRouter》,基于 OpenRouter 平台 100 万亿 Token 匿名化交互数据。第一作者 Malika Aubakirova(a16z)。
🌟 对 AI 学习者的启示
这一段是Aaron读完整份报告后,专门写给正在学 AI、用 AI 的你。
认知刷新:你可能以为 AI 最大的用途是写代码和办公提效,但 100 万亿 Token 的真实数据说:开源模型超过一半的使用量是角色扮演和互动叙事。人们对 AI 最大的需求不是「帮我干活」,而是「陪我玩」。
实操建议:不要押注单一模型。今天就建立「多模型切换」的习惯——编程用 Claude,通用任务试 Gemini,成本敏感场景用 DeepSeek。根据任务类型选最优模型,比死守一个模型效率高得多。
趋势判断:Aaron认为 6 个月内 AI 市场的定价逻辑会发生根本变化。数据显示降价 10% 只带来 0.5% 的使用量增长——LLM 远未商品化,用户选模型的逻辑是「谁能可靠完成任务」而不是「谁最便宜」。能力差异化比价格战更有效。
📋 文档信息
资源
📎 20251204-OpenRouter-100T-Token-Study-翻译版.md
📎 20251204-OpenRouter-100T-Token-Study-原版.md
📊 本页表格(2 张,从原数据库还原)
| 数据 | 维度 | Aaron解读 |
|---|---|---|
| 达到总使用量的 ~1/3 | 开源模型份额 | 开源不再是玩具,是真正的生产力 |
| ~52% | 角色扮演占开源使用 | 最大的使用场景不是编程,是讲故事 |
| 从 11% 飙升至 50%+ | 编程占总 Token | 编程是增长最快的类别,但非唯一 |
| 超过 50% 的全部 Token | 推理模型份额 | Agent 式推理已成为新默认 |
| 从 1,500 增至 6,000+ Token | 平均提示长度 | 用户不再「聊天」,而是让 AI 分析整个代码库 |
| 从 13% 翻倍至 31% | 亚洲使用份额 | AI 推理消费正在全球化 |
| 14.37 万亿 | DeepSeek 总 Token | 开源模型单一最大贡献者 |
| 某些周接近 30% | 中国开源模型峰值份额 | 从零到三成只用了一年 |
| 平均份额 | 阵营 | 趋势 |
| ~70% | 闭源(北美) | 仍占多数,但份额在被蚕食 |
| ~13.7% | 开源(西方) | 稳步增长 |
| ~13.0% | 开源(中国) | 从 1.2% 到某些周接近 30%,增长最猛 |
| 特征 | 代表 | 象限 |
| 贵且用量大——用户愿意为复杂问题付高价 | 技术、科学 | 高端工作负载 |
| 便宜且用量大——价格敏感,开源的天下 | 编程、角色扮演 | 大众引擎 |
| 贵但用量小——高风险场景,准确性压倒一切 | 金融、医疗、学术 | 专业利基 |
| 便宜且用量小——可能已经「被解决」 | 翻译、法律 | 工具化 |
| 内容 | 项目 |
|---|---|
| State of AI: An Empirical 100 Trillion Token Study with OpenRouter | 报告名称 |
| OpenRouter Inc. & a16z (Andreessen Horowitz) | 发布机构 |
| Malika Aubakirova(第一作者,a16z)、Alex Atallah、Chris Clark、Justin Summerville(OpenRouter)、Anjney Midha(a16z) | 作者 |
| 2025 年 12 月 | 发布日期 |
| OpenRouter 平台 100 万亿 Token 匿名化请求级元数据(300+ 模型,60+ 提供商,全球用户群) | 数据来源 |
| Aaron | 教程撰写 |
| 教程版(Aaron视角深度解读) | 文档类型 |