研究报告研究报告

100 万亿 Token 告诉你一个反直觉的真相:大模型最大的用途不是写代码,是讲故事

这份报告是Aaron近期读到的最具颠覆性的 AI 使用数据分析。a16z 和 OpenRouter 联手,用 100 万亿个 Token 的真实数据画出了一幅完全不同于行业叙事的画像。所有人都在说 AI 是生产力工具,但数据说:开源模型超过一半的使用量是角色扮演。 这份报告让你重新理解——人们真正想从 AI 那里得到什么。 ——Aaron

FULL TEXT

详细文字内容

💬 Aaron点评

这份报告是Aaron近期读到的最具颠覆性的 AI 使用数据分析。a16z 和 OpenRouter 联手,用 100 万亿个 Token 的真实数据画出了一幅完全不同于行业叙事的画像。所有人都在说 AI 是生产力工具,但数据说:开源模型超过一半的使用量是角色扮演。 这份报告让你重新理解——人们真正想从 AI 那里得到什么。 ——Aaron

🎯 报告速览

这是一份基于 OpenRouter 平台 100 万亿 Token 真实交互数据的实证研究,由 a16z(硅谷顶级风投 Andreessen Horowitz)和 OpenRouter(多模型推理平台)联合发布。数据覆盖 300+ 模型、60+ 提供商、全球用户群,时间跨度 13 个月。

报告传递的根本信息:AI 的实际使用远比行业叙事复杂——不是一个模型统治一切,不是只有编程才重要,不是闭源一定赢。

📌 一、最反直觉的发现:角色扮演才是开源模型的核心战场

Aaron读这份报告,第一个被击中的数据是——开源模型超过一半的 Token 用于角色扮演。不是编程,不是写作,不是数据分析。是讲故事、玩角色、做互动小说

具体来看:角色扮演占开源模型使用量的约 52%,编程排第二(15-20%),翻译、知识问答、教育各占小头。

💡 Aaron怎么看? 行业里所有人都在讲 AI 是生产力革命,但 100 万亿 Token 的数据告诉你:人们对 AI 最大的需求不是「帮我干活」,而是「陪我玩」。 这不是小众现象——角色扮演的 Token 消耗量几乎和编程持平,在某些维度甚至超过编程。

💡 为什么这很重要:这个发现直接改写了 AI 产品的赛道逻辑——如果你只盯着 B2B 生产力工具,你可能错过了一个和编程同等规模的消费级市场。互动叙事和 AI 伙伴是被数据验证过的刚需。

为什么开源模型在角色扮演上占优势?三个原因:

  • 内容过滤更少 — 闭源模型的安全层限制了创意自由度
  • 可深度定制 — 用户可以微调人格、对话风格
  • 成本更低 — 长时间的角色扮演对话消耗大量 Token,开源模型的成本优势明显

这对行业的启示是什么?面向消费者的 AI 应用,不应该只盯着「办公助手」这个赛道。互动叙事、角色驱动的体验、AI 伙伴——这些才是用户用脚投票选出的刚需。

📌 二、开源 vs. 闭源:三分天下的新格局

一年前,闭源模型几乎垄断了 AI 推理市场。今天,格局完全不同了。

市场份额变迁

DeepSeek 以 14.37 万亿 Token 位居开源模型使用量第一,Qwen 5.59 万亿排第二,Meta LLaMA 3.96 万亿排第三。

🧠 Aaron的判断:开源模型的增长不是昙花一现。每次重大开源模型发布(DeepSeek V3、Kimi K2、GPT OSS 系列),使用量都出现跳升——而且跳上去就不下来了。这说明用户不是尝鲜然后回到闭源,而是真正在生产环境中切换过来了。

一年前 DeepSeek 一家独大,现在 Qwen、MoonshotAI、Minimax、Z-AI 都在抢份额。没有单一开源模型能持续占据 20-25% 以上的份额。开源生态从一家独大变成了群雄逐鹿,竞争比以往任何时候都激烈

一个有趣的发现:中型模型崛起

报告把开源模型按参数量分为三档:小型(<150 亿)、中型(150-700 亿)、大型(>700 亿)。

结论是——小型模型在衰落,中型模型在崛起。Qwen2.5 Coder 32B 在 2024 年 11 月发布时几乎凭一己之力创造了「中型模型」这个品类,后来 Mistral Small 3、GPT-OSS 20B 接棒。用户在寻找的是能力和效率之间的最佳平衡点,而不是一味追求最大或最小。

📌 三、Agent 式推理:AI 使用方式的结构性转变

如果只能从报告中带走一个信息,Aaron选这个:AI 的使用方式正在从「问答」变成「执行」。

几个关键数据点:

  • 推理模型已经占全部 Token 的 50%+——从年初的几乎为零
  • 工具调用持续上升——AI 不只是回答问题,它在调用外部工具完成任务
  • 平均提示长度从 1,500 Token 增至 6,000+——用户不再问简单问题,而是喂给 AI 整个代码库让它分析
  • 编程相关提示经常超过 20,000 Token
  • 平均序列长度从 2,000 翻了近三倍到 5,400

Aaron的解读:这些数据汇在一起说明了一件事——AI 正在从聊天机器人变成自主执行者。不是你问它一个问题它给你一个答案,而是你给它一个目标,它自己规划步骤、调用工具、推理验证、最终交付结果。报告用了一个精准的词:agentic inference(Agent 式推理)。这不是趋势,这是已经在发生的事。

编程是推动这一变化的最大力量。编程查询从年初占总 Token 的 11% 飙升至超过 50%。Anthropic 的 Claude 在编程类别中持续占据 60% 以上的份额——这个数据Aaron觉得特别值得注意。Claude 在 AI 编程领域的统治地位,比大多数人意识到的要深得多。

📌 四、灰姑娘「水晶鞋」效应:为什么先发优势如此致命

报告提出了一个Aaron觉得极其精妙的框架——灰姑娘「水晶鞋」效应

核心思想是这样的:在 AI 领域,有大量高价值的工作负载在等待「被解决」。每次发布新的前沿模型,就像是在给灰姑娘试鞋——大多数模型「穿不上」,但偶尔某个模型恰好解决了某类此前无法完成的任务,就形成了完美契合。

一旦用户找到了这种契合,他们就不走了

📌 数据支持:Claude 4 Sonnet 的 2025 年 5 月群组和 Gemini 2.5 Pro 的 6 月群组,到第 5 个月仍保持约 40% 的留存率——远高于后续群组。相反,Gemini 2.0 Flash 和 Llama 4 Maverick 没有任何群组表现出色——它们从未被视为任何高价值工作负载的「前沿」。

GPT-4o Mini 展示了这一效应的极端形态:2024 年 7 月的首发群组形成了极高粘性,之后所有群组都聚集在底部。窗口只有一次,而且只在模型被认为是「前沿」的那个瞬间。

DeepSeek 则展示了一个有趣的变体——回旋效应。用户流失后又回来了。这说明一些用户尝试了替代方案后发现 DeepSeek 确实更适合他们的工作负载。

💎 Aaron总结这个框架:对模型开发者来说,「水晶鞋」效应意味着发布时机和首发能力至关重要。你不需要在所有维度都最强,你需要在某个关键维度上率先做到别人做不到的事。对用户来说,这意味着一旦找到适合你工作流的模型,切换成本比你想象的高得多——不只是技术成本,还有习惯和认知的成本

📌 五、AI 的经济学:便宜不等于赢

报告用了一张非常精彩的成本-使用量散点图,把所有 AI 工作负载分成了四个象限:

中位数成本是每百万 Token $0.73。但这个数字掩盖了巨大的分化——Claude Sonnet 系列约 $2 仍然有极高使用量,而很多接近零成本的开源模型使用量却很低。

🧠 Aaron的观点:这组数据反驳了「AI 终将商品化、价格战决定一切」的简单叙事。LLM 市场还远没有商品化。 需求对价格是非弹性的——降价 10% 只带来 0.5-0.7% 的使用量增长。用户选择模型的逻辑不是「谁便宜用谁」,而是「谁能可靠地完成我的任务」。

报告还发现了杰文斯悖论的证据:当模型变得非常便宜时,用户并没有省钱,而是用了更多——更长的上下文、更多的迭代、更多的任务。Gemini 2.0 Flash 和 DeepSeek V3 就是典型——极低价格导致了海量使用,总消耗反而暴增。

📌 六、全球化:AI 不再是硅谷独享

最后一个值得关注的维度是地理分布。

北美不再占多数——亚洲从 13% 翻倍到 31%。英语仍占 82.87% 的 Token,但中文(简体)已占 4.95%,俄语 2.47%,西班牙语 1.43%。

💬 Aaron的判断:中国的角色特别值得注意——不仅是 AI 模型的消费者,更是生产者和出口者。DeepSeek、Qwen、MoonshotAI 这些中国开源模型在全球平台上获得了真实的大规模使用。这不是实验室里的基准分数,而是用户用真金白银投票的结果。

💎 精华提炼:三个可带走的核心认知

第一,AI 的「杀手级应用」不是你以为的那个。 行业叙事是 AI = 生产力工具,但 100 万亿 Token 的数据说:角色扮演和编程并驾齐驱,娱乐需求不亚于生产力需求。 如果你在做 AI 产品,不要只盯着 B2B 赛道。消费端的互动叙事、AI 伙伴、角色驱动体验,是已经被证明的巨大需求——而且开源模型在这个赛道上有天然优势。

第二,多模型时代已经到来,押注单一模型是最大的战略风险。 没有一个模型在所有场景都最优。Claude 统治编程,DeepSeek 称霸角色扮演,Gemini 在通用场景有优势。聪明的开发者和企业应该建立多模型基础设施——根据任务类型动态路由到最优模型。这不是锦上添花,这是竞争生存的基本功。

第三,先解决一个「不可能的问题」比什么都重要。 灰姑娘「水晶鞋」效应告诉我们:在 AI 领域,持久的竞争优势不来自「什么都比别人好 5%」,而来自**「率先做到别人做不到的一件事」**。那个「水晶鞋」时刻——用户发现你的模型第一次解决了他们长期未被满足的工作需求——创造的不是一时的使用量,而是持久的锁定。这对模型开发者如此,对 AI 创业者亦如此。

📌 报告来源:a16z & OpenRouter《State of AI: An Empirical 100 Trillion Token Study with OpenRouter》,基于 OpenRouter 平台 100 万亿 Token 匿名化交互数据。第一作者 Malika Aubakirova(a16z)。

🌟 对 AI 学习者的启示

这一段是Aaron读完整份报告后,专门写给正在学 AI、用 AI 的你。

认知刷新:你可能以为 AI 最大的用途是写代码和办公提效,但 100 万亿 Token 的真实数据说:开源模型超过一半的使用量是角色扮演和互动叙事。人们对 AI 最大的需求不是「帮我干活」,而是「陪我玩」。

实操建议:不要押注单一模型。今天就建立「多模型切换」的习惯——编程用 Claude,通用任务试 Gemini,成本敏感场景用 DeepSeek。根据任务类型选最优模型,比死守一个模型效率高得多。

趋势判断:Aaron认为 6 个月内 AI 市场的定价逻辑会发生根本变化。数据显示降价 10% 只带来 0.5% 的使用量增长——LLM 远未商品化,用户选模型的逻辑是「谁能可靠完成任务」而不是「谁最便宜」。能力差异化比价格战更有效。

📋 文档信息

资源

📎 20251204-OpenRouter-100T-Token-Study-翻译版.md

📎 20251204-OpenRouter-100T-Token-Study-原版.md

📊 本页表格(2 张,从原数据库还原)

数据维度Aaron解读
达到总使用量的 ~1/3开源模型份额开源不再是玩具,是真正的生产力
~52%角色扮演占开源使用最大的使用场景不是编程,是讲故事
从 11% 飙升至 50%+编程占总 Token编程是增长最快的类别,但非唯一
超过 50% 的全部 Token推理模型份额Agent 式推理已成为新默认
从 1,500 增至 6,000+ Token平均提示长度用户不再「聊天」,而是让 AI 分析整个代码库
从 13% 翻倍至 31%亚洲使用份额AI 推理消费正在全球化
14.37 万亿DeepSeek 总 Token开源模型单一最大贡献者
某些周接近 30%中国开源模型峰值份额从零到三成只用了一年
平均份额阵营趋势
~70%闭源(北美)仍占多数,但份额在被蚕食
~13.7%开源(西方)稳步增长
~13.0%开源(中国)从 1.2% 到某些周接近 30%,增长最猛
特征代表象限
贵且用量大——用户愿意为复杂问题付高价技术、科学高端工作负载
便宜且用量大——价格敏感,开源的天下编程、角色扮演大众引擎
贵但用量小——高风险场景,准确性压倒一切金融、医疗、学术专业利基
便宜且用量小——可能已经「被解决」翻译、法律工具化
内容项目
State of AI: An Empirical 100 Trillion Token Study with OpenRouter报告名称
OpenRouter Inc. & a16z (Andreessen Horowitz)发布机构
Malika Aubakirova(第一作者,a16z)、Alex Atallah、Chris Clark、Justin Summerville(OpenRouter)、Anjney Midha(a16z)作者
2025 年 12 月发布日期
OpenRouter 平台 100 万亿 Token 匿名化请求级元数据(300+ 模型,60+ 提供商,全球用户群)数据来源
Aaron教程撰写
教程版(Aaron视角深度解读)文档类型
STRUCTURED NEXT STEP

继续进入结构化课程或精选资产