一、结论先行
模型单价崩了 10–24 倍,但 Agent 单任务 token 消耗涨了 5–30 倍,企业推理预算占 AI 算力开支约 2/3、占企业 AI 预算约 85%。总账单没塌,是低价引爆了需求。 而算力链(GPU / HBM / CoWoS)是"卖铲子"的,总池子因此更厚——这就是为什么模型免费、算力股却在涨。[综合本号 2026-08-01 话题地图 / WebSearch 聚合,置信中]
二、两种爽文都漏了"总量"
- 爽文 A(AI 太贵要崩):“企业用不起 AI,泡沫必破。”
- 爽文 B(模型免费党):“模型免费了,算力没人要了,芯片股到顶。”
实际:模型单价确实崩了,但调用量暴涨得更快。Jevons 在《煤炭问题》里写:蒸汽机效率提升让煤更便宜,结果英国煤消耗总量不降反升——因为便宜打开了无数新用途。推理模型降价,正在做一模一样的事。[来源:Jevons 1865 原著机理 / 本号推理经济学框架]
偏差:两派都盯着"单价",没人盯"总账单"。2026 年的事实是——单价塌了,总量炸了,算力总消耗不降反升。
三、机制:三个齿轮咬出"账单爆炸"
3.1 Jevons 在推理侧:便宜是需求引爆器
1848 年煤炭降价→用量暴涨→总消耗升。2026 年模型单价降 10–24 倍→调用量(token)暴涨→算力总消耗升。降价不消灭需求,它创造需求。企业从"偶尔调用"变成"全员 Agent 化",token 总池子被低价炸开。
Jevons 总成本公式:
总成本 = 单价_per_token × 调用量
= (单价↓ 10–24x) × (调用量↑ 5–30x)
→ 净方向:总成本 ↑(除非调用量增速 < 单价降幅,但目前反向)
3.2 Agent 的"Token 黑洞"
单任务多步推理、工具调用、重试、上下文累积,让一个 Agent 任务的 token 消耗是单次问答的 5–30 倍。[来源:行业实测/机构研报 consensus,置信中] Gartner 调研显示 88% 的企业 Agent 项目没有量化 ROI——大家都在烧 token,但"值不值"还没算清。这正是"账单爆炸"的微观机制。
Agent 任务成本拆解:
单次问答成本 = prompt_tokens × p_in + completion_tokens × p_out
Agent 任务成本 = Σ(每步 prompt+completion) × 重试系数 × 工具调用步数
≈ 单次问答 × (5–30) # 多步+重试+上下文累积
3.3 利润池暗线:算力链是卖铲子的
推理预算占比上升,但钱最终流向算力链:GPU(英伟达 5.07 万亿美元市值、PE 31.7)、HBM(长鑫 3.28 万亿、PE 113.6;美光毛利率 84%)、光模块(中际旭创 1.17 万亿、PE 78)。[来源:C2 估值与投资跟踪数据库 2026-07 截面 / 美光财报] 模型层在打价格战、利润薄如纸;算力层卖铲子、利润池反而更厚。接本号已完成的《Agent ROI》——Agent 落地的 171% 回报预期,是靠算力链扩产支撑的。
3.4 成本观测代码(可直接复用)
def estimate_agent_cost(
base_tokens: int, # 单次问答 token 数
steps: int, # Agent 步数(多步推理+工具调用)
retry_factor: float, # 重试系数(1.0 = 不重试)
price_per_1k_in: float, # 输入单价 $/1k tokens
price_per_1k_out: float, # 输出单价 $/1k tokens
):
"""Agent 任务相对单次问答的成本放大倍数。"""
single = base_tokens * (price_per_1k_in + price_per_1k_out) / 1000
agent = single * steps * retry_factor
return {
"单次问答成本": round(single, 4),
"Agent任务成本": round(agent, 4),
"放大倍数": round(steps * retry_factor, 1),
}
# 示例:base=2000, steps=12(含工具调用), retry=1.3
print(estimate_agent_cost(2000, 12, 1.3, 0.001, 0.002))
# → 放大倍数 ≈ 15.6x,落在行业观测的 5–30x 区间
3.5 三层对照
| 层级 | 现象 | 利润归属 | 数据 |
|---|---|---|---|
| 模型层 | 单价崩 10–24x | 利润薄 | DeepSeek/Kimi/OpenAI 降价 [本号 07-30] |
| Agent 层 | token 耗 5–30x | ROI 未量化 | 88% 无量化 ROI(Gartner) |
| 算力层 | 总消耗升 | 利润池厚 | 中际旭创 PE78 / 长鑫 PE113.6(C2) |
四、案例:把"免费"和"爆炸"摆一起
- 案例 A——价格战的水电账单:一人公司用 DeepSeek,表面月费 200 元,但上下文超限 + 重试 + 人工审核回路,真实月成本 842 元,是表面 4 倍(本号 2026-07-24《DeepSeek 自来水》)。微观版"账单爆炸"。
- 案例 B——算力股不跌反涨:模型免费叙事最盛的 2026 上半年,中际旭创市值站上 1.17 万亿、长鑫 3.28 万亿——卖铲子逻辑未被"模型免费"削弱,反而被 token 总量扩张强化。[来源:C2 2026-07 截面]
- 案例 C——NVDA 的从容:英伟达 PE 仅 31.7(低于国产 GPU),因为市场认定其利润捕获已兑现。模型免费不打垮 NVDA,打垮的是"以为免费=算力无用"的误判。[来源:C2 / 美股财报]
五、诚实 B 面
- 反方:若推理效率提升(小模型、蒸馏、KV-cache 优化)快于调用量增长,token 总消耗可能增速放缓,算力链利润池扩张节奏会低于"Jevons 必然爆发"叙事。[来源:机构研报 consensus,置信中]
- 边界:Jevons 悖论是"方向性"规律,不是"匀速"规律。总量一定扩张,但扩张速度取决于 Agent 落地率与效率优化的拉锯。
- 什么情况下会错:若 Agent 大规模证伪(88% 无 ROI 蔓延成"砍项目")、或推理效率跃迁式提升,则"算力利润池持续增厚"需要下修。
六、给读者的框架
自己验证的信号清单:
- 企业推理预算占比(看云厂财报 “inference vs training” 口径);
- token 单价走势(是否继续降,降幅是否收窄);
- Agent 落地率(Gartner 类调研的"取消率");
- 算力链资本开支(NVDA/博通/中际旭创的 supply commitment);
- 小模型/蒸馏采用率(效率侧的对冲信号)。
该避的坑:把"模型免费"等同于"算力无用"。2026 年推理侧的真故事是——便宜引爆需求,需求喂厚利润池,模型层打价格战,算力层卖铲子赚钱。
常见问题(FAQ)
Q1:模型免费了,为什么企业账单反而更贵?
A:因为单价降了 10–24 倍,但调用量(token)涨得更快——Agent 多步推理、工具调用、重试、上下文累积,单任务 token 是单次问答的 5–30 倍。这是 Jevons 悖论:资源越便宜,总消耗越大。账单价降了,总量炸了,总账单没塌。
Q2:Jevons 悖论在 AI 推理侧真的成立吗?
A:机理成立。1865 年 Jevons 观察煤炭:效率提升→煤更便宜→用量暴涨→总消耗升。2026 年模型降价→调用量暴涨→算力总消耗升,是同一机制。它是"方向性"规律,不是"匀速"规律——扩张速度取决于 Agent 落地率与效率优化的拉锯。
Q3:既然模型免费,为什么英伟达/中际旭创还在涨?
A:因为钱最终流向算力链。模型层打价格战、利润薄;算力层(GPU/HBM/光模块)卖铲子,token 总量扩张反而喂厚了利润池。NVDA PE 仅 31.7(低于国产 GPU),因为市场认定其利润捕获已兑现。
Q4:怎么给企业算一笔 Agent 的账?
A:用第三节的成本公式:单次成本 × 步数 × 重试系数。示例 base=2000 tokens、12 步、重试 1.3 倍,放大约 15.6 倍,落在行业观测的 5–30x 区间。关键是把"步数"和"重试"算进去,否则会严重低估。
Q5:效率提升(小模型/蒸馏)会不会让算力需求掉下来?
A:会减缓增速,但不一定逆转总量。若效率优化快于调用量增长,利润池扩张节奏会低于"Jevons 必然爆发"叙事。需同时盯"调用量增速"和"单 token 效率"两侧信号。
*数据来源:C2 估值与投资跟踪数据库(2026-07 截面,NVDA 5.07 万亿$/PE31.7、长鑫 3.28 万亿/PE113.6、中际旭创 1.17 万亿/PE78、美光毛利率 84%);本号 2026-07-24《DeepSeek 自来水》(842 元真实月成本)、2026-07-30《模型层价格战》(单价降 10–30x)、2026-08-01 话题地图;Gartner(88% 无量化 ROI);Jevons《煤炭问题》1865。本文为信息聚合与框架分析,不构成任何投资建议。涉及 A 股标的仅作产业机制说明,不做个股方向判断。投资有风险,决策需独立。

被折叠的 条评论
为什么被折叠?



