AI推理利润不只看成本,收入端和工作负载结构才是关键分化点
AI 摘要卡
AI推理利润不只看成本,收入端和工作负载结构才是关键分化点
伯恩斯坦认为,中国AI实验室的推理利润率由每百万token收入、KV缓存命中率、输入输出比例、模态组合和GPU小时成本共同决定;Z.ai有望在H1 2026改善利润率,Qwen依托阿里云具备成本优势,而Minimax可能受工作负载从高价语音转向文本/代码与智能体编排拖累。
- 收入端变量对现实中的AI实验室推理利润率影响可能大于成本端,尤其是不同模态和工作负载的Rev/Mtok差异。
- 文本转语音token定价显著高于文本/代码与视频生成,Minimax过往较高Open Platform毛利率可能部分受益于音频API。
- Z.ai的GLM-5和GLM-5.1涨价有望抵消云厂商算力涨价,并带来H1 2026推理利润率改善。
- Qwen依托阿里云算力和超大云厂商利润链条,较独立AI实验室可能拥有更持久的单位算力成本优势。
研报解读
概览
本报告是一篇关于中国互联网与AI推理经济学的深度研究,试图用较低术语门槛解释AI实验室推理利润率的形成机制。报告将直接推理毛利定义为每token收入减每token成本,不包括公司层面费用和训练成本,并以Minimax和Z.ai的财务披露、公开token定价、OpenRouter数据、GPU小时成本推算和云厂商渠道信息作为主要依据。核心问题不是“AI收入是否增长”,而是不同模型、模态、地区定价、缓存命中率、输入输出长度和GPU利用率如何共同决定单位经济。
核心观点
报告的核心观点包括:第一,不同AI推理token并不等价,文本/代码、视频生成、文本转语音的收入强度差异很大;第二,现实利润率中每百万token收入的差异可能比每token成本优化更具决定性;第三,Z.ai因GLM-5和GLM-5.1涨价,H1 2026推理利润率有望明显改善;第四,Minimax虽然披露过较高Open Platform毛利率,但若工作负载从高价文本转语音转向低价文本/代码和智能体编排, blended Rev/Mtok可能承压;第五,Qwen/阿里云因云基础设施和算力供给链条,较独立AI实验室具备中期成本优势。
分析框架
报告采用自上而下和自下而上结合的“粗略但可解释”模型:收入端估算输入token、输出token、KV缓存命中率、缓存token折扣、国内外价格差异和多模态价格换算后的Rev/Mtok;成本端估算每GPU小时成本、tokens/second吞吐、GPU利用率、模型参数规模、批处理效率以及云厂商加价。随后通过Z.ai和Minimax在不同模型、地区、模态和工作负载下的敏感性分析,判断推理利润率方向性差异。
方法论与常识提炼
每百万token收入
收入端由输入输出token比例、输入/输出token定价、KV缓存命中率和缓存token折扣共同决定;对多模态模型,还需要把视频秒数、音频字符数等换算为等效token收入。
每百万token成本
成本端由每GPU小时成本、单GPU每秒token吞吐、GPU利用率和每小时秒数推导;模型架构、MoE稀疏度、批处理效率和云厂商服务加价都会影响结果。
工作负载结构敏感性
报告比较文本/代码、视频、文本转语音和智能体编排等不同负载,强调模态结构变化会改变blended Rev/Mtok,从而影响AI实验室毛利率。
互联网公司估值对比
报告附有中国、亚洲和美国互联网公司估值比较表,用PE、EV/sales、市值、评级、目标价和最新价格提供覆盖公司和同业背景。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Alibaba / Qwen / Alibaba Cloud受益于云算力成本优势和Qwen多模态需求捕获
- 优势
- 云基础设施规模、算力调度、外部AI客户提价能力和Qwen模型生态可能带来较低Cost/Mtok。
- 劣势
- 算力限制、芯片进口限制和云业务资本开支压力仍可能影响利润释放。
- 对比
- 相对独立AI实验室,阿里云作为hyperscaler更可能在GPU小时成本和服务链条上保留优势。
- 风险
- 宏观消费、平台竞争、监管、创新业务亏损以及AI价格竞争可能削弱估值和盈利弹性。
- Z.ai推理利润率改善受益者
- 优势
- GLM-5和GLM-5.1涨价、通用推理负载和国际定价溢价有助于提升Rev/Mtok。
- 劣势
- 披露有限,成本端依赖外部GPU小时成本假设,国内价格低于国际价格。
- 对比
- 报告估算Z.ai文本/代码推理利润率高于Minimax,除非Minimax吞吐优势远超假设。
- 风险
- 云厂商涨价、模型吞吐假设偏差、KV缓存和ISL:OSL假设变化可能改变结论。
- Minimax高毛利可持续性存在压力
- 优势
- M2.5/2.7定位轻量智能体骨干,模型更小且稀疏,可能有较高吞吐和GPU利用率;9M 2025 Open Platform毛利率较高。
- 劣势
- 未提高价格,文本/代码Rev/Mtok较低;高价文本转语音负载占比若下降,整体收入强度承压。
- 对比
- 相比Z.ai,Minimax可能在吞吐和利用率上更好,但报告认为这不足以完全抵消收入端差距。
- 风险
- 工作负载向OpenClaw、文本/代码和智能体编排迁移,可能压缩blended Rev/Mtok和毛利率。
- Tencent覆盖公司,互联网估值与AI主题相关
- 优势
- 表内评级为Outperform,目标价HK$780,对应当前价HK$522.50存在上行空间。
- 劣势
- 报告主体并非腾讯AI推理利润率专项分析,更多作为中国互联网覆盖与估值背景。
- 对比
- 在中国互联网覆盖中,与阿里巴巴、PDD、美团、网易、京东等共同列示估值。
- 风险
- 宏观信用和零售消费、用户参与度波动、游戏和广告竞争、反垄断等监管风险。
关键数据
- Z.ai API毛利率H2 2025为22.4%,一年前为-11.7%,隐含同比增量利润率30.3%报告认为GLM-5/GLM-5.1涨价可能推动H1 2026进一步改善。
- Minimax Open Platform毛利率9M 2025为69.4%,9M 2024为62.3%,隐含同比增量利润率73.9%公司未披露2025全年数字;报告担心高毛利受文本转语音高定价贡献,未来或受负载迁移影响。
- 文本转语音Rev/Mtok报告估算Minimax文本转语音list price可超过US$10/Mtok,HD口径约US$17/Mtok显著高于文本/代码token,解释了多模态负载对利润率的巨大影响。
- Z.ai文本/代码Rev/Mtok调整典型输入输出比例和KV缓存后,blended Rev/Mtok大致在US$1区间GLM-5和GLM-5.1提价是H1 2026利润改善的重要驱动。
- Minimax文本/代码Rev/Mtok轻量模型文本/代码token大致在US$0.2/Mtok区间若OpenClaw等智能体负载占比提升,可能拉低整体收入强度。
- KV缓存命中率图表显示GLM-5中位数约39%,Minimax-M2.5中位数约71%缓存命中率影响输入token有效收入,也反映不同工作负载特征。
- GPU小时成本报告通过阿里云AI收入、算力规模和社交媒体H20服务器租赁报价推算,低US$1/小时区间较合理阿里云推算约RMB7-9/小时,裸金属服务器租赁约RMB7.0-8.5/小时,后者更像下限。
- 阿里云外部AI收入假设上季度约RMB9.0bn,约US$1.3bn报告据此反推约1.2-1.3GW算力和约250万张GPU规模假设。
- 覆盖公司评级与目标价腾讯O,目标价HK$780;阿里巴巴O,ADR目标价US$180,9988.HK目标价HK$176表内当前价为腾讯HK$522.50、BABA US$141.01、9988.HK HK$137.00。
影响与含义
投资含义是,AI商业化不应只看收入增长或模型热度,而应评估推理单位经济是否可持续。对互联网平台而言,拥有云基础设施、GPU采购和调度能力的公司更可能在成本端形成护城河;对独立AI实验室而言,短期高毛利可能来自有利的模态组合或定价窗口,但当智能体和文本/代码负载占比上升时,收入强度可能被稀释。报告因此更看好Qwen/阿里云的相对成本位置,也认为Z.ai短期利润率改善可见度较高,同时对Minimax高毛利的可持续性保持审慎。
风险
- AI实验室披露有限,许多成本和吞吐假设只能通过公开价格、渠道信息和粗略模型推算。
- GPU小时成本、利用率、tokens/second吞吐、批处理效率和模型架构差异可能显著改变Cost/Mtok估算。
- 商业折扣不可观察,公开OpenRouter或list price可能高估真实Rev/Mtok。
- 文本转语音高定价的竞争格局和客户支付意愿可能不可持续。
- 工作负载结构若快速转向低价文本/代码或智能体编排,Minimax等平台的blended Rev/Mtok可能下行。
- 云厂商算力涨价、芯片进口限制、GPU供应和国内外价格差异可能影响AI实验室利润率。
- 腾讯和阿里巴巴仍面临宏观、平台竞争、监管和创新业务亏损等传统互联网风险。
后续跟踪
- Z.ai下一次业绩披露中API毛利率和增量利润率是否显著改善。
- GLM-5、GLM-5.1及后续模型国内外价格是否继续上调,以及商业折扣幅度。
- Minimax是否开始提价,或是否继续以M2.5/2.7作为低成本智能体骨干。
- OpenClaw、Hermes agents等智能体工作负载占比变化,以及其对ISL:OSL、KV缓存和Rev/Mtok的影响。
- 文本转语音API价格是否维持高溢价,还是因竞争加剧而回落。
- 阿里云外部AI收入、算力利用率、GPU小时成本和Qwen闭源/商业化策略。
- H20/H100/H800等可用GPU供给、租赁价格和中国AI算力限制。