摘要速读
覆盖华尔街顶级投行最新研报

AI推理利润不只看成本,收入端和工作负载结构才是关键分化点

机构
Bernstein
日期
2026-04-21
作者
Robin Zhu、Charles Gou、Min-Joo Kang
公司
-
代码
-
行业
Internet; Artificial Intelligence
评级
Tencent: Outperform; Alibaba: Outperform
中性信心弱The report argues AI inference unit economics will increasingly matter for competitiveness. It expects Z.ai margins to improve after GLM-5/GLM-5.1 price increases and sees Qwen/Alibaba Cloud retaining a compute-cost edge, while Minimax faces potential Rev/Mtok pressure as workload mix shifts away from high-priced text-to-speech.
作者Robin Zhu、Charles Gou、Min-Joo Kang
目标价Tencent HK$780; Alibaba ADR US$180; Alibaba 9988.HK HK$176
资产类别权益/股票
子公司Alibaba Cloud、Qwen
业务部门AI inference、Cloud computing、AI models、Internet platforms、Text/coding workloads、Text-to-speech、Video generation
研究机构部门/子公司Bernstein(其他)

AI 摘要卡

AI推理利润不只看成本,收入端和工作负载结构才是关键分化点

伯恩斯坦认为,中国AI实验室的推理利润率由每百万token收入、KV缓存命中率、输入输出比例、模态组合和GPU小时成本共同决定;Z.ai有望在H1 2026改善利润率,Qwen依托阿里云具备成本优势,而Minimax可能受工作负载从高价语音转向文本/代码与智能体编排拖累。

覆盖表显示腾讯和阿里巴巴均为Outperform;目标价分别为腾讯HK$780、阿里巴巴ADR US$180、阿里巴巴9988.HK HK$176。
中国互联网AI推理经济学Token定价Rev/MtokGPU成本QwenZ.aiMinimax
  • 收入端变量对现实中的AI实验室推理利润率影响可能大于成本端,尤其是不同模态和工作负载的Rev/Mtok差异。
  • 文本转语音token定价显著高于文本/代码与视频生成,Minimax过往较高Open Platform毛利率可能部分受益于音频API。
  • Z.ai的GLM-5和GLM-5.1涨价有望抵消云厂商算力涨价,并带来H1 2026推理利润率改善。
  • Qwen依托阿里云算力和超大云厂商利润链条,较独立AI实验室可能拥有更持久的单位算力成本优势。

研报解读

概览

本报告是一篇关于中国互联网与AI推理经济学的深度研究,试图用较低术语门槛解释AI实验室推理利润率的形成机制。报告将直接推理毛利定义为每token收入减每token成本,不包括公司层面费用和训练成本,并以Minimax和Z.ai的财务披露、公开token定价、OpenRouter数据、GPU小时成本推算和云厂商渠道信息作为主要依据。核心问题不是“AI收入是否增长”,而是不同模型、模态、地区定价、缓存命中率、输入输出长度和GPU利用率如何共同决定单位经济。

核心观点

报告的核心观点包括:第一,不同AI推理token并不等价,文本/代码、视频生成、文本转语音的收入强度差异很大;第二,现实利润率中每百万token收入的差异可能比每token成本优化更具决定性;第三,Z.ai因GLM-5和GLM-5.1涨价,H1 2026推理利润率有望明显改善;第四,Minimax虽然披露过较高Open Platform毛利率,但若工作负载从高价文本转语音转向低价文本/代码和智能体编排, blended Rev/Mtok可能承压;第五,Qwen/阿里云因云基础设施和算力供给链条,较独立AI实验室具备中期成本优势。

分析框架

报告采用自上而下和自下而上结合的“粗略但可解释”模型:收入端估算输入token、输出token、KV缓存命中率、缓存token折扣、国内外价格差异和多模态价格换算后的Rev/Mtok;成本端估算每GPU小时成本、tokens/second吞吐、GPU利用率、模型参数规模、批处理效率以及云厂商加价。随后通过Z.ai和Minimax在不同模型、地区、模态和工作负载下的敏感性分析,判断推理利润率方向性差异。

方法论与常识提炼

  • unit_economicsRev/Mtok model

    每百万token收入

    收入端由输入输出token比例、输入/输出token定价、KV缓存命中率和缓存token折扣共同决定;对多模态模型,还需要把视频秒数、音频字符数等换算为等效token收入。

  • unit_economicsCost/Mtok model

    每百万token成本

    成本端由每GPU小时成本、单GPU每秒token吞吐、GPU利用率和每小时秒数推导;模型架构、MoE稀疏度、批处理效率和云厂商服务加价都会影响结果。

  • scenario_analysisworkload mix sensitivity

    工作负载结构敏感性

    报告比较文本/代码、视频、文本转语音和智能体编排等不同负载,强调模态结构变化会改变blended Rev/Mtok,从而影响AI实验室毛利率。

  • market_comparisonvaluation comparison

    互联网公司估值对比

    报告附有中国、亚洲和美国互联网公司估值比较表,用PE、EV/sales、市值、评级、目标价和最新价格提供覆盖公司和同业背景。

标的映射与对比

研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。

  • Alibaba / Qwen / Alibaba Cloud
    受益于云算力成本优势和Qwen多模态需求捕获
    优势
    云基础设施规模、算力调度、外部AI客户提价能力和Qwen模型生态可能带来较低Cost/Mtok。
    劣势
    算力限制、芯片进口限制和云业务资本开支压力仍可能影响利润释放。
    对比
    相对独立AI实验室,阿里云作为hyperscaler更可能在GPU小时成本和服务链条上保留优势。
    风险
    宏观消费、平台竞争、监管、创新业务亏损以及AI价格竞争可能削弱估值和盈利弹性。
  • Z.ai
    推理利润率改善受益者
    优势
    GLM-5和GLM-5.1涨价、通用推理负载和国际定价溢价有助于提升Rev/Mtok。
    劣势
    披露有限,成本端依赖外部GPU小时成本假设,国内价格低于国际价格。
    对比
    报告估算Z.ai文本/代码推理利润率高于Minimax,除非Minimax吞吐优势远超假设。
    风险
    云厂商涨价、模型吞吐假设偏差、KV缓存和ISL:OSL假设变化可能改变结论。
  • Minimax
    高毛利可持续性存在压力
    优势
    M2.5/2.7定位轻量智能体骨干,模型更小且稀疏,可能有较高吞吐和GPU利用率;9M 2025 Open Platform毛利率较高。
    劣势
    未提高价格,文本/代码Rev/Mtok较低;高价文本转语音负载占比若下降,整体收入强度承压。
    对比
    相比Z.ai,Minimax可能在吞吐和利用率上更好,但报告认为这不足以完全抵消收入端差距。
    风险
    工作负载向OpenClaw、文本/代码和智能体编排迁移,可能压缩blended Rev/Mtok和毛利率。
  • Tencent
    覆盖公司,互联网估值与AI主题相关
    优势
    表内评级为Outperform,目标价HK$780,对应当前价HK$522.50存在上行空间。
    劣势
    报告主体并非腾讯AI推理利润率专项分析,更多作为中国互联网覆盖与估值背景。
    对比
    在中国互联网覆盖中,与阿里巴巴、PDD、美团、网易、京东等共同列示估值。
    风险
    宏观信用和零售消费、用户参与度波动、游戏和广告竞争、反垄断等监管风险。

关键数据

  • Z.ai API毛利率H2 2025为22.4%,一年前为-11.7%,隐含同比增量利润率30.3%报告认为GLM-5/GLM-5.1涨价可能推动H1 2026进一步改善。
  • Minimax Open Platform毛利率9M 2025为69.4%,9M 2024为62.3%,隐含同比增量利润率73.9%公司未披露2025全年数字;报告担心高毛利受文本转语音高定价贡献,未来或受负载迁移影响。
  • 文本转语音Rev/Mtok报告估算Minimax文本转语音list price可超过US$10/Mtok,HD口径约US$17/Mtok显著高于文本/代码token,解释了多模态负载对利润率的巨大影响。
  • Z.ai文本/代码Rev/Mtok调整典型输入输出比例和KV缓存后,blended Rev/Mtok大致在US$1区间GLM-5和GLM-5.1提价是H1 2026利润改善的重要驱动。
  • Minimax文本/代码Rev/Mtok轻量模型文本/代码token大致在US$0.2/Mtok区间若OpenClaw等智能体负载占比提升,可能拉低整体收入强度。
  • KV缓存命中率图表显示GLM-5中位数约39%,Minimax-M2.5中位数约71%缓存命中率影响输入token有效收入,也反映不同工作负载特征。
  • GPU小时成本报告通过阿里云AI收入、算力规模和社交媒体H20服务器租赁报价推算,低US$1/小时区间较合理阿里云推算约RMB7-9/小时,裸金属服务器租赁约RMB7.0-8.5/小时,后者更像下限。
  • 阿里云外部AI收入假设上季度约RMB9.0bn,约US$1.3bn报告据此反推约1.2-1.3GW算力和约250万张GPU规模假设。
  • 覆盖公司评级与目标价腾讯O,目标价HK$780;阿里巴巴O,ADR目标价US$180,9988.HK目标价HK$176表内当前价为腾讯HK$522.50、BABA US$141.01、9988.HK HK$137.00。

影响与含义

投资含义是,AI商业化不应只看收入增长或模型热度,而应评估推理单位经济是否可持续。对互联网平台而言,拥有云基础设施、GPU采购和调度能力的公司更可能在成本端形成护城河;对独立AI实验室而言,短期高毛利可能来自有利的模态组合或定价窗口,但当智能体和文本/代码负载占比上升时,收入强度可能被稀释。报告因此更看好Qwen/阿里云的相对成本位置,也认为Z.ai短期利润率改善可见度较高,同时对Minimax高毛利的可持续性保持审慎。

风险

  • AI实验室披露有限,许多成本和吞吐假设只能通过公开价格、渠道信息和粗略模型推算。
  • GPU小时成本、利用率、tokens/second吞吐、批处理效率和模型架构差异可能显著改变Cost/Mtok估算。
  • 商业折扣不可观察,公开OpenRouter或list price可能高估真实Rev/Mtok。
  • 文本转语音高定价的竞争格局和客户支付意愿可能不可持续。
  • 工作负载结构若快速转向低价文本/代码或智能体编排,Minimax等平台的blended Rev/Mtok可能下行。
  • 云厂商算力涨价、芯片进口限制、GPU供应和国内外价格差异可能影响AI实验室利润率。
  • 腾讯和阿里巴巴仍面临宏观、平台竞争、监管和创新业务亏损等传统互联网风险。

后续跟踪

  • Z.ai下一次业绩披露中API毛利率和增量利润率是否显著改善。
  • GLM-5、GLM-5.1及后续模型国内外价格是否继续上调,以及商业折扣幅度。
  • Minimax是否开始提价,或是否继续以M2.5/2.7作为低成本智能体骨干。
  • OpenClaw、Hermes agents等智能体工作负载占比变化,以及其对ISL:OSL、KV缓存和Rev/Mtok的影响。
  • 文本转语音API价格是否维持高溢价,还是因竞争加剧而回落。
  • 阿里云外部AI收入、算力利用率、GPU小时成本和Qwen闭源/商业化策略。
  • H20/H100/H800等可用GPU供给、租赁价格和中国AI算力限制。
备案号:浙ICP备2022035445号-5
免责声明:本网站提供的市场数据、图表、指标、研究观点及其他信息,仅用于信息展示、研究交流与学习参考,不应被视为任何形式的个性化投资建议、证券推荐、交易指令、要约邀请或收益承诺。尽管我们尽力提升数据与内容的可靠性,相关信息仍可能因来源差异、统计口径、系统处理或市场波动而存在延迟、误差、不完整或更新不及时的情况。用户在使用本网站任何内容时,应结合自身情况进行独立判断,并自行承担由此产生的风险与责任。

设置

登录后可查看最近记录