伯恩斯坦更新中国AI推理token经济模型,结论仍偏向前沿模型与高吞吐优化能力
AI 摘要卡
伯恩斯坦更新中国AI推理token经济模型,结论仍偏向前沿模型与高吞吐优化能力
报告将中国头部AI实验室反馈纳入推理利润率模型,认为Minimax 40%利润率需要显著更高TPS假设,而Z.ai在可比折扣下仍可能具备更高利润率,DeepSeek V4和腾讯hy3-preview则凸显中国AI竞争继续加速。
- Minimax M2.7若要达到约40%文本/代码推理毛利率,需要M2.7相对GLM-5/5.1约4.5-5.0倍的数据中心级TPS比率。
- 报告新增商业折扣变量,基础情景假设统一20%折扣;折扣上升会直接压低每百万token收入和推理利润率。
- 在可比折扣、工作负载和TPS假设下,伯恩斯坦仍认为Z.ai GLM系列模型利润率可能高于Minimax,但差距较此前估计收窄。
- DeepSeek V4接近数月前全球SOTA且成本更低,V4-Flash低价强化轻量低成本模型价格战判断。
- 腾讯hy3-preview被视为略滞后但方向正确的一步,关键观察点是腾讯AI数据与基础设施重建能否带来更快模型迭代。
研报解读
概览
本报告是伯恩斯坦对中国互联网与AI推理经济性的深度补充研究,核心是根据中国头部AI实验室反馈,更新AI token经济与推理利润率模型。报告讨论Minimax、Z.ai、DeepSeek V4与腾讯hy3-preview,并结合商业折扣、TPS、GPU成本、KV cache、输入输出token价格等变量,评估不同模型的推理利润率和竞争含义。
核心观点
核心观点包括:第一,Minimax管理层关于M2.7约40%推理毛利率的说法,需要比此前更高的tokens per second假设来解释;第二,Z.ai GLM系列在可比折扣和工作负载下仍可能具备更高利润率,但相对优势小于此前估计;第三,多模态推理因每百万token收入更高,利润率通常高于文本/代码推理;第四,DeepSeek V4显示中国模型能力仍接近全球前沿,但轻量低成本模型价格竞争会更加激烈;第五,腾讯hy3-preview的投资含义不在单次发布本身,而在于能否证明腾讯内部AI模型与应用迭代速度提升。
分析框架
报告采用自下而上的AI token经济模型,将每百万token收入、输入输出价格、KV cache命中率、商业折扣、TPS、GPU利用率和GPU小时成本等变量组合,估算不同模型的推理成本与毛利率,并通过敏感性分析观察TPS和折扣变化对利润率的影响。同时,报告用Lambda.ai吞吐量基准、公司反馈和模型定价对比来校准假设。
方法论与常识提炼
每百万token收入与推理成本模型
用输入/输出token价格、输入输出长度比、KV cache折扣、商业折扣、TPS、GPU利用率和GPU小时成本估算每百万token收入、成本与推理毛利率。
TPS与商业折扣敏感性分析
通过调整tokens per second和混合商业折扣,观察Minimax M2.5/M2.7与Z.ai GLM-5/5.1的隐含利润率变化。
前沿智能与低成本轻量模型竞争
报告区分前沿高能力模型与轻量低成本模型,认为前沿智能仍是长期胜负关键,而轻量模型价格竞争会更激烈。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Tencent Holdings Ltd / 700.HK覆盖公司与AI应用/模型迭代观察对象
- 优势
- 评级Outperform,目标价HK$780;广告业务AI应用反馈积极,hy3-preview显示模型迭代方向改善。
- 劣势
- hy3-preview更像阶段性产品,市场仍等待更强模型和微信agentic功能进展。
- 对比
- 相对DeepSeek、Z.ai、Kimi等国内AI同业,腾讯仍需证明自研模型迭代速度。
- 风险
- 宏观消费、用户参与度、游戏和广告竞争、反垄断等监管风险。
- Alibaba / BABA / 9988.HK覆盖公司与中国互联网AI生态相关标的
- 优势
- 评级Outperform,目标价US$180/HK$176;云业务和AI投资组合是估值支撑。
- 劣势
- 创新业务亏损和核心电商竞争仍影响利润可见度。
- 对比
- 报告提到阿里投资Kimi和Minimax,与腾讯可能主导DeepSeek融资形成生态对比。
- 风险
- 宏观消费、平台用户参与度、竞争、监管以及创新业务亏损。
- Z.ai GLM-5/GLM-5.1AI实验室模型利润率比较对象
- 优势
- 在可比折扣和TPS假设下,报告认为GLM系列可能具备较高推理利润率。
- 劣势
- 利润率对TPS、商业折扣和工作负载组合高度敏感。
- 对比
- 相对Minimax,利润率优势仍存在但较此前估计收窄。
- 风险
- 价格竞争、折扣扩大、吞吐量假设不达预期。
- Minimax M2.5/M2.7AI推理利润率模型校准对象
- 优势
- 公司反馈显示M2.7文本/代码推理毛利率可达约40%,并拥有较高TPS假设支撑。
- 劣势
- 达到40%利润率需要较高TPS比率,模型对折扣和工作负载变化敏感。
- 对比
- M2.5单GPULambda基准吞吐量约为GLM-5的5.1倍,但Z.ai模型利润率仍可能更高。
- 风险
- 商业折扣扩大、文本/代码工作负载占比提升导致收入结构不如多模态。
- DeepSeek V4中国AI前沿能力与价格竞争观察对象
- 优势
- 接近数月前全球SOTA且成本较低,开源/开放权重有助于提升中国AI实验室整体能力。
- 劣势
- 与国内同业的能力差距收窄,低价策略可能削弱定价能力。
- 对比
- V4-Pro定价接近GLM-5.1、Qwen3.6 Max等国内领先模型;V4-Flash接近轻量低成本模型价格下沿。
- 风险
- 低价和限时折扣加剧行业竞争,长期盈利能力仍待验证。
关键数据
- Minimax M2.7基础情景推理利润率42.5%基于20%商业折扣、TPS 9,000、GPU利用率90%、GPU成本每小时$1.6的模型假设。
- Z.ai GLM-5.1基础情景推理利润率50.3%报告认为在可比折扣假设下,GLM系列仍可能高于Minimax模型利润率。
- Z.ai GLM-5基础情景推理利润率33.9%基于报告更新后的token经济模型。
- Minimax M2.5基础情景推理利润率29.5%报告上调H1 2026 TPS假设后得到的基础情景。
- GPU成本假设$1.6/GPU-hour公司反馈认为该估计大体合理,报告假设头部中国AI实验室GPU成本大体相似。
- 商业折扣基础假设20%报告新增商业折扣变量,并提示客户结构和限时促销会显著影响每token收入。
- Lambda.ai吞吐量基准M2.5约4,031 tok/s/GPU;GLM-5约788 tok/s/GPU按报告口径,M2.5单GPU吞吐量约为GLM-5的5.1倍。
- 腾讯目标价HK$780基于20x FY+1 PE估值;评级Outperform。
- 阿里巴巴目标价US$180/HK$176基于核心电商和云业务FY+1收入与利润的SOTP估值;评级Outperform。
影响与含义
投资含义是,中国AI模型能力与商业化竞争仍在快速演进,推理利润率不能只看标价,还要结合TPS、折扣、工作负载和GPU利用率。对互联网龙头而言,前沿模型能力、AI基础设施迭代速度、应用层分发入口和商业化效率将影响中长期估值叙事;但低成本模型价格战、商业折扣和监管/宏观风险会压制利润可见度。
风险
- 低成本轻量AI模型价格竞争加剧,压低每百万token收入。
- 商业折扣、客户结构和限时促销会使外部利润率估算偏离实际财务结果。
- TPS、GPU利用率、KV cache命中率等关键假设难以从外部精确验证。
- 中国互联网龙头仍面临宏观消费、监管、平台竞争和用户参与度波动风险。
- AI实验室成本在销售成本、研发费用和营销费用之间的归类可能影响可比性。
后续跟踪
- Minimax、Z.ai等AI实验室后续披露的实际推理利润率与折扣水平。
- DeepSeek V4后续采用情况、价格策略以及潜在融资安排。
- 腾讯hy3-preview后续正式版本和更大模型发布节奏。
- 腾讯AI数据与基础设施组织重建是否带来更快模型迭代。
- 多模态、视频生成、文本转语音与文本/代码工作负载占比变化。
- 中国互联网公司AI在广告、游戏、微信生态和云业务中的商业化进展。