K3发布后,中国AI模型智能差距继续收窄,BABA全栈能力被重申看好
AI 摘要卡
K3发布后,中国AI模型智能差距继续收窄,BABA全栈能力被重申看好
Jefferies梳理K3发布后的七项观察,核心是中国大模型参数规模、智能水平和成本效率继续提升,云与应用侧需求有望受益。
- K3在多项智能指标中进入领先位置,投资者关注点从单点突破转向中美模型智能差距收窄。
- 中国模型在API价格和成本效率上相对美国模型更具优势,Token Expenditure Index仍偏软,使高性价比模型的重要性上升。
- Moonshot AI管理层称K3仍远未达到模型智能上限,K3发布后次日ARR增速达到最快。
- Zhipu认为Scaling Law仍在数据、环境、RL和基础设施多维度加速,GLM-5.2若扩展到K3量级有望超过K3能力。
- 应用侧Tencent WorkBuddy获得更多使用 traction;BABA、Baidu、Kingsoft Office等公司也在WAIC或产品会中展示AI应用。
- 报告重申看好BABA模型、云、芯片和应用的全栈能力。
研报解读
概览
本报告围绕K3发布后的中国AI模型、云服务和应用生态展开,提供模型价格、中美价格对比、Artificial Analysis智能指数、OpenRouter token消费、Token Expenditure Index等数据点。报告认为,中国模型在智能水平上继续接近美国前沿模型,同时在API成本和模型效率上具备显著优势;在应用端,企业AI和智能体工具开始体现 traction。
核心观点
核心观点包括:第一,K3达到新的智能里程碑,但Moonshot AI认为模型智能远未到上限;第二,更多T级参数中国模型即将推出,包括Qwen 3.8、MiniMax M3 Pro、Zhipu GLM和Tencent Hy4;第三,近期AI Lab融资和Kingsoft Cloud展望显示算力仍是焦点;第四,Token Expenditure Index走弱强化了高性价比模型在Coding和Agentic AI中的重要性;第五,视频生成模型格局暂未出现明显变化;第六,Tencent WorkBuddy在应用侧获得 traction;第七,BABA因模型、云、芯片和应用的全栈能力被重申看好。
分析框架
报告采用行业数据交叉验证的方法,将模型智能指数、模型参数规模、API输入输出价格、token消费趋势、公司电话会与行业会议信息结合,用于判断中国AI模型与美国模型的差距、成本效率、算力需求和应用商业化进展。
方法论与常识提炼
九项评测综合智能指数
该指数纳入GDPval-AA v2、t-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience和AA-LCR,用于比较不同AI模型的综合智能表现。
模型智能与混合API价格对比
报告将模型智能水平与输入、输出及缓存价格结合,评估中国模型相对美国模型的性价比和商业化可用性。
Token支出指数
该指数用于观察LLM token支出趋势;报告指出7月12日当周指数区间为1.56至1.61,低于5月31日的2.04。
前端代码能力与Arena Elo排名
报告引用Arena和Stanford AI Index数据,说明中国模型在前端代码等指标上与美国模型差距收窄。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Alibaba Group Holding Limited (BABA)报告重申BUY,并认为其在模型、云、芯片和应用上具备全栈能力。
- 优势
- Qwen模型迭代、开源权重、云与应用分发能力形成组合优势。
- 劣势
- 报告未给出具体目标价或上行空间,短期商业化仍需观察ARR和应用采用情况。
- 对比
- 相较单一模型公司,BABA被认为在全栈能力上更突出。
- 风险
- 模型竞争加剧、token成本变化、云需求兑现不及预期。
- Kingsoft Cloud (KC)报告提及因供应约束和6月资本开支节奏调整2Q收入预期。
- 优势
- AI算力和云需求增长可能带来收入机会。
- 劣势
- 供应约束对短期收入确认构成压力。
- 对比
- 与AI Lab融资受益逻辑类似,KC更直接暴露于云基础设施供给能力。
- 风险
- capex节奏、供应链约束和客户需求波动。
- Tencent Holdings Ltd. (700 HK)报告关注Tencent WorkBuddy traction,并提及Hy4后续模型。
- 优势
- WorkBuddy桌面月访问量达到8.85m,应用侧用户指标领先部分同业工具。
- 劣势
- 报告未提供完整收入转化数据。
- 对比
- WorkBuddy被指领先Trae、QClaw和Qoder Work等产品。
- 风险
- 企业AI应用转化率、竞品追赶和模型更新节奏。
- Moonshot AI / Kimi K3报告将K3作为模型智能突破和行业情绪变化的核心事件。
- 优势
- K3接近全球前沿模型,发布后ARR次日增速最快,参数规模达到2.8T。
- 劣势
- 平均速度20 TpS低于GLM-5.2表格中的平均60 TpS。
- 对比
- GLM-5.2参数更少、价格更低,但K3在规模和多模态上下文上更突出。
- 风险
- 后续模型迭代、成本控制、开源权重发布后的竞争格局。
- Zhipu GLM报告总结Zhipu电话会观点,强调Scaling Law和GLM-5.2能力。
- 优势
- GLM-5.2具备1M上下文、较低API价格和更高平均速度,并强调基础设施效率。
- 劣势
- 当前参数规模低于K3。
- 对比
- 若扩展至K3量级,Zhipu认为GLM-5.2可超过K3能力。
- 风险
- 规模扩展、训练成本、RL和基础设施优化落地。
关键数据
- Kimi K3总参数2.8T报告表格列示Kimi-3总参数为2.8T。
- DeepSeek-V4-Pro总参数1.6T报告列示DeepSeek-V4-Pro总参数为1.6T。
- Qwen3.7Max总参数1.2T报告列示Qwen3.7Max总参数为1.2T,并提及Qwen 3.8、2.4T模型即将发布。
- GLM-5.2总参数744BGLM-5.2参数少于K3,但Zhipu认为扩展到K3量级后有望超过K3能力。
- MiniMax M3总参数428B报告列示MiniMax M3总参数为428B,并提及MiniMax M3 Pro值得期待。
- Hy3总参数295B报告列示Hy3总参数为295B,并提及Tencent Hy4后续值得关注。
- GLM-5.2 API价格RMB2/8/28;USD0.26/1.4/4.4表格口径为cache/input/output价格。
- Kimi K3 API价格RMB2/20/100;USD0.3/3.0/15.0表格口径为cache/input/output价格。
- Token Expenditure Index1.56-1.617月12日当周区间,低于7月5日当周1.63-1.65及5月31日2.04。
- WorkBuddy桌面月访问量8.85mAnalysys数据,时间为2026年3月。
- 近期AI Lab融资DeepSeek USD7bn;Zhipu USD4bn;MiniMax USD2bn报告称融资可强化相关公司的算力需求。
影响与含义
报告的投资含义是,中国AI模型的智能与成本效率同时改善,可能提升中国互联网平台、云厂商和AI应用公司的竞争力。算力约束和资本开支仍是云收入兑现的重要变量,而应用侧如WorkBuddy、Meoo、Baidu Drive、Baidu Wenku、小度、WPS AI Hub等产品进展将决定AI能力能否转化为ARR和用户增长。
风险
- 算力供给和capex节奏可能限制云收入兑现。
- Token Expenditure Index持续偏软,可能反映需求或支出强度不足。
- 中国与美国模型竞争快速变化,当前智能差距收窄不等于长期领先。
- 视频生成模型短期未见明显格局变化,相关商业化优先级可能低于模型智能。
- 企业AI应用 traction 需要继续转化为ARR和付费客户,当前部分指标仍偏运营数据。
- Jefferies披露其与部分覆盖公司存在投行业务或服务关系,投资者需注意潜在利益冲突。
后续跟踪
- Kimi K3发布后的ARR持续性和开源权重发布影响。
- Qwen 3.8、MiniMax M3 Pro、Zhipu GLM和Tencent Hy4等后续模型发布。
- BABA在Qwen、云、芯片和企业应用上的协同进展。
- Kingsoft Cloud供应约束缓解和capex落地节奏。
- WorkBuddy、Meoo、Baidu AI应用、WPS AI Hub等企业AI应用的活跃度与收入转化。
- Token Expenditure Index和OpenRouter token消费是否恢复增长。
- 中国模型相对美国模型的API价格、智能指数和Coding/Agent任务成本变化。