Kimi K3 能力超预期,中国 AI 模型成本效率优势继续强化
AI 摘要卡
Kimi K3 能力超预期,中国 AI 模型成本效率优势继续强化
Jefferies 认为 Moonshot AI 发布的开放 2.8T 模型 Kimi K3 在多项基准中排名靠前,并强化了中国模型在智能追赶、API 成本和 token 消耗增长中的投资线索。
- Kimi K3 被描述为首个开放 2.8T 模型,在 Artificial Analysis Index 中排名第 3,并在 Frontend Code Arena 中排名第 1。
- Kimi K3 面向长周期编码、知识工作和推理,具备 1M context 和原生多模态能力。
- 报告强调中国模型 DeepSeek、Qwen、Kimi、MiniMax 和 Zhipu 相比美国模型具备较强成本效率,API 成本仅为美国模型的一小部分。
- OpenRouter 数据显示 7月6日至7月12日当周总 token 消耗环比增长 12.6% 至 52.6tn,中国模型 token 消耗为 27.6tn,高于美国模型 6.3tn。
- 受益方向包括 Baidu、Alibaba、Tencent、Kingsoft Cloud、AI labs 和 Kling,核心逻辑是 AI 模型与 Agent 需求提升带动算力、云和应用生态。
研报解读
概览
本报告是 Jefferies AI Series 第 58 篇,围绕 Moonshot AI 发布 Kimi K3 后的模型能力、成本表现、全球基准排名、token 消耗和模型定价进行跟踪。报告认为 Kimi K3 的发布构成市场意外惊喜,体现中国模型在大参数、长上下文、代码能力、Agent 能力和成本效率上的快速迭代。
核心观点
核心观点是:中国大模型的能力与美国前沿模型差距正在收窄,同时在 API 成本、架构效率和 token 消耗增长方面呈现更强相对优势。Kimi K3 在 Artificial Analysis、Frontend Code Arena 以及编码、通用 Agent、视觉 Agent 等维度表现靠前;DeepSeek、Qwen、Kimi、MiniMax 和 Zhipu 等中国模型凭借 MoE、attention 机制和更高模型算力利用率获得成本优势。需求端,OpenRouter token 消耗回升,尤其中国模型消耗规模超过美国模型,对 BAT、Kingsoft Cloud、AI labs 和 Kling 等生态参与者形成正面催化。
分析框架
报告采用行业数据跟踪方式,综合模型基准测试、API 输入输出价格、OpenRouter token 消耗、Token Expenditure Index、模型架构说明和中美模型横向比较,评估 Kimi K3 及中国 AI 模型生态的竞争力。
方法论与常识提炼
多维智能评估
该指数整合 GDPval-AA v2、t-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 等 9 项评估,用于比较全球前沿模型的综合智能水平。
token 消耗量
报告用 OpenRouter 的周度 token 消耗衡量模型使用强度,并比较中国模型、美国模型及具体模型的使用排名。
按模型使用结构加权的支出指数
指数随用户需求向高价模型迁移而上升,报告将其用于观察模型需求是否转向高端或高成本服务。
每百万 tokens 输入与输出价格
报告比较 Kimi K3 与全球模型的输入、输出 API 价格,以判断相同能力下的成本表现。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Moonshot AI / Kimi K3核心研究对象
- 优势
- 具备开放 2.8T 参数规模、1M context、原生多模态、较强编码与 Agent 能力,并在多个基准测试中排名靠前。
- 劣势
- 报告未提供商业化收入、用户留存或盈利能力数据,模型权重完整发布仍需等待 7月27日。
- 对比
- 在 Artificial Analysis Index 中排名第 3,落后于 Fable5 和 GPT-5.6 Sol(Max),但在 Frontend Code Arena 中排名第 1。
- 风险
- 如果后续真实开发者采用、API 稳定性或模型权重开放效果不及预期,市场对其能力突破的定价可能回落。
- DeepSeek、Qwen、Kimi、MiniMax、Zhipu中国高性价比模型阵营
- 优势
- 凭借 MoE、GQA、sparse attention、linear attention 和 MLU 等架构优化,API 成本较美国模型更低,智能差距持续收窄。
- 劣势
- 全球顶级模型能力仍由 Anthropic、Google、OpenAI 等美国公司占据重要位置,部分高端 benchmark 仍有追赶空间。
- 对比
- 报告称中国模型 API 成本仅为美国模型的一小部分,并引用 Stanford AI Index 指出美国顶级模型领先中国模型 2.7%。
- 风险
- 价格竞争可能压缩模型服务利润率,且监管、算力供给和海外生态接入仍是不确定因素。
- Baidu、Alibaba、Tencent、Kingsoft Cloud潜在受益云服务商与互联网平台
- 优势
- AI 模型与 Agent 使用增长将增加算力、云服务和模型托管需求,大型平台具备基础设施和客户基础优势。
- 劣势
- 报告未逐家公司给出收入敏感性、利润弹性或评级变化。
- 对比
- 相较纯模型公司,云服务商可能更直接受益于 token 消耗和企业工作流部署增长。
- 风险
- 如果 token 消耗增长不能转化为付费 API 或云收入,或企业设置员工 token 消耗上限,业绩兑现可能低于预期。
- Kling 与视频生成模型生态AI 应用需求受益方向
- 优势
- 视频生成模型定价与会员方案被纳入报告跟踪,显示多模态和内容生成仍是应用层重要场景。
- 劣势
- 报告中的视频生成价格表信息较碎片化,缺少明确市场份额和盈利指标。
- 对比
- 与通用 LLM 相比,视频生成应用更依赖单位视频成本、会员转化和内容创作需求。
- 风险
- 视频生成价格竞争、推广折扣和模型成本下降可能影响商业化质量。
关键数据
- Kimi K3 参数规模2.8T报告称 Moonshot AI 发布首个开放 2.8T 模型 Kimi K3。
- Kimi K3 Artificial Analysis 排名No. 3位列 Fable5 和 GPT-5.6 Sol(Max) 之后。
- Kimi K3 Frontend Code Arena 排名No. 1报告认为该排名凸显其前端代码能力。
- Kimi K3 context1M context同时具备原生多模态能力。
- Delta Attention 解码效率最高 6.3x报告称在百万 token 上下文中可实现最高 6.3 倍更快解码。
- Attention Residuals 训练效率高 25%额外成本低于 2%。
- 总体 scaling efficiency较 K2 提升 2.5x报告将其归因于架构更新与 Stable LatentMoE 框架。
- OpenRouter 总 token 消耗52.6tn7月6日至7月12日当周环比增长 12.6%。
- 中国模型 token 消耗27.6tn7月6日至7月12日当周,较前一周增长 17.7%。
- 美国模型 token 消耗6.3tn报告指出中国模型在 OpenRouter token 消耗上超过美国模型。
- Token Expenditure Index1.57-1.617月12日当周区间,低于7月5日当周的 1.63-1.65,也低于5月31日的 2.04。
- OpenRouter 模型 token 排名Hy3(free) 6.13T、MiMo-V2.5 5.95T、DeepSeek V4 Flash 5.22T对应最新周排名前三。
- Stanford AI Index 领先差距2.7%报告引用 2026 Stanford AI Index Report 称美国顶级模型领先中国模型 2.7%。
影响与含义
投资含义在于,Kimi K3 的发布强化了中国 AI 模型在全球前沿模型竞争中的可见度,且成本效率优势可能推动更多开发者、企业和 Agent 工作流采用中国模型。token 消耗上升将带动云计算资源、模型 API 调用、AI Agent、代码工作流和内容生成需求,利好云服务商、模型实验室以及视频生成等应用层公司。
风险
- 模型 benchmark 表现可能无法完全代表真实生产环境中的稳定性、延迟、开发者体验和企业部署效果。
- 中国模型的成本优势可能引发更激烈价格竞争,导致 API 收入增长与利润率改善不同步。
- 企业对员工 token 消耗设置上限可能抑制高端模型支出和 Token Expenditure Index 回升。
- 模型能力快速迭代可能缩短单一模型领先窗口,Kimi K3 的市场惊喜需要后续使用量和生态采用验证。
- 中美模型比较涉及数据来源、评价框架和样本差异,排名变化可能带来市场预期波动。
后续跟踪
- Kimi K3 完整模型权重于 7月27日发布后的开发者采用和真实应用反馈。
- OpenRouter 后续周度 token 消耗是否延续增长,以及中国模型相对美国模型的份额变化。
- Token Expenditure Index 是否继续走弱,或因高端模型需求恢复而回升。
- DeepSeek、Qwen、Kimi、MiniMax、Zhipu 等中国模型在 Artificial Analysis 与代码、Agent、视觉任务中的排名变化。
- Baidu、Alibaba、Tencent、Kingsoft Cloud 等公司是否在财报或运营数据中体现 AI token 消耗增长带来的云收入贡献。
- 模型 API 与视频生成服务的价格调整、促销结束后的真实付费需求和单位经济性。