Kimi K3

中国的Fable 5时刻——优秀国产模型向全球前沿模型发起的一次正面冲击

Kimi K3

Kimi K3不是一次常规版本升级,而是月之暗面从“优秀国产模型”向“全球前沿模型”发起的一次正面冲击。

综合官方基准、Artificial Analysis独立评测、Arena与媒体披露的数据,Kimi K3目前大致处于以下位置:

综合能力进入全球第一梯队,但尚未稳定超过最顶级闭源模型;代码智能体、长任务执行、网页前端、搜索和知识工作是其突出强项,速度、输出成本、冗长程度和复杂专业任务的可靠性仍是主要短板。

综合评级:

维度 评价
综合智能 9.0/10
编程与软件工程 9.3/10
Agent与长任务 9.4/10
搜索及知识工作 9.2/10
多模态理解 8.8/10
数学与科学推理 8.6/10
中文能力 9.1/10
速度与延迟 7.6/10
成本效率 7.8/10
输出稳定性 8.0/10
本地部署可行性 3.5/10

总体评分:8.8/10。

K3已经足以成为Claude、GPT之外的主力生产模型,尤其适合复杂编程、研究报告、网页构建、长文档分析和多工具Agent任务。

套餐价格与API价格对比

1.个人订阅套餐价格

套餐层级 Kimi OpenAI Anthropic
免费入门 Adagio
¥0
轻度体验
有限使用Kimi产品能力
ChatGPT Free
$0
基础体验
有限使用GPT-5.5 Instant
Claude Free
$0
基础体验
有限使用Claude能力
基础付费 Moderato
¥39
日常个人使用、轻量代码任务
包含Kimi会员与Kimi Code额度
ChatGPT Plus
$20
高级个人生产力
支持GPT-5.6系列高级推理能力,但有使用限制
Claude Pro
$20
日常专业生产力
包含Claude Code、Research等功能
高频进阶 Allegretto
¥79
较高频开发和Agent任务
更高周额度与并发
ChatGPT Pro 5x
$100
高频研究和编程
Pro能力,使用额度约为Plus的5倍
Claude Max 5x
$100
高频专业使用
每次会话约为Pro的5倍容量
重度/超重度 Allegro
¥159
重度开发及复杂项目
大幅提高Agent、Swarm与并发额度
ChatGPT Pro 20x
$200
极重度研究和编程
Pro能力,使用额度约为Plus的20倍
Claude Max 20x
$200
极重度专业使用
每次会话约为Pro的20倍容量
顶级个人档 Vivace
¥559
最高个人使用档位
最高周额度和并发
- -

Kimi的订阅价格整体与OpenAI和Anthropic形成直接对应:¥39对标 $20基础专业档,¥79对标 $100高用量档,¥159对标 $200最高个人档。Kimi的优势是同一会员同时覆盖网页端、Kimi Code、Agent、Swarm和部分部署功能;OpenAI和Anthropic则拥有更成熟的模型生态、工具链和国际开发者支持。

需要注意,三家均采用动态额度、周期重置和并发限制,月费相同不代表可用Token或可完成任务数量完全相同。Kimi主要以周额度及Agent次数计量,OpenAI和Anthropic则根据模型、功能和时间窗口实施不同限制。

2.最新旗舰模型API价格

单位:美元/100万Token,采用标准实时API价格。

厂商 最新旗舰模型 缓存命中输入 普通输入 输出 上下文窗口
Kimi Kimi K3 $0.30 $3.00 $15.00 100万Token
OpenAI GPT-5.6 Sol $0.50 $5.00 $30.00 长上下文请求适用更高费率
Anthropic Claude Fable 5 $1.00 $10.00 $50.00 100万Token
Anthropic Claude Opus 4.8 $0.50 $5.00 $25.00 100万Token
Anthropic Claude Sonnet 5(限时价) $0.20 $2.00 $10.00 100万Token

Claude Sonnet 5的 $2输入、 $10输出属于截至2026年8月31日的限时价格;自2026年9月1日起,标准价格将调整为 $3输入、 $15输出。

以Kimi K3为基准:

  • GPT-5.6 Sol普通输入价格约为K3的1.67倍,输出价格为2倍。
  • Claude Fable 5普通输入价格约为K3的3.33倍,输出价格约为3.33倍。
  • Claude Opus 4.8普通输入价格约为K3的1.67倍,输出价格约为1.67倍。
  • Claude Sonnet 5限时价格低于K3,但其定位更偏向速度与成本平衡,而非Anthropic最高能力型号。
  • K3的缓存输入价格仅为普通输入的10%。官方称编程工作负载中的缓存命中率可超过90%,在重复读取大型代码库时成本优势会进一步扩大。

3.API成本示例

假设一次复杂Agent任务消耗100万普通输入Token和20万输出Token,不考虑工具调用费、缓存及批处理折扣:

模型 输入成本 输出成本 合计
Kimi K3 $3.00 $3.00 $6.00
GPT-5.6 Sol $5.00 $6.00 $11.00
Claude Fable 5 $10.00 $10.00 $20.00
Claude Opus 4.8 $5.00 $5.00 $10.00
Claude Sonnet 5(限时价) $2.00 $2.00 $4.00

从纯Token价格看,K3明显低于GPT-5.6 Sol、Claude Opus 4.8和Claude Fable 5。但真实任务成本还取决于模型完成任务所需的输出长度、失败重试次数、工具调用次数和是否有效命中缓存。K3在部分独立评测中表现出较高的Token消耗,因此“单价较低”不必然等于“完成同一任务的总成本最低”。

官方价格来源:

模型定位与技术规格

月之暗面于2026年7月16日正式发布Kimi K3。官方将其定位为面向长周期编程、知识工作和深度推理的旗舰模型。

K3的核心规格包括:

  • 总参数量约 2.8万亿
  • MoE架构,896个专家中每次有效激活16个
  • 原生支持文本与图像输入
  • 上下文窗口达到 100万Token
  • 使用Kimi Delta Attention、Attention Residuals和Stable LatentMoE
  • 从监督微调阶段开始采用量化感知训练
  • API默认使用最高思考强度
  • 完整模型权重计划于2026年7月27日前发布

月之暗面称,新的架构和训练方法使K3相对于K2获得约2.5倍的整体Scaling效率提升。需要注意,这一数字属于官方内部测算,目前技术报告尚未完整公开,外界还不能复现验证。

来源:Kimi官方博客

官方主视觉

Kimi K3官方主视觉

独立综合评测:确实进入前沿梯队

Artificial Analysis给Kimi K3的Intelligence Index评分为 57分,当前页面显示其在同类模型中排名第4。该指数由GDPval-AA、Terminal-Bench、SciCode、Humanity’s Last Exam、GPQA Diamond、AA-Omniscience等九项评测组合而成,比单一数学或代码跑分更能反映综合能力。

来源:Artificial Analysis:Kimi K3

Artificial Analysis综合智能评分

Artificial Analysis Intelligence Index (17 Jul '26)

与上一代Kimi K2.6相比:

  • 综合指数从44提升到57,约提高30%
  • 输出速度从46 Token/s提升到62 Token/s
  • 首Token延迟从2.72秒降至1.99秒
  • 上下文从约26万Token提升至100万Token

这说明K3并不是单纯依赖更长推理提高分数,而是在智能、速度和上下文容量上同时进步。

来源:Artificial Analysis模型对比

不过,Artificial Analysis也发现K3存在明显效率问题:

  • 输出速度约62 Token/s,低于同档模型约72.7 Token/s的中位数
  • 完成整套综合评测输出了约1.3亿Token,接近同档模型中位数的两倍
  • 输入价格为3美元/百万Token
  • 输出价格为15美元/百万Token
  • 完成整套指数测试成本约2709.75美元

因此,K3的“智力性价比”不差,但并不是低成本或高吞吐模型。它更像一个愿意消耗更多推理Token换取成功率的旗舰Agent模型。

来源:Artificial Analysis:Kimi K3

编程能力:目前最具说服力的优势

K3最强的部分并不是传统算法题,而是真实软件工程和长周期Agent编程

官方公布的代码评测中:

测试 Kimi K3 主要对手表现 判断
DeepSWE 67.5 GPT-5.6 Sol 73.0、Fable 5 70.0 第一梯队,但不是第一
Terminal-Bench 2.1 88.3 GPT-5.6 Sol 88.8 几乎持平
FrontierSWE 81.2 Fable 5 86.6 明显强于多数模型
Program Bench 77.8 GPT-5.6 Sol 77.6 略微领先
SWE Marathon 42.0 Opus 4.8 40.0、GPT-5.6 Sol 39.0 排名第一
Kimi Code Bench 2.0 72.8 Fable 5 76.9 接近最强闭源模型

官方编程基准图

Kimi K3编程基准

这些结果表明,K3特别擅长:

  1. 在大型代码仓库中持续工作;
  2. 调用终端、编译器和测试工具;
  3. 长时间迭代而不是只生成一次代码;
  4. 将图像反馈加入网页、游戏和CAD开发过程;
  5. 处理需要数小时甚至数十小时的工程任务。

K3还展示了自主开发MiniTriton编译器、优化GPU Kernel、完成科研代码复现,以及在48小时内设计和验证简单AI芯片的案例。但这些案例主要由官方提供,环境、失败次数、人工介入程度尚未完全公开,因此应视为能力上限展示,而不是普通用户每次都能复现的稳定结果。

来源:Kimi官方博客

K3已经是全球最强的开源权重编程模型候选之一。在长周期编程任务上,它可能超过部分GPT和Claude型号;但在最困难的代码任务中,Fable 5和GPT-5.6 Sol仍有小幅领先。

Agent与知识工作:K3真正拉开差距的领域

K3在General Agent评测中的表现非常突出:

测试 Kimi K3 结果
GDPval-AA v2 Elo 1668 低于Fable 5和GPT-5.6 Sol,高于Opus 4.8
AA-Briefcase Elo 1548 接近Fable 5的1583
JobBench 52.9 仅低于Fable 5
SpreadsheetBench 2 34.8 略高于Fable 5
AutomationBench 30.8 官方比较中第一
BrowseComp 91.2 官方比较中第一

官方Agent基准图

Kimi K3 Agent与多模态基准

BrowseComp达到91.2尤其值得关注。该测试强调通过浏览器搜索、筛选信息和多步推理找到难以直接检索的答案。K3在100万Token、不进行上下文压缩时也取得90.4分,说明其超长上下文不是纯粹的宣传规格,而是能够在部分Agent场景中转化为实际效果。

来源:Kimi官方博客

官方内部知识工作测试中,K3在在线实验、PPT制作和金融分析上也超过GPT-5.5与Claude Opus 4.8。但这是内部数据,测试集和裁判细节没有完全公开,可信度低于第三方结果。

Kimi K3内部知识工作测试

Kimi K3内部知识工作测试

K3的核心竞争力是“完成一项工作”,而不只是“回答一道题”。在深度研究、网页搜索、表格、PPT、代码仓库和多工具调用场景中,它比普通聊天模型更有价值。

多模态能力:强,但当前重点仍是理解而非生成

K3支持原生视觉输入,可以理解图片、网页截图、图表和视频帧,并将视觉反馈用于代码修改。

官方结果显示:

  • CharXiv视觉图表推理:91.3
  • ZeroBench with tools Pass@5:44.0
  • 支持通过截图反复检查和修正网页、游戏及CAD结果

在CharXiv中,K3低于Fable 5的93.5,但高于Opus 4.8、GPT-5.6 Sol和GPT-5.5;在ZeroBench工具模式中,则仅低于Fable 5。

不过,K3目前仍是“图像输入、文本输出”模型,不应与原生图像生成或视频生成模型混为一谈。其多模态价值主要体现在视觉理解、图表分析、截图调试和Agent操作。

质疑与真实使用风险

1. 跑分受到Agent框架影响

K3使用KimiCode、Claude Code或其他Harness进行测试,而竞品可能使用Codex、Terminus等不同框架。Agent基准测到的是“模型+工具框架+提示词+上下文管理”的综合能力,不能完全归因于模型本身。

官方也明确披露,不同测试采用了不同Harness,部分Fable 5运行还可能回退至Opus 4.8。

来源:Kimi官方博客

2. 专业推理仍可能犯基础错误

沃顿商学院教授Ethan Mollick使用K3审查复杂统计研究时,发现其错误应用统计方法,并在多个环节产生问题。这说明K3即使能够生成结构完整、语言自信的长报告,也不代表核心方法一定正确。

来源:Business Insider相关报道

在法律、金融、医学、统计和科研场景中,必须要求:

  • 明确列出推导过程和数据来源;
  • 使用代码重新计算;
  • 对关键结论进行第二模型或人工复核;
  • 不因报告长度和格式完整而提高信任度。

3. 容易过度行动

月之暗面主动披露,K3为复杂长任务进行了强化训练,因此在面对模糊要求或小问题时,可能未经确认便替用户作出决定。对于会修改文件、执行代码、调用外部服务的Agent,这类“过度主动”是现实风险。

来源:Kimi官方博客

4. 对思考历史较敏感

K3采用保留式思考历史训练。如果Agent框架没有正确回传历史推理内容,或者用户在对话中途从其他模型切换到K3,输出质量可能出现明显波动。官方建议优先使用兼容的Kimi Code,并避免中途切换模型。

来源:Kimi官方博客

5. 参数开放不等于容易部署

2.8万亿参数即使采用16/896专家稀疏激活,也不适合普通工作站部署。官方建议使用至少64张加速卡组成的Supernode配置。路透社援引分析指出,完整本地运行可能需要价值数十万美元的硬件。

来源:Kimi官方博客

因此,K3的“开放权重”价值主要属于云服务商、研究机构和大型企业,而不是普通开发者的单机私有部署。

成本与产品实用性

K3官方API价格如下:

Token类型 官方美元价格 国内平台人民币价格
缓存命中输入 $0.30/百万Token ¥2/百万Token
普通输入 $3/百万Token ¥20/百万Token
输出 $15/百万Token ¥100/百万Token

官方称,在编程工作负载中,Mooncake推理架构的缓存命中率可超过90%。如果项目反复使用同一代码仓库或文档,缓存可以显著降低成本;若任务每次输入完全不同,价格优势会明显缩小。

来源:Kimi官方博客

适合使用K3的任务:

  • 大型代码库重构
  • 复杂网页或互动产品开发
  • 深度研究与多来源资料核验
  • 超长文档、财报、论文和合同分析
  • 表格、PPT和咨询报告制作
  • 多工具、多步骤自动化流程

不适合作为默认模型的任务:

  • 简单客服问答
  • 高频短文本生成
  • 对延迟极敏感的实时应用
  • 对输出成本极敏感的大规模批处理
  • 需要严格可控、不得自行扩展任务边界的自动化系统

最终定位

Kimi K3的真实水平可以概括为:

它不是全球绝对最强模型,但已经是最接近顶级闭源模型的开放权重模型之一,并在长周期编程、前端开发、搜索Agent和知识工作中达到甚至局部超过部分顶级闭源模型的水平。

与主要模型相比:

  • 对比Claude Fable 5:总体仍落后,部分代码、搜索和自动化任务接近或局部领先。
  • 对比GPT-5.6 Sol:综合体验和部分高难推理仍有差距,但Terminal、Program Bench和部分Agent任务已接近。
  • 对比Claude Opus 4.8:K3在多数公开编程和Agent评测中更强。
  • 对比GPT-5.5:K3大部分综合与工程测试更强。
  • 对比GLM-5.2、Qwen3.7 Max:K3综合智能和长任务能力领先,但成本及速度未必占优。
  • 对比Kimi K2.6:属于明显的代际升级,而不是小幅迭代。

目前最合理的评价不是“K3已经登顶全球”,而是:

中国模型首次在综合智能、复杂软件工程和Agent知识工作三个方向上,同时逼近全球最强闭源模型。

由于K3发布仅数日,完整技术报告、开放权重、更多第三方长周期测试和大规模真实用户反馈仍未完全出现。现阶段应对其能力保持高度认可,同时避免把官方案例和早期榜单当作稳定生产成功率。

参考资料

  1. Kimi K3官方博客
  2. Artificial Analysis:Kimi K3
  3. Artificial Analysis:Kimi K3与Kimi K2.6对比
  4. Reuters:Moonshot unveils Kimi K3
  5. Business Insider:Kimi K3外部评价
  6. Business Insider:Kimi K3模型、基准与价格
  7. Times of India:Kimi K3发布报道

KEEP READING