Kimi K3
中国的Fable 5时刻——优秀国产模型向全球前沿模型发起的一次正面冲击

Kimi K3不是一次常规版本升级,而是月之暗面从“优秀国产模型”向“全球前沿模型”发起的一次正面冲击。
综合官方基准、Artificial Analysis独立评测、Arena与媒体披露的数据,Kimi K3目前大致处于以下位置:
综合能力进入全球第一梯队,但尚未稳定超过最顶级闭源模型;代码智能体、长任务执行、网页前端、搜索和知识工作是其突出强项,速度、输出成本、冗长程度和复杂专业任务的可靠性仍是主要短板。
综合评级:
| 维度 | 评价 |
|---|---|
| 综合智能 | 9.0/10 |
| 编程与软件工程 | 9.3/10 |
| Agent与长任务 | 9.4/10 |
| 搜索及知识工作 | 9.2/10 |
| 多模态理解 | 8.8/10 |
| 数学与科学推理 | 8.6/10 |
| 中文能力 | 9.1/10 |
| 速度与延迟 | 7.6/10 |
| 成本效率 | 7.8/10 |
| 输出稳定性 | 8.0/10 |
| 本地部署可行性 | 3.5/10 |
总体评分:8.8/10。
K3已经足以成为Claude、GPT之外的主力生产模型,尤其适合复杂编程、研究报告、网页构建、长文档分析和多工具Agent任务。
套餐价格与API价格对比
1.个人订阅套餐价格
| 套餐层级 | Kimi | OpenAI | Anthropic |
|---|---|---|---|
| 免费入门 | Adagio ¥0 轻度体验 有限使用Kimi产品能力 |
ChatGPT Free $0 基础体验 有限使用GPT-5.5 Instant |
Claude Free $0 基础体验 有限使用Claude能力 |
| 基础付费 | Moderato ¥39 日常个人使用、轻量代码任务 包含Kimi会员与Kimi Code额度 |
ChatGPT Plus $20 高级个人生产力 支持GPT-5.6系列高级推理能力,但有使用限制 |
Claude Pro $20 日常专业生产力 包含Claude Code、Research等功能 |
| 高频进阶 | Allegretto ¥79 较高频开发和Agent任务 更高周额度与并发 |
ChatGPT Pro 5x $100 高频研究和编程 Pro能力,使用额度约为Plus的5倍 |
Claude Max 5x $100 高频专业使用 每次会话约为Pro的5倍容量 |
| 重度/超重度 | Allegro ¥159 重度开发及复杂项目 大幅提高Agent、Swarm与并发额度 |
ChatGPT Pro 20x $200 极重度研究和编程 Pro能力,使用额度约为Plus的20倍 |
Claude Max 20x $200 极重度专业使用 每次会话约为Pro的20倍容量 |
| 顶级个人档 | Vivace ¥559 最高个人使用档位 最高周额度和并发 |
- | - |
Kimi的订阅价格整体与OpenAI和Anthropic形成直接对应:¥39对标 $20基础专业档,¥79对标 $100高用量档,¥159对标 $200最高个人档。Kimi的优势是同一会员同时覆盖网页端、Kimi Code、Agent、Swarm和部分部署功能;OpenAI和Anthropic则拥有更成熟的模型生态、工具链和国际开发者支持。
需要注意,三家均采用动态额度、周期重置和并发限制,月费相同不代表可用Token或可完成任务数量完全相同。Kimi主要以周额度及Agent次数计量,OpenAI和Anthropic则根据模型、功能和时间窗口实施不同限制。
2.最新旗舰模型API价格
单位:美元/100万Token,采用标准实时API价格。
| 厂商 | 最新旗舰模型 | 缓存命中输入 | 普通输入 | 输出 | 上下文窗口 |
|---|---|---|---|---|---|
| Kimi | Kimi K3 | $0.30 | $3.00 | $15.00 | 100万Token |
| OpenAI | GPT-5.6 Sol | $0.50 | $5.00 | $30.00 | 长上下文请求适用更高费率 |
| Anthropic | Claude Fable 5 | $1.00 | $10.00 | $50.00 | 100万Token |
| Anthropic | Claude Opus 4.8 | $0.50 | $5.00 | $25.00 | 100万Token |
| Anthropic | Claude Sonnet 5(限时价) | $0.20 | $2.00 | $10.00 | 100万Token |
Claude Sonnet 5的 $2输入、 $10输出属于截至2026年8月31日的限时价格;自2026年9月1日起,标准价格将调整为 $3输入、 $15输出。
以Kimi K3为基准:
- GPT-5.6 Sol普通输入价格约为K3的1.67倍,输出价格为2倍。
- Claude Fable 5普通输入价格约为K3的3.33倍,输出价格约为3.33倍。
- Claude Opus 4.8普通输入价格约为K3的1.67倍,输出价格约为1.67倍。
- Claude Sonnet 5限时价格低于K3,但其定位更偏向速度与成本平衡,而非Anthropic最高能力型号。
- K3的缓存输入价格仅为普通输入的10%。官方称编程工作负载中的缓存命中率可超过90%,在重复读取大型代码库时成本优势会进一步扩大。
3.API成本示例
假设一次复杂Agent任务消耗100万普通输入Token和20万输出Token,不考虑工具调用费、缓存及批处理折扣:
| 模型 | 输入成本 | 输出成本 | 合计 |
|---|---|---|---|
| Kimi K3 | $3.00 | $3.00 | $6.00 |
| GPT-5.6 Sol | $5.00 | $6.00 | $11.00 |
| Claude Fable 5 | $10.00 | $10.00 | $20.00 |
| Claude Opus 4.8 | $5.00 | $5.00 | $10.00 |
| Claude Sonnet 5(限时价) | $2.00 | $2.00 | $4.00 |
从纯Token价格看,K3明显低于GPT-5.6 Sol、Claude Opus 4.8和Claude Fable 5。但真实任务成本还取决于模型完成任务所需的输出长度、失败重试次数、工具调用次数和是否有效命中缓存。K3在部分独立评测中表现出较高的Token消耗,因此“单价较低”不必然等于“完成同一任务的总成本最低”。
官方价格来源:
- Kimi K3官方发布与API价格
- Kimi会员与Kimi Code套餐
- ChatGPT Plus价格说明
- ChatGPT Pro档位说明
- OpenAI API价格
- Claude个人套餐价格
- Claude API价格
模型定位与技术规格
月之暗面于2026年7月16日正式发布Kimi K3。官方将其定位为面向长周期编程、知识工作和深度推理的旗舰模型。
K3的核心规格包括:
- 总参数量约 2.8万亿
- MoE架构,896个专家中每次有效激活16个
- 原生支持文本与图像输入
- 上下文窗口达到 100万Token
- 使用Kimi Delta Attention、Attention Residuals和Stable LatentMoE
- 从监督微调阶段开始采用量化感知训练
- API默认使用最高思考强度
- 完整模型权重计划于2026年7月27日前发布
月之暗面称,新的架构和训练方法使K3相对于K2获得约2.5倍的整体Scaling效率提升。需要注意,这一数字属于官方内部测算,目前技术报告尚未完整公开,外界还不能复现验证。
来源:Kimi官方博客
官方主视觉
独立综合评测:确实进入前沿梯队
Artificial Analysis给Kimi K3的Intelligence Index评分为 57分,当前页面显示其在同类模型中排名第4。该指数由GDPval-AA、Terminal-Bench、SciCode、Humanity’s Last Exam、GPQA Diamond、AA-Omniscience等九项评测组合而成,比单一数学或代码跑分更能反映综合能力。
来源:Artificial Analysis:Kimi K3
Artificial Analysis综合智能评分
与上一代Kimi K2.6相比:
- 综合指数从44提升到57,约提高30%
- 输出速度从46 Token/s提升到62 Token/s
- 首Token延迟从2.72秒降至1.99秒
- 上下文从约26万Token提升至100万Token
这说明K3并不是单纯依赖更长推理提高分数,而是在智能、速度和上下文容量上同时进步。
不过,Artificial Analysis也发现K3存在明显效率问题:
- 输出速度约62 Token/s,低于同档模型约72.7 Token/s的中位数
- 完成整套综合评测输出了约1.3亿Token,接近同档模型中位数的两倍
- 输入价格为3美元/百万Token
- 输出价格为15美元/百万Token
- 完成整套指数测试成本约2709.75美元
因此,K3的“智力性价比”不差,但并不是低成本或高吞吐模型。它更像一个愿意消耗更多推理Token换取成功率的旗舰Agent模型。
来源:Artificial Analysis:Kimi K3
编程能力:目前最具说服力的优势
K3最强的部分并不是传统算法题,而是真实软件工程和长周期Agent编程。
官方公布的代码评测中:
| 测试 | Kimi K3 | 主要对手表现 | 判断 |
|---|---|---|---|
| DeepSWE | 67.5 | GPT-5.6 Sol 73.0、Fable 5 70.0 | 第一梯队,但不是第一 |
| Terminal-Bench 2.1 | 88.3 | GPT-5.6 Sol 88.8 | 几乎持平 |
| FrontierSWE | 81.2 | Fable 5 86.6 | 明显强于多数模型 |
| Program Bench | 77.8 | GPT-5.6 Sol 77.6 | 略微领先 |
| SWE Marathon | 42.0 | Opus 4.8 40.0、GPT-5.6 Sol 39.0 | 排名第一 |
| Kimi Code Bench 2.0 | 72.8 | Fable 5 76.9 | 接近最强闭源模型 |
官方编程基准图
这些结果表明,K3特别擅长:
- 在大型代码仓库中持续工作;
- 调用终端、编译器和测试工具;
- 长时间迭代而不是只生成一次代码;
- 将图像反馈加入网页、游戏和CAD开发过程;
- 处理需要数小时甚至数十小时的工程任务。
K3还展示了自主开发MiniTriton编译器、优化GPU Kernel、完成科研代码复现,以及在48小时内设计和验证简单AI芯片的案例。但这些案例主要由官方提供,环境、失败次数、人工介入程度尚未完全公开,因此应视为能力上限展示,而不是普通用户每次都能复现的稳定结果。
来源:Kimi官方博客
K3已经是全球最强的开源权重编程模型候选之一。在长周期编程任务上,它可能超过部分GPT和Claude型号;但在最困难的代码任务中,Fable 5和GPT-5.6 Sol仍有小幅领先。
Agent与知识工作:K3真正拉开差距的领域
K3在General Agent评测中的表现非常突出:
| 测试 | Kimi K3 | 结果 |
|---|---|---|
| GDPval-AA v2 Elo | 1668 | 低于Fable 5和GPT-5.6 Sol,高于Opus 4.8 |
| AA-Briefcase Elo | 1548 | 接近Fable 5的1583 |
| JobBench | 52.9 | 仅低于Fable 5 |
| SpreadsheetBench 2 | 34.8 | 略高于Fable 5 |
| AutomationBench | 30.8 | 官方比较中第一 |
| BrowseComp | 91.2 | 官方比较中第一 |
官方Agent基准图
BrowseComp达到91.2尤其值得关注。该测试强调通过浏览器搜索、筛选信息和多步推理找到难以直接检索的答案。K3在100万Token、不进行上下文压缩时也取得90.4分,说明其超长上下文不是纯粹的宣传规格,而是能够在部分Agent场景中转化为实际效果。
来源:Kimi官方博客
官方内部知识工作测试中,K3在在线实验、PPT制作和金融分析上也超过GPT-5.5与Claude Opus 4.8。但这是内部数据,测试集和裁判细节没有完全公开,可信度低于第三方结果。
Kimi K3内部知识工作测试
K3的核心竞争力是“完成一项工作”,而不只是“回答一道题”。在深度研究、网页搜索、表格、PPT、代码仓库和多工具调用场景中,它比普通聊天模型更有价值。
多模态能力:强,但当前重点仍是理解而非生成
K3支持原生视觉输入,可以理解图片、网页截图、图表和视频帧,并将视觉反馈用于代码修改。
官方结果显示:
- CharXiv视觉图表推理:91.3
- ZeroBench with tools Pass@5:44.0
- 支持通过截图反复检查和修正网页、游戏及CAD结果
在CharXiv中,K3低于Fable 5的93.5,但高于Opus 4.8、GPT-5.6 Sol和GPT-5.5;在ZeroBench工具模式中,则仅低于Fable 5。
不过,K3目前仍是“图像输入、文本输出”模型,不应与原生图像生成或视频生成模型混为一谈。其多模态价值主要体现在视觉理解、图表分析、截图调试和Agent操作。
质疑与真实使用风险
1. 跑分受到Agent框架影响
K3使用KimiCode、Claude Code或其他Harness进行测试,而竞品可能使用Codex、Terminus等不同框架。Agent基准测到的是“模型+工具框架+提示词+上下文管理”的综合能力,不能完全归因于模型本身。
官方也明确披露,不同测试采用了不同Harness,部分Fable 5运行还可能回退至Opus 4.8。
来源:Kimi官方博客
2. 专业推理仍可能犯基础错误
沃顿商学院教授Ethan Mollick使用K3审查复杂统计研究时,发现其错误应用统计方法,并在多个环节产生问题。这说明K3即使能够生成结构完整、语言自信的长报告,也不代表核心方法一定正确。
在法律、金融、医学、统计和科研场景中,必须要求:
- 明确列出推导过程和数据来源;
- 使用代码重新计算;
- 对关键结论进行第二模型或人工复核;
- 不因报告长度和格式完整而提高信任度。
3. 容易过度行动
月之暗面主动披露,K3为复杂长任务进行了强化训练,因此在面对模糊要求或小问题时,可能未经确认便替用户作出决定。对于会修改文件、执行代码、调用外部服务的Agent,这类“过度主动”是现实风险。
来源:Kimi官方博客
4. 对思考历史较敏感
K3采用保留式思考历史训练。如果Agent框架没有正确回传历史推理内容,或者用户在对话中途从其他模型切换到K3,输出质量可能出现明显波动。官方建议优先使用兼容的Kimi Code,并避免中途切换模型。
来源:Kimi官方博客
5. 参数开放不等于容易部署
2.8万亿参数即使采用16/896专家稀疏激活,也不适合普通工作站部署。官方建议使用至少64张加速卡组成的Supernode配置。路透社援引分析指出,完整本地运行可能需要价值数十万美元的硬件。
来源:Kimi官方博客
因此,K3的“开放权重”价值主要属于云服务商、研究机构和大型企业,而不是普通开发者的单机私有部署。
成本与产品实用性
K3官方API价格如下:
| Token类型 | 官方美元价格 | 国内平台人民币价格 |
|---|---|---|
| 缓存命中输入 | $0.30/百万Token | ¥2/百万Token |
| 普通输入 | $3/百万Token | ¥20/百万Token |
| 输出 | $15/百万Token | ¥100/百万Token |
官方称,在编程工作负载中,Mooncake推理架构的缓存命中率可超过90%。如果项目反复使用同一代码仓库或文档,缓存可以显著降低成本;若任务每次输入完全不同,价格优势会明显缩小。
来源:Kimi官方博客
适合使用K3的任务:
- 大型代码库重构
- 复杂网页或互动产品开发
- 深度研究与多来源资料核验
- 超长文档、财报、论文和合同分析
- 表格、PPT和咨询报告制作
- 多工具、多步骤自动化流程
不适合作为默认模型的任务:
- 简单客服问答
- 高频短文本生成
- 对延迟极敏感的实时应用
- 对输出成本极敏感的大规模批处理
- 需要严格可控、不得自行扩展任务边界的自动化系统
最终定位
Kimi K3的真实水平可以概括为:
它不是全球绝对最强模型,但已经是最接近顶级闭源模型的开放权重模型之一,并在长周期编程、前端开发、搜索Agent和知识工作中达到甚至局部超过部分顶级闭源模型的水平。
与主要模型相比:
- 对比Claude Fable 5:总体仍落后,部分代码、搜索和自动化任务接近或局部领先。
- 对比GPT-5.6 Sol:综合体验和部分高难推理仍有差距,但Terminal、Program Bench和部分Agent任务已接近。
- 对比Claude Opus 4.8:K3在多数公开编程和Agent评测中更强。
- 对比GPT-5.5:K3大部分综合与工程测试更强。
- 对比GLM-5.2、Qwen3.7 Max:K3综合智能和长任务能力领先,但成本及速度未必占优。
- 对比Kimi K2.6:属于明显的代际升级,而不是小幅迭代。
目前最合理的评价不是“K3已经登顶全球”,而是:
中国模型首次在综合智能、复杂软件工程和Agent知识工作三个方向上,同时逼近全球最强闭源模型。
由于K3发布仅数日,完整技术报告、开放权重、更多第三方长周期测试和大规模真实用户反馈仍未完全出现。现阶段应对其能力保持高度认可,同时避免把官方案例和早期榜单当作稳定生产成功率。



