[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fQQfhYqt1zfOeDwlds502GKIpDFFeNnHHqgKzjMUbDA8":3},{"item":4,"related":52},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":43,"sourceName":44,"sourceUrl":44,"status":45,"seoTitle":44,"seoDescription":44,"canonicalUrl":44,"isFeatured":46,"sno":47,"sortOrder":48,"publishedAt":49,"updatedAt":50,"createdAt":51},"14a78d02-d08a-4cc1-b4b4-5f86f632d90c","article","DeepSeek-V4-Flash：跑得快没奖励，跑得慢有惩罚","deepseek-v4-flash","DeepSeek-V4-Flash 正式版，是怎么把整个 AI 行业逼到墙角的","2026 年 7 月 31 日下午，DeepSeek 干了一件很\"DeepSeek\"的事。\n\n没有发布会，没有倒计时海报，没有 CEO 站在聚光灯下说\"这是我们迄今为止最激动人心的模型\"。他们只是在 API 文档的更新日志里，**加了一行字**：DeepSeek-V4-Flash 正式版 API 上线公测。\n\n然后全球开发者社区就炸了。\n\n有意思的是，就在前一天，OpenAI 刚刚紧急宣布 GPT-5.6 Luna 全线降价 80%——上线才三周的模型，输入价格从 1 美元砍到 0.2 美元，输出从 6 美元砍到 1.2 美元。这个时间点巧得让人起疑：一边是硅谷连夜挥刀自砍，一边是杭州轻描淡写更新日志。\n\n结果是：**OpenAI 砍完 80% 之后，跑同样的任务，还是比 DeepSeek 贵大约 60%。**\n\n这就很尴尬了。\n\n## 模型没换，脑子换了\n\n在讲行业影响之前，得先把技术上那个\"反直觉\"的点说清楚，因为它是后面一切的地基。\n\n**V4-Flash 正式版（版本号 0731），和 4 月发的预览版，是同一个模型。**\n\n不是\"架构微调\"，不是\"扩了点参数\"，是**完全一样**：\n\n| 项目 | V4-Flash-Preview（4月） | V4-Flash-0731（正式版） |\n|---|---|---|\n| 总参数 | 2840 亿 | 2840 亿 |\n| 激活参数 | 130 亿 | 130 亿 |\n| 架构 | MoE | MoE |\n| 上下文 | 100 万 token | 100 万 token |\n| 价格 | 输入 $0.14 \u002F 输出 $0.28 | **一分钱没涨** |\n\n那到底改了什么？官方说得很朴素：**重新做了一遍后训练（Post-Training）。**\n\n就这。骨架没动，发动机没换，只是重新调了一遍油路和电控。\n\n然后成绩单变成了这样：\n\n| 基准测试 | 预览版 | 正式版 | 变化 |\n|---|---|---|---|\n| **DeepSWE**（真实代码仓库修复） | 7.3 | **54.4** | 涨了 **6 倍多** |\n| **Terminal Bench 2.1**（终端连续操作） | 61.8 | **82.7** | +20.9 |\n| Cybergym（网络安全攻防） | — | 76.7 | — |\n| Toolathlon Verified（多工具协同） | — | 70.3 | — |\n| DSBench-FullStack（全栈开发） | — | 68.7 | — |\n| DSBench-Hard（高难编码） | — | 59.6 | — |\n\nDeepSWE 从 7.3 涨到 54.4 是什么概念？打个不太严谨的比方：一个学生上学期期末考 7 分，这学期考了 54 分，中间他没换脑子、没补课本，只是**终于学会了怎么答题**。\n\n更炸裂的是横向对比。官方公布的**九项 Agent 与代码基准，V4-Flash 正式版全部超过了自家的 V4-Pro 预览版**——那个总参数 1.6 万亿、激活 490 亿的旗舰。\n\n也就是说：**用 Pro 六分之一的总参数、不到四分之一的激活参数，把自家旗舰按在地上摩擦。** 在 DeepSWE 这一项上，分差高达 41.6 分。\n\n行业里\"Pro 强、Flash 弱\"的分层信仰，当场碎了一地。\n\n### 这说明了什么？\n\n一个被严重低估的事实：**预训练决定能力上限，后训练决定这个上限能兑现多少。**\n\n过去两年，所有人都在卷预训练——卷参数、卷算力、卷数据量。2026 年上半年更是进入\"万亿参数时代\"：4 月 DeepSeek V4-Pro 预览版 1.6 万亿开局，7 月阿里 Qwen 3.8-Max 推到 2.4 万亿，同月月之暗面 Kimi K3 以 2.8 万亿登顶开源模型规模之王。\n\n大家默认的逻辑是：**更大 = 更强**。\n\nV4-Flash-0731 说：不一定。它在 4 月的时候，脑子里其实**已经装着**这些能力了，只是不知道怎么用。后训练做的事情，是教它\"打开终端 → 调用工具 → 改代码 → 跑测试 → 修 Bug → 继续改\"这套 Agent 完整链路——从\"回答问题\"变成\"完成任务\"。\n\n同时首次亮相的还有 DeepSeek 自研的 Agent 测试框架 **DeepSeek Harness**，用极简模式跑分。工程侧的优化和训练侧的优化产生了协同效应。\n\n用一位分析师的说法：**AI 发展不只需要大力出奇迹，还得慢工出细活。**\n\n## 真正的核弹：价格表\n\n技术上的惊喜是\"哇好厉害\"，价格上的冲击才是\"卧槽这怎么活\"。\n\n**V4-Flash 正式版定价（每百万 Token）：**\n\n| 类型 | 美元 | 人民币 |\n|---|---|---|\n| 输入（缓存未命中） | $0.14 | 约 1 元 |\n| 输入（缓存命中） | $0.0028 | 约 0.02 元 |\n| 输出 | $0.28 | 约 2 元 |\n\n注意那个**缓存命中价**：0.02 元\u002F百万 Token。缓存折扣高达 **98%**，而行业大多数厂商是 90%。在 Agent 场景下——固定系统提示词反复复用、多轮工具调用——这个折扣是能吃满的。\n\n现在把它和\"厉害的那些\"放一起：\n\n| 模型 | 输入（$\u002FM） | 输出（$\u002FM） | 智能指数 (AAII) |\n|---|---|---|---|\n| **DeepSeek V4-Flash** | **0.14** | **0.28** | **50** |\n| GPT-5.6 Luna（已降价80%） | 0.20 | 1.20 | 51 |\n| Anthropic Haiku 4.5 | 1.00 | 5.00 | — |\n| Claude Opus 4.8 | — | 约 **85 倍** V4-Flash | 约 56 |\n| Gemini 3.6 Flash | — | — | 50（打平） |\n\n第三方评测机构 **Artificial Analysis** 给 V4-Flash 的智能指数打了 **50 分**，比自己上一代高 10 分，比 V4-Pro 预览版高 6 分，追平 Gemini 3.6 Flash，**只落后 GPT-5.6 Luna 一分**。\n\n而在 ALE 基准上，V4-Flash 和全球顶级的 **Claude Opus 4.8 只差半分**。\n\n半分。价格差 85 倍。\n\n再翻译一遍：**Opus 多拿了那 6 分综合智能，但跑完同一套评测的账单，高出约 52 倍。**\n\n这已经不是性价比的差距了，这是**计量单位级别的错位**。就像有人跟你比谁跑得快，你报的是\"秒\"，他报的是\"分钟\"。\n\n### 开发者的真实账单，比参数表更有说服力\n\n跑分终究是实验室数据，真正让海外开发者集体破防的，是他们自己刷卡时看到的数字：\n\n- **@tonbistudio**：整整一天，用 V4-Flash 跑了一堆多小时的复杂任务，**总共花了 0.31 美元**。而上周同样的任务用 Kimi K3 之类的模型，花了 **35 美元**。\"剧透一下：贵的那些也没强 100 倍。\"\n- **@CommandCodeAI**：同一个游戏设计提示词，Kimi K3 单次调用 0.0740 美元，GLM 5.2 是 0.0480 美元，**V4-Flash 是 0.0005 美元——便宜 150 倍**。（诚实地说，V4-Flash 在边缘细节上确实糙了点。）\n- **@SciTechera**：在 Terminal-Bench 2.1 上完成单个基准任务，**估算成本 0.03 美元**。\n- **@RoundtableSpace**：对比刚发布的 Opus 5——Opus 一次成功，DeepSeek 试了三次。但 **Opus 输出了 3000 行代码，DeepSeek 用约 900 行就搞定了，单次成本约 1 美分。**\n\n最后这条特别有意思：贵的模型一次搞定，便宜的模型试三次。但便宜的模型试三次的总成本，还不到贵模型的百分之一——而且代码更精简。\n\n**在 Agent 时代，\"一次做对\"不再是唯一的美德，\"错了也无所谓，反正重来一次只要一分钱\"变成了一种全新的工程哲学。**\n\nBold Metrics 的 CTO Morgan Linton 说得更直白：对于需要成千上万次 API 调用的工业级 Agent 工作流，**这种价格让\"大批量自动化试错\"第一次具备了财务可行性。**\n\n以前你不敢让 AI 反复尝试，因为每一次尝试都在烧钱。现在你可以了。这不是省钱，这是**换了一种做事方式**。\n\n## \"斩杀线\"：这个词是怎么来的，又为什么这么准\n\n发布之后，中英文社区不约而同地造出了同一个概念。\n\n中文叫**斩杀线**，英文叫 **Kill Line**。\n\n它的定义特别精确，值得逐字读：\n\n> **斩杀线不是性能分水岭，而是性能与价格的平衡临界值。**\n>\n> - 同一能力梯队中，定价显著高于 DeepSeek 的模型，将持续流失中小开发者；\n> - 性能弱于 DeepSeek、成本却更高的产品，生存空间快速萎缩。\n\n北京市社会科学院副研究员王鹏在接受《环球时报》采访时的表述更简洁：**Codex 和 Claude 划定上限，DeepSeek 划定\"斩杀线\"——追平它，你就没有溢价空间了；落后它，你就出局了。**\n\n这就回到了本文开头那句话。用一个游戏化的说法：\n\n### **跑得快没奖励，跑得慢有惩罚**\n\n这是一个残酷到近乎优雅的博弈结构：\n\n**如果你比 DeepSeek 强一点点（跑得快）：**\n- 你得证明\"多出来的那几分能力\"，值得客户多付 50 倍的钱\n- 但 80% 的日常任务根本用不上那几分\n- 所以你拿不到与投入成正比的市场份额 → **没奖励**\n\n**如果你比 DeepSeek 弱、还比它贵（跑得慢）：**\n- 你没有任何存在的理由\n- 中小开发者用脚投票，一夜之间迁移完毕\n- → **有惩罚，而且是死刑**\n\n**如果你和它差不多贵、差不多强：**\n- 恭喜，你成了一个可被随时替换的商品（commodity）\n\n海外社区把这个感受表达得更生动。X 用户 @FoxRick01 说：\n\n> \"Anthropic 被 Codex 打了一整周，现在又被便宜 100 倍的 DeepSeek 打。他们现在看起来像是**卖菲亚特、收法拉利价钱的销售员**。\"\n\n于是\"**法拉利的性能，自行车的价格**\"成了这次发布的标志性调侃。\n\n一位从事 AI 创业孵化的人士说得更狠：\n\n> \"梁文锋似乎站在了市面上所有模型玩家的对立面。所有 AI 公司都在他前面奔跑——不管用什么方式，**它们必须跑到 DeepSeek 前面，才能活着**。\"\n\n## 48 小时之内，整个行业开始重新算账\n\n嘴上说说是一回事，Token 流向是另一回事。数据不会撒谎。\n\n### 调用量：一个模型，打赢了一群模型\n\nOpenRouter（全球最大的模型聚合平台）7 月 27 日 – 8 月 2 日的周度数据：\n\n| 排名 | 模型 | 周调用量 |\n|---|---|---|\n| 🥇 1 | **DeepSeek-V4-Flash** | **7.22 万亿 Token** |\n| 🥈 2 | 小米 MiMo-V2.5 | 6.30 万亿 |\n| 🥉 3 | 腾讯 HY3 | 4.82 万亿 |\n| 4 | DeepSeek-V4-Pro | 3.28 万亿 |\n| 5 | 智谱 GLM-5.2 | 2.89 万亿 |\n\n**前五名，全部是中国模型。**\n\n再看总量：全球总调用 56.8 万亿 Token，其中上榜的中国大模型周调用量 **28.13 万亿**，美国大模型 **4.38 万亿**。中国模型的周调用量已经**连续 14 周**超过美国。\n\n编程平台 OpenCode 的 CEO Jay 在 8 月 1 日发文：V4-Flash 上线后，平台**单日调用量增长 30%**，OpenCode Go 的新订阅用户也增长了 **30%**。\"DeepSeek 一天消耗 8 万亿\"直接冲上热搜——不是烧掉 8 万亿资金，是单日处理 8 万亿 Token。\n\n**单一模型、单一入口的单日消耗，超过了海外数百款模型加起来的日均总和。**\n\n### 硅谷的反应：连夜改价格表\n\n这波价格战的猛烈程度，是 AI 史上前所未见的：\n\n| 厂商 | 动作 |\n|---|---|\n| **OpenAI** | GPT-5.6 Luna 降价 **80%**（上线仅三周）；Terra 降 20%；旗舰 Sol 维持不动 |\n| **Anthropic** | Claude Opus 5 降价 |\n| **Google** | 推出低价 Gemini Flash 系列应对 |\n| **Mistral** | 重新调整商业化方案，靠开源免费 + 云端优惠守住开发者盘 |\n| **中小开源服务商** | 被迫重算成本，放弃\"靠 API 毛利盈利\"的幻想 |\n\nOpenAI 的策略写在脸上：**旗舰 Sol 的溢价一分不让，用中低端产品的激进降价，拦截客户流失。** 保住高端护城河，把中端市场当防线来打。\n\n问题是——这条防线，砍完 80% 之后依然比 DeepSeek 贵 60%。\n\n### 企业侧：Token 经济学的崩塌\n\n真正的压力其实来自更早，V4-Flash 只是压垮骆驼的最后一根稻草：\n\n- **Uber**：5000 名工程师中 84% 启用了 Agent 式编码，人均月度 API 成本飙到 500–2000 美元区间，**四个月烧光全年 AI 预算**。CTO Praveen Neppalli Naga 坦言\"原定预算已被彻底击穿\"。\n- **Lindy**（旧金山，25 人 AI 创业公司）：把 **100% 的流量**从 Anthropic 全面切向 DeepSeek，预计省下数百万美元。\n- **微软**：悄悄把 DeepSeek 塞进了 Copilot 底层引擎的评估名单。\n- **CNBC 调查**：自 2026 年 2 月 8 日起，中国模型在 OpenRouter 上的**美国企业** Token 用量占比每周稳定在 30% 以上，峰值 **46%**。\n\n为什么企业撑不住了？因为 Agent 改变了消耗结构。OpenRouter 数据显示：**Agent 式工作流每个请求的 Token 消耗量，是人机对话的 15 倍。**\n\n一个看似简单的自然语言指令，实际要拆解成：意图理解 → 环境感知 → 文件检索 → 工具调用 → 代码生成 → 自我修正 → 再来一遍。**乘数效应瞬间放大 Token 消耗。**\n\n在这个结构下，单价的微小差异会被放大成账单上的天文数字。于是\"能力溢价\"的旧范式，输给了\"成本效率\"的新范式。\n\n## 它到底扮演什么角色？\n\n聊到这里，可以给 V4-Flash 在 AI 产业里的位置下个判断了。它不是\"最强模型\"，也不只是\"最便宜的模型\"，它同时扮演着三个更微妙的角色。\n\n### 角色一：定价的\"锚\"，而不是性能的\"顶\"\n\n顶不是它的。上限依然由 Claude Opus 4.8、GPT-5.6 Sol、Kimi K3 这些巨兽划定。\n\n但**底**是它划的。而且这个底一旦划下来，就变成了所有人的参照系。\n\n这才是最要命的地方：**一个定价锚点，比一个性能冠军更能改变行业结构。** 性能冠军只影响\"最难的那 5% 任务\"，定价锚点影响\"所有任务\"。\n\nDeepSeek 走的也不是烧钱补贴的路子。它的低价来自底层工程优化——高效推理架构、动态 KV 缓存、流量峰谷调度、长文本优化——是把成本真的做下来了，不是亏钱换市场。这意味着这条线**不会因为补贴结束而回弹**。\n\n《财富》杂志还指出，V4 系列的研发与华为底层芯片生态做了紧密适配。随着昇腾系列软硬件协同效率提升，**推理成本还有进一步下探空间**。\n\n### 角色二：默认选项的重新分配者\n\n\"斩杀线\"真正斩掉的，不是所有高端模型，而是——\n\n> **对旗舰模型\"不计成本\"的默认调用习惯。**\n\n这句话值得再读一遍。\n\n以前的工作流是：默认上最强的，反正能力越强越保险。\n现在的工作流是：**先问一句，这活儿真的需要旗舰吗？**\n\n写一段代码、改一份文案、整理会议纪要、跑一轮自动化测试——先交给低成本且完成率足够的模型；只有遇到复杂推理、长链路 Agent、高风险场景，才升级到昂贵旗舰。\n\n**高价模型仍然有位置，但它必须证明：多出来的那点能力差距，足以覆盖多出来的调用成本。**\n\n这就是\"跑得快没奖励\"的精确含义——不是快没用，而是**快的边际收益，被巨大的边际成本吃掉了**。\n\n一个合理的生产架构长这样：\n\n```\n┌─────────────────────────────────────────┐\n│  80% 高频常态任务  →  V4-Flash（$0.28\u002FM）│\n│  ├─ 代码补全、重构、测试                  │\n│  ├─ 终端运维、批量处理                    │\n│  └─ 文本分类、格式转换                    │\n├─────────────────────────────────────────┤\n│  15% 中等复杂任务  →  中端模型 \u002F Flash高档 │\n├─────────────────────────────────────────┤\n│  5%  极难推理任务  →  Opus \u002F Sol \u002F K3     │\n│  └─ 高难算法、长逻辑链、高风险决策         │\n└─────────────────────────────────────────┘\n```\n\n一位开发者的实践更精妙：V4-Flash 目前不支持原生视觉输入，于是 **@hqmank** 先让 Kimi K3 读参考图、提取布局与颜色规范，再把结构化文本交给 V4-Flash 生成代码。布局与间距还原得不错，**整体成本远低于全程调用顶级多模态模型**。\n\n跨模型组合，正在成为一门新手艺。\n\n### 角色三：AI 普惠的\"降门槛器\"\n\n这一层可能是最被低估的。\n\n天风证券计算机团队在发布当天给出\"大超预期\"的定调，并做了一个反常识的判断：**看好软件公司受益**。\n\n反常在哪？过去市场普遍认为 AI 模型越强，越利空 SaaS 类企业——AI 会把它们吃掉。\n\n但现在逻辑反过来了：**DeepSeek 的性价比已经足够让软件公司自己用起来提效**。更重要的是，那些过去因为 Token 账单太贵而不敢碰 AI 的公司，现在可以开发高性价比的 AI 服务了。**过去无法被满足的 Agent 需求，第一次变成了可以被满足的。**\n\n0xSupergemma 创始人宋骏从全球经济视角补了一刀：全球有大量低收入群体和初创团队，根本负担不起高昂的模型订阅费。DeepSeek 极低的 API 定价，会**通过下游开发者转化成极便宜的 SaaS 工具与服务**，让更广泛的终端用户间接享受技术红利。\n\n一位微博用户的比喻更远：AI 最终可能不是一个独立工具，而是像**电力**一样的基础设施层——嵌入工厂、医院、车辆、办公系统，成为每个行业的默认能力。它最大的影响，也许不是给人们又一个聊天机器人，而是提供了重塑社会运作方式的算力底座。\n\n而电力普及的前提，从来都是**便宜**。\n\n## 并不万能\n\nV4-Flash 的边界同样清晰，而且比很多人想象的明显。\n\n### 1. 硬推理能力，差距是真实存在的\n\n- **HLE**（博士级推理基准）：V4-Flash **8.1%**，Claude Sonnet 5 是 **57.4%**。这不是差一点，这是差一个物种。\n- 在那九项它\"全面反超 Pro\"的基准上，**它依然全部输给 Claude Opus 4.8**，平均落后 5.7 分。仓库生成类任务上，差距超过 15 分。\n- 开发者 @OmedVibeCodes 实测：面对 GPT-5.6 Sol、Kimi K3 这类顶级模型，V4-Flash 在**极其复杂的长逻辑链求解**上仍有明显差距。\n\n所以那句\"厉害的没它便宜，也没厉害多少\"——**在 80% 的日常任务上成立，在最后 5% 的硬骨头上，不成立。**\n\n### 2. 跑分本身要打折看\n\n- 九项基准是 **DeepSeek 自己报的**，用的是自研的 DeepSeek Harness 框架，**该框架尚未公开**，目前无法独立复现。\n- 第三方复现显示，Terminal-Bench 分数与厂商自报值有约 **4 分**的差距。\n- Terminal Bench 2.0 与 2.1 并非同一版本，直接跨版本对比不完全公平。\n- 公开基准存在过拟合风险，**跑分 ≠ 真实业务表现**。\n\n### 3. 工程上的坑\n\n- 部分海外开发者反映：**输入缓存命中率偏低、安全分类器经常超时**。这在一定程度上说明，算力和参数储备不足，仍然是能力上限的瓶颈。\n- **98% 的缓存折扣是平台机制口径，不是你的实际成本。** 真实命中率取决于 prompt 前缀复用率——Agent 多轮调用、固定系统提示的场景容易吃满；一对一开放式对话可能差得很远。别拿\"成本低 60%\"直接套自家预算。\n- **峰谷差异化定价**：官方公布高峰时段（北京时间 9:00–12:00、14:00–18:00）价格会上浮。对欧美时区团队，这对应的是美东晚上 9 点至凌晨、凌晨 2–6 点，成本模型需要重算。\n- **Artificial Analysis 测出它比较\"话痨\"**：跑完整个智能指数消耗 2.06–2.1 亿输出 Token，而中位数约 1 亿。单价便宜但输出更多，实际账单要按 token 总量算，不能只看单价。\n- **暂不支持原生视觉输入**，图文混排任务需要外部模型前置解析。\n- 目前**仅 API 开放**，App 和网页端还用不上，普通用户暂时体验不到。\n\n### 4. 也别把\"Scaling Law 失灵\"当结论\n\n这可能是最容易被误读的一点。\n\n看到\"2840 亿打赢 1.6 万亿\"，很容易得出\"规模法则失效了\"的结论。但没人真的这么认为——包括 DeepSeek 自己。\n\n梁文锋在一份流传甚广的融资会议纪要中说得很明确：\n\n> \"**规模法则远未到上限，国内模型规模受限只是算力不足，不是规律走到尽头。**\"\n\n但他补了一句关键的：**规模不再是唯一杠杆，思维链和智能体将会是下一个杠杆。**\n\n市场也是这么反应的：V4-Flash 上线后，英伟达、博通、AMD 在 7 月 31 日的股价**并未出现剧烈波动**。这和 2025 年 1 月 R1 发布后英伟达单日蒸发 5000 亿美元市值形成鲜明对比。\n\n市场已经学会了：**AI 工程效率的提升，不是算力需求的利空。** 摩根大通的判断是，DeepSeek 强化了\"算力供应扩张、定价纪律、结构性成本曲线压缩\"三大支柱，对行业是**顺风，不是零和**。\n\n便宜了，用得起的人多了，总消耗反而涨了。这就是杰文斯悖论在 AI 上的演绎。\n\n### 5. 一个未解的插曲\n\n正在小范围灰度的 V4-Pro 正式版，有部分开发者反馈其生成的复杂代码风格与某些高价旗舰模型相似，甚至触发过疑似特定模型的安全拒绝响应，引发\"是否使用了混合路由\"的猜测。社区调侃为\"**矿泉水瓶里掺茅台**\"。\n\n需要说明：这些目前**都是社区反馈，官方尚无进一步复现说明**。技术专家 @TeksCreate 从架构层面分析认为，V4-Pro 的 1.6 万亿 MoE 架构 + 混合注意力系统（CSA 历史压缩 + HCA 超长文本压缩 + SWA 全保真跟踪），使处理 100 万上下文时计算量降至前代 27%，本身就具备达到该水平的技术条件（Codeforces 3206 分、SWE-bench Verified 80.6%、1M 长上下文 MRCR 83.5%）。\n\n真相如何，等官方回应。\n\n## 一台永不停止的收割机\n\n回到最开始那句话。\n\n> **便宜的模型没它厉害，厉害的模型没它便宜，也没厉害多少。**\n> **跑得快没奖励，跑得慢有惩罚。**\n\n这句话之所以精准，是因为它描述的不是一个模型，而是**一种市场结构**。\n\n在这个结构里，DeepSeek V4-Flash 不是赛道上跑得最快的那个选手。它是**站在赛道中间，用一根杆子把及格线抬到所有人头顶**的那个人。\n\n你比它快？恭喜，但观众不一定为那点速度买单。\n你比它慢？抱歉，出局。\n你和它一样快、一样便宜？那你就是个可替代品。\n\n有人调侃：\"梁文锋的 DeepSeek 成了一台永不停止的收割机。\"\n\n某种程度上，这句话对每个人都成立——它收割的是行业的定价权，是\"AI 就该很贵\"的默认假设，也是所有靠信息差和成本不透明赚的钱。\n\n但换个角度看，被\"收割\"掉的这些，本来也不该由用户来承担。\n\n**2025 年春天，DeepSeek 让世界重新思考\"AI 需要多少算力\"。**\n**2026 年夏天，它让世界重新思考\"AI 应该卖多少钱\"。**\n\n这两个问题，最终指向的是同一件事：**智能，究竟应该属于少数人，还是属于所有人。**\n\n至于这条斩杀线会不会被别人越过——\n\nKimi K3 的 2.8 万亿参数还在那儿，Qwen 3.8-Max 的 2.4 万亿也在那儿，V4-Pro 正式版还没发布，OpenAI 的刀刚砍完第一轮。\n\n**没人知道下一个 48 小时会发生什么。这大概就是 2026 年的 AI 行业最有意思的地方。**\n\n### 主要资料来源\n\n- DeepSeek 官方 API 文档更新日志（2026-07-31）\n- 21 世纪经济报道《DeepSeek 又发重磅更新，行业梦回 2025 年春天》\n- Global Times《DeepSeek V4 Flash hailed as 'Ferrari at bicycle prices'》\n- 凤凰网科技《口碑持续逆转，DeepSeek 成全球 AI 斩杀线》\n- 网易科技《DeepSeek V4 Flash 刷屏海外，\"像魔法一样\"的 AI，只卖几分钱》\n- 新浪财经《85 倍价差：DeepSeek 逼着硅谷巨头重算\"性价比\"》\n- TechFlow《OpenAI 上线三周降价 80%》、CNBC 相关调查报道\n- 北京日报、环球网、潮新闻、太平洋科技相关报道\n\n> *本文数据截至 2026 年 8 月 5 日。基准测试分数多为厂商自报或第三方初步评测，实际业务表现请以自有场景实测为准。价格随时可能变动，决策前请核对官方最新定价。*","\u002Fuploads\u002F2026-08-05\u002Fc4b0e276-bfcb-4796-8da7-aa8ff5df8253.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"8649729c-92bf-4ec7-b98b-3bae4271318b","思考","thought","从项目或实操经验中延伸出的思考",[23,27,31,35,39],{"id":24,"name":25,"slug":26},"a2ccffe0-49b2-458b-baf6-a83a1b20443d","大语言模型","llm",{"id":28,"name":29,"slug":30},"63b56667-dcdb-4b8b-bcbe-c405143a7ec2","测评","test",{"id":32,"name":33,"slug":34},"144abe77-0dc6-4f66-a176-20bddb1c0bfa","编程","coding",{"id":36,"name":37,"slug":38},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":40,"name":41,"slug":42},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse","资料来源",null,"published",true,1,0,"2026-08-05T00:00:00.000Z","2026-08-06T05:47:25.253Z","2026-08-05T03:24:39.350Z",[53,62,71],{"id":54,"type":6,"title":55,"slug":56,"summary":57,"coverUrl":58,"authorName":14,"sno":59,"publishedAt":60,"createdAt":61},"62724dbd-ce49-4be9-afa9-4ba127513a62","语音搜索一定先变成文字吗？AI 开始绕过转写这一步","speech-to-retrieval-without-transcription","传统语音搜索先把声音转成文字，再拿文字查资料，一次听错就可能让搜索方向完全跑偏。Speech-to-Retrieval 尝试直接把语音与相关文档映射到同一个语义空间。本文用蒙克名画的例子讲清新旧架构及其边界。","\u002Fuploads\u002F2026-09-08\u002Fe1173842-1ec4-48f3-8349-240fc2d78197.jpg",50,"2026-08-30T00:00:00.000Z","2026-08-14T03:06:11.525Z",{"id":63,"type":6,"title":64,"slug":65,"summary":66,"coverUrl":67,"authorName":14,"sno":68,"publishedAt":69,"createdAt":70},"0999bb14-a97c-4003-84e7-61ad2da998e0","文件删除以后去了哪里？为什么有时还能恢复？","where-deleted-files-go-data-recovery","普通删除往往只是移除文件系统里的索引并把空间标记为可重用，数据本身未必立即消失；SSD 的 TRIM、磨损均衡与加密又让情况更加复杂。本文区分回收站、删除、覆盖和安全清除，说明何时应停止写入设备。","\u002Fuploads\u002F2026-09-08\u002Fb7222764-de75-4863-8679-0a94a8965af3.jpg",51,"2026-08-20T00:00:00.000Z","2026-08-14T03:06:15.710Z",{"id":72,"type":6,"title":73,"slug":74,"summary":75,"coverUrl":76,"authorName":14,"sno":77,"publishedAt":78,"createdAt":79},"55f42805-a25a-4ce3-89d9-121b9a268a8f","0.1＋0.2 为什么不等于 0.3？计算机真的算错了吗？","why-point-one-plus-point-two-not-point-three","许多十进制小数无法用有限位二进制精确表示，计算机只能保存最接近的值。微小误差在显示时常被隐藏，却会在比较、累计和金额计算中冒出来。本文用三分之一的类比讲清浮点数，并给出可靠的处理原则。","\u002Fuploads\u002F2026-09-08\u002Ffd3a7daf-2a2c-4ef0-8f57-38f1d9de962c.jpg",54,"2026-09-06T00:00:00.000Z","2026-08-14T03:06:15.129Z"]