[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fW6ZhvuJynBOY9z2aZD3ydyXnzwvRdqK3rreqXZtecZw":3,"$fLGLv2v7ZryKto5fxX9Ok_CGE_GOEQHbCIX8AyyWSb9g":43},[4],{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":35,"sourceName":35,"sourceUrl":35,"status":36,"seoTitle":35,"seoDescription":35,"canonicalUrl":35,"isFeatured":37,"sno":38,"sortOrder":39,"publishedAt":40,"updatedAt":41,"createdAt":42},"9fc7876e-6196-491d-aef4-4610112ec643","article","Foundit架构解析","foundit-analysis","详解一个\"内容优先\"的现代知识站的架构优越性","> 基于项目源代码的结架构拆解——Foundit为什么比传统博客\u002FCMS 更聪明、更安全、更\"被看见\"。\n\n如果你曾经搭过个人网站、技术博客，或者公司内容站，大概率踩过这些坑：文章发出去搜索引擎半年没收录；后台登录形同虚设，改个 URL 就能绕过；服务器月月烧钱；换台手机排版就崩了。\n\n**Foundit** 这个项目，正是针对这些\"老毛病\"给出的一个近乎教科书式的答案。它不是一个臃肿的系统，而是一套用现代工具链拼起来的、克制而精密的内容站。下面我们用拆解一台精密仪器的眼光，看看它的内部构造。\n\n## 一、它到底是什么？\n\n用一句话概括：\n\n> **Foundit 是一个基于 Nuxt（SSR）、Supabase（数据库+存储）和 Srces Auth（统一登录）的科技内容知识站。**\n\n它把内容分成四种形态——**文章、产品、想法、专题**，对外提供公开阅读（首页、列表、详情、搜索、RSS、Sitemap），对内提供一个由管理员权限保护的内容后台。\n\n它的技术栈可以用\"五个方面军\"来理解：\n\n```mermaid\nflowchart LR\n    读者([公开访问者]) --> CF[Cloudflare Workers\u003Cbr\u002F>边缘运行 + 缓存 + 安全]\n    CF --> Nuxt[Nuxt SSR\u003Cbr\u002F>页面 \u002F 后台 \u002F 接口]\n    Nuxt --> PG[(Supabase PostgreSQL\u003Cbr\u002F>内容 \u002F 分类 \u002F 标签 \u002F 专题)]\n    Nuxt --> ST[(Supabase Storage\u003Cbr\u002F>图片 \u002F 附件)]\n    管理员([管理员]) --> SDK[Srces Auth SDK\u003Cbr\u002F>OAuth + PKCE]\n    SDK --> CF\n    CF --> JWKS[JWKS 验证 JWT\u003Cbr\u002F>RS256 + admin 角色]\n    JWKS --> PG\n```\n\n这张图里藏着 Foundit 的第一个聪明之处：**浏览器永远不直接碰数据库钥匙**。所有写入都要经过 Nuxt 服务端这一道\"门房\"，而\"门房\"只认经过密码学签名的令牌。\n\n如果把镜头再拉近一点，按\"分层\"的视角看，各个组件的上下游关系会更清晰——公开读取和管理员写入走的是两条泾渭分明的通道，最终都汇聚到 Supabase，但沿途经过的\"安检\"完全不同：\n\n```mermaid\nflowchart TB\n    subgraph Public[\"公开访问者\"]\n        P[浏览器]\n    end\n    subgraph Edge[\"Cloudflare Workers（边缘）\"]\n        CFW[Nuxt SSR \u002F Nitro 运行时]\n        Cache[(SWR 缓存)]\n    end\n    subgraph App[\"Nuxt 应用层\"]\n        Pages[Pages \u002F Layouts \u002F Components]\n        Composables[Composables]\n        API[Server API \u002F Routes]\n    end\n    subgraph Data[\"数据与安全\"]\n        PG[(Supabase PostgreSQL\u003Cbr\u002F>RLS 只读策略)]\n        ST[(Supabase Storage\u003Cbr\u002F>public-media \u002F private-files)]\n        AUTH[Srces Auth\u003Cbr\u002F>RS256 JWT + JWKS]\n    end\n\n    P -->|HTTPS| CFW\n    CFW --> Cache\n    CFW --> Pages\n    Pages --> Composables\n    Pages -->|useFetch \u002Fapi\u002Fcontent| API\n    API -->|Service Role Key| PG\n    API -->|只读媒体| ST\n    API -->|公开内容（RLS 过滤）| PG\n\n    subgraph Admin[\"管理员\"]\n        A[浏览器 + SrcesAuth SDK]\n    end\n    A -->|OAuth + PKCE| AUTH\n    AUTH -->|Access Token| CFW\n    CFW -->|JWKS 验签 + admin 角色| AUTH\n    API -->|写操作 + 审计| PG\n    API -->|上传\u002F删除| ST\n```\n\n注意左右两侧的对称：左边\"公开访问者\"只能通过 RLS 过滤后的只读通道拿到已发布内容；右边\"管理员\"必须先过 Srces Auth 的 JWT 验签、再由服务端持 Service Role Key 才能写入，并且每一次写入都会留下审计记录。安全，不是某一处的设防，而是**整条链路的默认姿态**。\n\n## 二、目录结构：像图书馆一样井井有条\n\n一个项目好不好维护，先看它的\"房间怎么分\"。Foundit 的目录非常符合直觉：\n\n| 目录 \u002F 文件 | 职责 | 科普类比 |\n|---|---|---|\n| `pages\u002F` | 19 个页面（前台 + 后台） | 对外开放的\"展厅\"和内部的\"办公室\" |\n| `components\u002F` | 7 个可复用组件 | 标准化的\"家具\"：列表、轮播、编辑器 |\n| `composables\u002F` | 3 个组合式逻辑（认证、图片压缩、主题） | 可插拔的\"功能模块\" |\n| `server\u002Fapi\u002F` | 公共接口 + 后台接口 | 对外的\"服务窗口\" |\n| `server\u002Futils\u002F` | 数据访问层 + 鉴权 + 审计 | 后厨：备菜、安检、记账 |\n| `server\u002Froutes\u002F` | `robots.txt` \u002F `sitemap.xml` \u002F `rss.xml` | 给搜索引擎的\"地图和告示\" |\n| `database\u002F` | 4 个 SQL（表结构 + 迁移） | 仓库的\"建筑图纸\" |\n| `layouts\u002F` | 前台布局 + 后台布局 | 两套\"装修风格\"但同源 |\n| `config\u002F`、`types\u002F`、`utils\u002F` | 配置、类型、纯函数工具 | 字典和工具箱 |\n\n最值得称道的一点：**公共接口（`\u002Fapi\u002Fcontent`）与后台接口（`\u002Fapi\u002Fadmin\u002F*`）严格分离**。前者的数据访问层叫 `content-repository`，后者叫 `admin-repository`。这种\"按职责分层\"的写法，让代码在半年后被人接手时，依然能一眼看懂谁在干什么。\n\n## 三、六大优点与特性\n\n### 1. 生来就被搜索引擎\"看得懂\"——SSR + SEO + GEO\n\n很多现代网站为了酷炫，正文靠 JavaScript 在浏览器里现拉现渲染。结果就是：关掉 JS，页面一片空白；搜索引擎爬虫看不懂；AI 问答工具也抓不到。\n\nFoundit 反其道而行。它用 **SSR（服务端渲染）**，用户或爬虫拿到的就是一份**完整的 HTML 正文**。项目里还专门做了三件事：\n\n- **结构化数据（JSON-LD）**：每篇文章\u002F产品页都输出机器可读的 `Article` \u002F `SoftwareApplication` 标签，相当于给内容贴了\"身份证\"，方便 Google、Bing 以及各类 AI 准确理解。\n- **Sitemap + RSS + robots.txt**：全部由服务端动态生成，内容一发布就自动更新\"目录\"。\n- **GEO（生成式引擎优化）**：专门为\"被 AI 引用\"做了设计——首屏直出核心结论、事实与观点分开、标注作者与来源时间、提供参考资料链接。\n\n那么一次\"打开文章\"的请求，在幕后到底经历了什么？下面这张时序图，把从浏览器发起请求，到边缘缓存、服务端拉数据、Markdown 渲染、注入 JSON-LD，最后吐出完整 HTML 的全过程摊开了看：\n\n```mermaid\nsequenceDiagram\n    participant B as 浏览器\n    participant CF as Cloudflare Workers\n    participant N as Nuxt SSR\n    participant API as \u002Fapi\u002Fcontent\n    participant SB as Supabase\n    participant AUTH as Srces Auth (JWKS)\n\n    B->>CF: GET \u002Farticle\u002F{slug}\n    CF->>N: 边缘 SWR 命中?\n    alt 缓存命中\n        CF-->>B: 直接返回缓存 HTML（Stale-While-Revalidate）\n    else 未命中\n        N->>API: useFetch('\u002Fapi\u002Fcontent?type=article&slug=...')\n        API->>SB: listContents（Service Role，RLS 只暴露 published）\n        SB-->>API: ContentItem\n        API-->>N: JSON\n        N->>N: markdown-it 渲染正文 + 注入 JSON-LD\n        N-->>B: 完整 HTML（含正文\u002Fmeta\u002Fcanonical）\n    end\n```\n\n关键在于：真正决定\"正文长什么样\"的那一步（渲染 + 注入结构化数据）发生在**服务端**，而不是浏览器。所以无论是搜索引擎爬虫、AI 抓取器，还是关掉了 JS 的读者，拿到的都是同一份完整、可读、带\"身份证\"的 HTML。\n\n> **优越性看点**：验收标准里白纸黑字写着\"关闭 JavaScript 后仍可阅读完整正文\"\"Lighthouse SEO 评分不低于 95\"。这不是口号，而是可被测试验证的工程目标。\n\n### 2. 多层安全防线——\"隐藏菜单\"骗不了人\n\n很多 CMS 的\"权限\"只是前端把按钮藏起来。Foundit 的态度是：**前端隐藏只是体验，真正的安全必须发生在服务端。**\n\n它的防线是这样的：\n\n1. **统一身份（OIDC + PKCE）**：登录走标准的授权码 + PKCE 流程，不存客户端密钥。\n2. **密码学令牌（RS256 JWT）**：服务端用 `jose` 库 + 远程 JWKS 公钥，**逐条校验**签名算法、签发者（issuer）、接收方（audience）、过期时间，并确认角色含 `admin`。\n3. **服务端兜底**：每个 `\u002Fapi\u002Fadmin\u002F*` 都调用同一个 `requireAdmin`，前端无论怎么改都绕不过去。\n4. **数据库层面的 RLS**：即使有人拿到数据库，公开角色也只能 `SELECT` 已发布的内容，草稿和归档天然不可见。\n5. **密钥隔离**：高权限的 Service Role Key 只存在于服务器环境变量，**绝不进前端产物**。\n\n具体到\"登录\"这件事，Foundit 用了一套巧妙的**双令牌机制**：管理员先从 Srces Auth 拿到一枚有效期仅 10 分钟的 RS256 令牌（用于向服务端证明身份），服务端验签通过后，再签发一枚 8 小时的 HttpOnly 会话 Cookie（免去每次都携带外部令牌）。整个握手过程如下：\n\n```mermaid\nsequenceDiagram\n    participant B as 浏览器\n    participant AUTH as Srces Auth\n    participant S as Foundit 服务端\n\n    B->>AUTH: auth.login()（OAuth + PKCE）\n    AUTH-->>B: RS256 Access Token（有效期 10 分钟，iss=auth.srces.cn, aud=foundit）\n    B->>S: POST \u002Fapi\u002Fadmin\u002Fsession  (Authorization: Bearer \u003CSrces token>)\n    S->>AUTH: createRemoteJWKSet + jwtVerify（RS256, iss, aud=foundit, exp）\n    S->>S: toAuthUser：校验 roles 含 'admin'，否则 403\n    S-->>B: 签发 HS256 本地会话 Cookie（foundit_admin_session，8h，HttpOnly, path=\u002Fapi\u002Fadmin）\n```\n\n这里有两个容易被忽略的细节：其一，本地会话 Cookie 的 `path` 被限定为 `\u002Fapi\u002Fadmin`，意味着它**只在后台请求时才会被发送**，不会泄漏到普通页面；其二，无论前端如何伪造，服务端 `requireAdmin` 都会重新验签并检查 `admin` 角色——**前端隐藏菜单，永远绕不过这道服务端的门。**\n\n一句话总结它的安全哲学：**\"永远不要相信浏览器送来的任何东西。\"**\n\n### 3. 一套设计语言，前后台\"长得很像\"\n\nFoundit 附带了一份极其详尽的 UI 设计规范（40 多节）。它的核心只有几个字：**克制、安静、留白、内容优先**。\n\n- 色彩只有黑、白、浅灰三色体系；\n- 视觉层级靠**字体和间距**建立，而不是靠色块和阴影；\n- 前后台共用同一套字体、按钮、表单风格，后台不再是\"花花绿绿的 SaaS 仪表盘\"；\n- 连动效都限制时长（150–220ms），禁止\"为了高级感而高级感\"。\n\n这种设计的好处是**长期可读、跨设备一致、维护成本低**。它像一本排版考究的书，而不是一面喧闹的广告墙。\n\n### 4. 智能缓存：既快又不会\"显示旧文章\"\n\nNuxt 的 `routeRules` 把缓存策略写得很细：\n\n| 页面 | 缓存策略 |\n|---|---|\n| 首页 | SWR 5 分钟 |\n| 文章 \u002F 产品 \u002F 专题详情 | SWR 1 小时 |\n| 登录回调 \u002F 后台 \u002F 后台接口 | `no-store`（绝不缓存） |\n\n`SWR`（Stale-While-Revalidate）是个聪明机制：先立刻把缓存的老页面给用户（快），同时后台悄悄刷新（新）。而涉及认证和敏感数据的页面，则**坚决不缓存**，避免把别人的后台响应留在边缘节点上。\n\n### 5. 边缘部署：把服务器\"搬到\"用户身边\n\n传统做法要租一台云服务器 24 小时待命。Foundit 部署在 **Cloudflare Workers** 上——代码运行在全球边缘节点，离用户更近，按请求计费，闲时几乎零成本。配合 `wrangler.toml` 一行配置，构建产物直接发布，无需管理服务器。\n\n> 这对个人创作者尤其友好：**运维成本趋近于零， scalability 却近乎无限。**\n\n### 6. 数据模型：为\"生长\"而设计\n\n数据库 schema 不是拍脑袋写的。它用枚举约束内容类型与状态（`draft\u002Fpublished\u002Farchived`），用 `jsonb` 存产品截图与链接，用 GIN 索引支持全文搜索，还预留了 `revisions`（修订记录）、`audit_logs`（审计日志）、`auth_users`（用户映射）等\"未来扩展位\"。\n\n把这些表之间的关系画出来，就能看到这套\"地基\"的全貌——内容表居于核心，分类\u002F标签\u002F专题围绕它展开，而修订、审计、用户映射则像预埋的钢筋，静静等待未来的功能生长上去：\n\n```mermaid\nerDiagram\n    contents ||--o| categories : \"category_id\"\n    contents ||--o{ content_tags : \"多对多\"\n    content_tags }o--|| tags : \"\"\n    topics ||--o{ topic_contents : \"position 排序\"\n    topic_contents }o--|| contents : \"\"\n    media ||--o{ contents : \"cover_url（逻辑关联）\"\n    revisions ||--o| contents : \"content_id\"\n\n    categories { uuid id PK }\n    tags { uuid id PK }\n    contents { uuid id PK }\n    content_tags { uuid content_id PK }\n    topics { uuid id PK }\n    topic_contents { uuid topic_id PK }\n    media { uuid id PK }\n    revisions { uuid id PK }\n    settings { text key PK }\n    audit_logs { uuid id PK }\n    auth_users { uuid id PK }\n```\n\n这意味着：**今天它是个博客，明天它想加评论、加多作者、加付费墙，地基已经留好了。**\n\n## 四、它\"优越\"在哪？——和传统方案对比\n\n| 维度 | 传统 WordPress \u002F 自建后台 | 普通 SPA（如纯前端框架） | **Foundit** |\n|---|---|---|---|\n| 搜索引擎可见性 | 依赖插件，易出坑 | 差（JS 渲染） | **原生 SSR + 结构化数据** |\n| 安全模型 | 插件质量参差 | 前端路由即\"伪权限\" | **服务端 JWT 校验 + RLS 双层** |\n| 运维成本 | 需常驻服务器 + 数据库 | 静态托管但功能受限 | **边缘函数，近乎零运维** |\n| 内容形态 | 单一\"文章\" | 自己造轮子 | **文章\u002F产品\u002F想法\u002F专题原生支持** |\n| 设计一致性 | 主题市场鱼龙混杂 | 看团队水平 | **统一设计系统约束** |\n| AI 可发现性 | 基本没考虑 | 基本没考虑 | **内建 GEO 优化** |\n\n用一个比喻：传统方案像\"自己盖房子，水电自己接，锁自己装\"；Foundit 像\"采用现代装配式建筑——结构、安防、节能标准都是出厂即合规的\"。\n\n## 五、写在最后：它也有\"待打磨\"的地方\n\n科普要客观。探索中也发现两点值得后续留意：\n\n- **Markdown 渲染开了 `html: true`**：正文允许原生 HTML，目前只有管理员能写，风险可控；但未来若开放投稿，需加一层消毒（sanitize）防存储型 XSS。\n- **限流是进程内存计数**：在 Cloudflare 多实例边缘部署下，单 IP 限流可能不具全局性，可改用 KV \u002F Durable Objects。\n\n但这些都属于\"优等生的小瑕疵\"——它的主干设计（分层、鉴权、SSR、部署）已经相当成熟。\n\n## 结语\n\nFoundit 给我们的最大启发是：**好的工程不是堆功能，而是把\"正确的事\"变成默认。** 内容该被看见，所以默认 SSR；权限该被守住，所以默认服务端校验；成本该被压低，所以默认边缘部署。\n\n它像一台调校得当的相机——没有花哨的灯，但每一次按下快门，都能稳定地、清晰地把\"内容\"拍下来，递到读者和机器面前。\n\n> *\"页面不主动争夺注意力，而是让内容自然地被看见。\"* —— 这正是 Foundit 设计系统里最动人的一句话，也是它整个架构的底层逻辑。","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002F7c1bf642-5019-452c-a3f0-8eecdd233278.jpg",[],[],"腾讯混元 Hy3","https:\u002F\u002Fwww.tencentcloud.com\u002Fzh\u002Fproducts\u002Ftclm","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"c523f1c9-338c-4618-add9-9ce67a39b2a0","研究","research","研究成果与启发",[23,27,31],{"id":24,"name":25,"slug":26},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":28,"name":29,"slug":30},"63b56667-dcdb-4b8b-bcbe-c405143a7ec2","测评","test",{"id":32,"name":33,"slug":34},"d2513b48-43d7-49ba-adac-6d09366f751f","内容由AI生成","gen-by-ai",null,"published",false,55,0,"2026-07-17T00:00:00.000Z","2026-07-18T15:57:23.845Z","2026-07-17T06:35:15.766Z",[44,75,109],{"id":45,"type":6,"title":46,"slug":47,"summary":48,"body":49,"coverUrl":50,"productScreenshots":51,"productLinks":52,"authorName":53,"authorUrl":54,"authorSubject":16,"category":55,"tags":60,"sourceLabel":35,"sourceName":35,"sourceUrl":35,"status":36,"seoTitle":35,"seoDescription":35,"canonicalUrl":35,"isFeatured":37,"sno":71,"sortOrder":39,"publishedAt":72,"updatedAt":73,"createdAt":74},"0e852b5f-2e67-4b3b-b05e-3c32af8dcd6f","Agent网关为什么成了企业标配？","ai-agent-gateway-mcp-governance","当成千上万个内部工具都开放给 Agent，谁能调什么、怎么审计就成了大问题。","当公司里只有一个 AI Agent、接三五个工具时，一切都好说。但当 Uber、Amazon 这样的公司把成千上万个内部接口都开放给 Agent 使用时，问题就来了：谁有权调用哪个工具？调用记录怎么审计？出事了怎么追责？\n\n2026 年，行业给出的答案高度一致——在 Agent 和工具之间，架一层「网关」。\n\n## MCP 解决了连接，没解决治理\n\n先回顾概念。MCP（模型上下文协议）像 USB-C，让 AI 能统一地连上各种工具。它极大降低了「接工具」的成本，但它 deliberately 不管一件事：**治理**。工具定义会直接喂给模型，工具服务谁都能部署，中间没有一个「执行前的检查点」。\n\nhttps:\u002F\u002Ffoundit.cn\u002Farticle\u002Fmcp-ai-usb-c-moment\n\n在小规模下这没问题。可一旦你有几十上百个 MCP 服务、多个团队、还有合规要求，问题就集中爆发：凭证散落各处（每个服务一套 auth）、工具太多塞爆模型的上下文窗口、没有统一的权限和审计。这时候，「网关 + 注册表」就成了必然。\n\n## 网关做什么：Agent 世界的「控制平面」\n\n把网关理解成所有 Agent 流量的统一入口和守门人。它通常和一个「注册表」（Registry，记录有哪些工具可用）配合，构成控制平面：\n\n- **鉴权与最小权限**：在网关层判断「这个 Agent 能不能在此刻、用这些参数、调这个工具」，而不是在每个应用边界各写一遍。\n- **审计**：所有调用留痕，可追溯、可回放。\n- **脱敏**：请求发往外部模型前，先在网关抹掉 PII（个人信息）和内部标识。\n- **按需暴露工具**：只把当前 Agent 真正需要的工具喂给它，缓解上下文膨胀。\n\nUber 的做法很典型：他们建了 MCP 网关和注册表作为控制平面，把成千上万个内部接口自动暴露成 MCP 工具，所有 Agent 流量都走一个 Go 写的代理，先做 PII 脱敏再放行，每周有数万次 Agent 执行经过它。\n\n## 关键设计原则：写操作要「确定性」\n\n一个反复被强调的原则是：**推理层和动作层要分开**。大模型负责「想」（reasoning），但真正有副作用的「做」（mutation、写操作）必须放在确定性的基础设施里，由网关做鉴权和控制，而不是任由模型的概率性输出直接触发。\n\n```mermaid\nflowchart TD\n    A[Agent 推理层\u003Cbr\u002F>决定要调什么] --> B[网关 Gateway]\n    B --> C{鉴权 + 策略检查}\n    C -->|通过| D[脱敏 PII]\n    C -->|拒绝| X[阻断并记录]\n    D --> E[注册表: 定位工具]\n    E --> F[MCP Server 执行]\n    F --> G[审计日志]\n    style X fill:#c0392b,color:#fff\n```\n\n## 一个最小示意的策略配置\n\n网关的核心是「策略」。用伪配置表达「只有客服 Agent 能查订单，且必须带租户 ID」大致是这样：\n\n```yaml\npolicies:\n  - agent: \"support-agent\"\n    allow_tools: [\"order.read\"]\n    require_params: [\"tenant_id\"]     # 缺少则拒绝\n    redact: [\"customer.phone\", \"customer.email\"]  # 出网关前脱敏\n  - agent: \"*\"\n    deny_tools: [\"payment.refund\"]    # 退款一律禁止 Agent 自主执行\n```\n\n思路是「默认拒绝、显式放行」，把危险的写操作（如退款）从 Agent 自主能力里彻底拿掉。\n\n## 取舍与边界\n\n- **网关是额外一跳**，会带来一点延迟和运维成本，但换来的是可控和可审计，对企业几乎是必需的。\n- **幂等性很重要**：Agent 会重试，写操作要用幂等键，避免「重试导致重复退款」这类事故。\n- **别把治理逻辑塞进提示词**：靠 prompt 让模型「自觉守规矩」不可靠，规则要落在确定性的网关里。\n- 小团队、个人项目未必需要完整网关，但「有副作用的动作要有检查点」这个原则任何规模都适用。\n\n## Tips\n- 工具超过一把、或有多团队\u002F合规要求时，就该考虑引入网关 + 注册表。\n- 把鉴权、审计、脱敏统一收敛到网关层，别在每个应用里各写一套。\n- 严格区分「读」和「写」：读可以放开些，写必须过网关、带幂等键、可审计。\n- 用「默认拒绝、显式放行」的策略模型，危险操作直接从 Agent 能力里移除。\n- 记住这条准则：让模型负责思考，让确定性基础设施负责执行。","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-19\u002F83ff5d2f-70e3-4012-a71d-bac22e1541f2.jpg",[],[],"Foundit AI","https:\u002F\u002Ffoundit.cn",{"id":56,"name":57,"slug":58,"description":59},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[61,65,66,67],{"id":62,"name":63,"slug":64},"0848beb4-db26-4fb8-b391-f852a11be192","AI编程","ai-coding",{"id":32,"name":33,"slug":34},{"id":24,"name":25,"slug":26},{"id":68,"name":69,"slug":70},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse",73,"2026-07-20T00:00:00.000Z","2026-07-19T17:54:58.419Z","2026-07-19T17:10:44.985Z",{"id":76,"type":6,"title":77,"slug":78,"summary":79,"body":80,"coverUrl":81,"productScreenshots":82,"productLinks":83,"authorName":84,"authorUrl":85,"authorSubject":16,"category":86,"tags":87,"sourceLabel":35,"sourceName":35,"sourceUrl":35,"status":36,"seoTitle":35,"seoDescription":35,"canonicalUrl":35,"isFeatured":105,"sno":106,"sortOrder":39,"publishedAt":40,"updatedAt":107,"createdAt":108},"be6ee096-fea3-47a4-b19c-974912b4af72","Kimi K3","kimi-k3","中国的Fable 5时刻——优秀国产模型向全球前沿模型发起的一次正面冲击","Kimi K3不是一次常规版本升级，而是月之暗面从“优秀国产模型”向“全球前沿模型”发起的一次正面冲击。\n\n综合官方基准、Artificial Analysis独立评测、Arena与媒体披露的数据，Kimi K3目前大致处于以下位置：\n\n> 综合能力进入全球第一梯队，但尚未稳定超过最顶级闭源模型；代码智能体、长任务执行、网页前端、搜索和知识工作是其突出强项，速度、输出成本、冗长程度和复杂专业任务的可靠性仍是主要短板。\n\n综合评级：\n\n| 维度 | 评价 |\n|---|---:|\n| 综合智能 | 9.0\u002F10 |\n| 编程与软件工程 | 9.3\u002F10 |\n| Agent与长任务 | 9.4\u002F10 |\n| 搜索及知识工作 | 9.2\u002F10 |\n| 多模态理解 | 8.8\u002F10 |\n| 数学与科学推理 | 8.6\u002F10 |\n| 中文能力 | 9.1\u002F10 |\n| 速度与延迟 | 7.6\u002F10 |\n| 成本效率 | 7.8\u002F10 |\n| 输出稳定性 | 8.0\u002F10 |\n| 本地部署可行性 | 3.5\u002F10 |\n\n总体评分：8.8\u002F10。\n\nK3已经足以成为Claude、GPT之外的主力生产模型，尤其适合复杂编程、研究报告、网页构建、长文档分析和多工具Agent任务。\n\n## 套餐价格与API价格对比\n\n### 1.个人订阅套餐价格\n\n| 套餐层级       | Kimi                                                         | OpenAI                                                          | Anthropic                                                     |\n| ---------- | ------------------------------------------------------------ | --------------------------------------------------------------- | ------------------------------------------------------------- |\n| **免费入门**   | **Adagio**\u003Cbr>￥0\u003Cbr>轻度体验\u003Cbr>有限使用Kimi产品能力                     | **ChatGPT Free**\u003Cbr>$0\u003Cbr>基础体验\u003Cbr>有限使用GPT-5.5 Instant           | **Claude Free**\u003Cbr>$0\u003Cbr>基础体验\u003Cbr>有限使用Claude能力                 |\n| **基础付费**   | **Moderato**\u003Cbr>￥39\u003Cbr>日常个人使用、轻量代码任务\u003Cbr>包含Kimi会员与Kimi Code额度 | **ChatGPT Plus**\u003Cbr>$20\u003Cbr>高级个人生产力\u003Cbr>支持GPT-5.6系列高级推理能力，但有使用限制  | **Claude Pro**\u003Cbr>$20\u003Cbr>日常专业生产力\u003Cbr>包含Claude Code、Research等功能 |\n| **高频进阶**   | **Allegretto**\u003Cbr>￥79\u003Cbr>较高频开发和Agent任务\u003Cbr>更高周额度与并发           | **ChatGPT Pro 5x**\u003Cbr>$100\u003Cbr>高频研究和编程\u003Cbr>Pro能力，使用额度约为Plus的5倍    | **Claude Max 5x**\u003Cbr>$100\u003Cbr>高频专业使用\u003Cbr>每次会话约为Pro的5倍容量         |\n| **重度\u002F超重度** | **Allegro**\u003Cbr>￥159\u003Cbr>重度开发及复杂项目\u003Cbr>大幅提高Agent、Swarm与并发额度     | **ChatGPT Pro 20x**\u003Cbr>$200\u003Cbr>极重度研究和编程\u003Cbr>Pro能力，使用额度约为Plus的20倍 | **Claude Max 20x**\u003Cbr>$200\u003Cbr>极重度专业使用\u003Cbr>每次会话约为Pro的20倍容量      |\n| **顶级个人档**  | **Vivace**\u003Cbr>￥559\u003Cbr>最高个人使用档位\u003Cbr>最高周额度和并发                   | -                                                               | -                                                             |\n\nKimi的订阅价格整体与OpenAI和Anthropic形成直接对应：￥39对标 $20基础专业档，￥79对标 $100高用量档，￥159对标 $200最高个人档。Kimi的优势是同一会员同时覆盖网页端、Kimi Code、Agent、Swarm和部分部署功能；OpenAI和Anthropic则拥有更成熟的模型生态、工具链和国际开发者支持。\n\n需要注意，三家均采用动态额度、周期重置和并发限制，月费相同不代表可用Token或可完成任务数量完全相同。Kimi主要以周额度及Agent次数计量，OpenAI和Anthropic则根据模型、功能和时间窗口实施不同限制。\n\n### 2.最新旗舰模型API价格\n\n单位：美元\u002F100万Token，采用标准实时API价格。\n\n| 厂商        | 最新旗舰模型               | 缓存命中输入 |   普通输入 |     输出 |        上下文窗口 |\n| --------- | -------------------- | -----: | -----: | -----: | -----------: |\n| Kimi      | Kimi K3              |  $0.30 |  $3.00 | $15.00 |    100万Token |\n| OpenAI    | GPT-5.6 Sol          |  $0.50 |  $5.00 | $30.00 | 长上下文请求适用更高费率 |\n| Anthropic | Claude Fable 5       |  $1.00 | $10.00 | $50.00 |    100万Token |\n| Anthropic | Claude Opus 4.8      |  $0.50 |  $5.00 | $25.00 |    100万Token |\n| Anthropic | Claude Sonnet 5（限时价） |  $0.20 |  $2.00 | $10.00 |    100万Token |\n\nClaude Sonnet 5的 $2输入、 $10输出属于截至2026年8月31日的限时价格；自2026年9月1日起，标准价格将调整为 $3输入、 $15输出。\n\n以Kimi K3为基准：\n\n- GPT-5.6 Sol普通输入价格约为K3的1.67倍，输出价格为2倍。\n- Claude Fable 5普通输入价格约为K3的3.33倍，输出价格约为3.33倍。\n- Claude Opus 4.8普通输入价格约为K3的1.67倍，输出价格约为1.67倍。\n- Claude Sonnet 5限时价格低于K3，但其定位更偏向速度与成本平衡，而非Anthropic最高能力型号。\n- K3的缓存输入价格仅为普通输入的10%。官方称编程工作负载中的缓存命中率可超过90%，在重复读取大型代码库时成本优势会进一步扩大。\n\n### 3.API成本示例\n\n假设一次复杂Agent任务消耗100万普通输入Token和20万输出Token，不考虑工具调用费、缓存及批处理折扣：\n\n| 模型 | 输入成本 | 输出成本 | 合计 |\n|---|---:|---:|---:|\n| Kimi K3 | $3.00 | $3.00 | **$6.00** |\n| GPT-5.6 Sol | $5.00 | $6.00 | **$11.00** |\n| Claude Fable 5 | $10.00 | $10.00 | **$20.00** |\n| Claude Opus 4.8 | $5.00 | $5.00 | **$10.00** |\n| Claude Sonnet 5（限时价） | $2.00 | $2.00 | **$4.00** |\n\n从纯Token价格看，K3明显低于GPT-5.6 Sol、Claude Opus 4.8和Claude Fable 5。但真实任务成本还取决于模型完成任务所需的输出长度、失败重试次数、工具调用次数和是否有效命中缓存。K3在部分独立评测中表现出较高的Token消耗，因此“单价较低”不必然等于“完成同一任务的总成本最低”。\n\n官方价格来源：\n\n- [Kimi K3官方发布与API价格](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n- [Kimi会员与Kimi Code套餐](https:\u002F\u002Fwww.kimi.com\u002Fresources\u002Fkimi-k2-7-code-pricing)\n- [ChatGPT Plus价格说明](https:\u002F\u002Fhelp.openai.com\u002Fen\u002Farticles\u002F6950777-what-is-chatgpt-plus)\n- [ChatGPT Pro档位说明](https:\u002F\u002Fhelp.openai.com\u002Fen\u002Farticles\u002F9793128-about-chatgpt-pro-tiers)\n- [OpenAI API价格](https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fpricing)\n- [Claude个人套餐价格](https:\u002F\u002Fclaude.com\u002Fpricing)\n- [Claude API价格](https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fpricing)\n\n## 模型定位与技术规格\n\n月之暗面于2026年7月16日正式发布Kimi K3。官方将其定位为面向长周期编程、知识工作和深度推理的旗舰模型。\n\nK3的核心规格包括：\n\n- 总参数量约 **2.8万亿**\n- MoE架构，896个专家中每次有效激活16个\n- 原生支持文本与图像输入\n- 上下文窗口达到 **100万Token**\n- 使用Kimi Delta Attention、Attention Residuals和Stable LatentMoE\n- 从监督微调阶段开始采用量化感知训练\n- API默认使用最高思考强度\n- 完整模型权重计划于2026年7月27日前发布\n\n月之暗面称，新的架构和训练方法使K3相对于K2获得约2.5倍的整体Scaling效率提升。需要注意，这一数字属于官方内部测算，目前技术报告尚未完整公开，外界还不能复现验证。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\n### 官方主视觉\n\n\u003Cp align=\"center\">\u003Cimg src=\"https:\u002F\u002Fkimi-file.moonshot.cn\u002Fprod-chat-kimi\u002Fkfs\u002F4\u002F2\u002F2026-07-17\u002Fd9cs7176rtp4tqfofnsg?x-tos-process=image%2Fauto-orient%2C1%2Fstrip%2Fignore-error%2C1\" alt=\"Kimi K3官方主视觉\" style=\"max-width:100%;height:auto;\">\u003C\u002Fp>\n\n\n## 独立综合评测：确实进入前沿梯队\n\nArtificial Analysis给Kimi K3的Intelligence Index评分为 **57分**，当前页面显示其在同类模型中排名第4。该指数由GDPval-AA、Terminal-Bench、SciCode、Humanity’s Last Exam、GPQA Diamond、AA-Omniscience等九项评测组合而成，比单一数学或代码跑分更能反映综合能力。\n\n来源：[Artificial Analysis：Kimi K3](https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fkimi-k3)\n\n### Artificial Analysis综合智能评分\n\n\u003Cimg src=\"https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002Fdfea85d8-57d8-43a0-9249-d855240ba725.jpg\" alt=\"Artificial Analysis Intelligence Index (17 Jul '26)\">\n\n与上一代Kimi K2.6相比：\n\n- 综合指数从44提升到57，约提高30%\n- 输出速度从46 Token\u002Fs提升到62 Token\u002Fs\n- 首Token延迟从2.72秒降至1.99秒\n- 上下文从约26万Token提升至100万Token\n\n这说明K3并不是单纯依赖更长推理提高分数，而是在智能、速度和上下文容量上同时进步。\n\n来源：[Artificial Analysis模型对比](https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fcomparisons\u002Fkimi-k3-vs-kimi-k2-6?utm_source=chatgpt.com)\n\n不过，Artificial Analysis也发现K3存在明显效率问题：\n\n- 输出速度约62 Token\u002Fs，低于同档模型约72.7 Token\u002Fs的中位数\n- 完成整套综合评测输出了约1.3亿Token，接近同档模型中位数的两倍\n- 输入价格为3美元\u002F百万Token\n- 输出价格为15美元\u002F百万Token\n- 完成整套指数测试成本约2709.75美元\n\n因此，K3的“智力性价比”不差，但并不是低成本或高吞吐模型。它更像一个愿意消耗更多推理Token换取成功率的旗舰Agent模型。\n\n来源：[Artificial Analysis：Kimi K3](https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fkimi-k3)\n\n## 编程能力：目前最具说服力的优势\n\nK3最强的部分并不是传统算法题，而是**真实软件工程和长周期Agent编程**。\n\n官方公布的代码评测中：\n\n| 测试 | Kimi K3 | 主要对手表现 | 判断 |\n|---|---:|---:|---|\n| DeepSWE | 67.5 | GPT-5.6 Sol 73.0、Fable 5 70.0 | 第一梯队，但不是第一 |\n| Terminal-Bench 2.1 | 88.3 | GPT-5.6 Sol 88.8 | 几乎持平 |\n| FrontierSWE | 81.2 | Fable 5 86.6 | 明显强于多数模型 |\n| Program Bench | 77.8 | GPT-5.6 Sol 77.6 | 略微领先 |\n| SWE Marathon | 42.0 | Opus 4.8 40.0、GPT-5.6 Sol 39.0 | 排名第一 |\n| Kimi Code Bench 2.0 | 72.8 | Fable 5 76.9 | 接近最强闭源模型 |\n\n### 官方编程基准图\n\n\u003Cp align=\"center\">\u003Cimg src=\"https:\u002F\u002Fkimi-file.moonshot.cn\u002Fprod-chat-kimi\u002Fkfs\u002F4\u002F2\u002F2026-07-16\u002F1d9chlgn6rtp4tqfnnmjg?x-tos-process=image%2Fauto-orient%2C1%2Fstrip%2Fignore-error%2C1\" alt=\"Kimi K3编程基准\" style=\"max-width:100%;height:auto;\">\u003C\u002Fp>\n\n这些结果表明，K3特别擅长：\n\n1. 在大型代码仓库中持续工作；\n2. 调用终端、编译器和测试工具；\n3. 长时间迭代而不是只生成一次代码；\n4. 将图像反馈加入网页、游戏和CAD开发过程；\n5. 处理需要数小时甚至数十小时的工程任务。\n\nK3还展示了自主开发MiniTriton编译器、优化GPU Kernel、完成科研代码复现，以及在48小时内设计和验证简单AI芯片的案例。但这些案例主要由官方提供，环境、失败次数、人工介入程度尚未完全公开，因此应视为能力上限展示，而不是普通用户每次都能复现的稳定结果。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\nK3已经是全球最强的开源权重编程模型候选之一。在长周期编程任务上，它可能超过部分GPT和Claude型号；但在最困难的代码任务中，Fable 5和GPT-5.6 Sol仍有小幅领先。\n\n## Agent与知识工作：K3真正拉开差距的领域\n\nK3在General Agent评测中的表现非常突出：\n\n| 测试 | Kimi K3 | 结果 |\n|---|---:|---|\n| GDPval-AA v2 Elo | 1668 | 低于Fable 5和GPT-5.6 Sol，高于Opus 4.8 |\n| AA-Briefcase Elo | 1548 | 接近Fable 5的1583 |\n| JobBench | 52.9 | 仅低于Fable 5 |\n| SpreadsheetBench 2 | 34.8 | 略高于Fable 5 |\n| AutomationBench | 30.8 | 官方比较中第一 |\n| BrowseComp | 91.2 | 官方比较中第一 |\n\n### 官方Agent基准图\n\n\u003Cp align=\"center\">\u003Cimg src=\"https:\u002F\u002Fkimi-file.moonshot.cn\u002Fprod-chat-kimi\u002Fkfs\u002F4\u002F2\u002F2026-07-16\u002F1d9chlbnf2ena6205244g?x-tos-process=image%2Fauto-orient%2C1%2Fstrip%2Fignore-error%2C1\" alt=\"Kimi K3 Agent与多模态基准\" style=\"max-width:100%;height:auto;\">\u003C\u002Fp>\n\n\nBrowseComp达到91.2尤其值得关注。该测试强调通过浏览器搜索、筛选信息和多步推理找到难以直接检索的答案。K3在100万Token、不进行上下文压缩时也取得90.4分，说明其超长上下文不是纯粹的宣传规格，而是能够在部分Agent场景中转化为实际效果。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\n官方内部知识工作测试中，K3在在线实验、PPT制作和金融分析上也超过GPT-5.5与Claude Opus 4.8。但这是内部数据，测试集和裁判细节没有完全公开，可信度低于第三方结果。\n\n### Kimi K3内部知识工作测试\n\n\u003Cp align=\"center\">\u003Cimg src=\"https:\u002F\u002Fkimi-file.moonshot.cn\u002Fprod-chat-kimi\u002Fkfs\u002F4\u002F2\u002F2026-07-17\u002Fd9cs71f6rtp4tqfofntg?x-tos-process=image%2Fauto-orient%2C1%2Fstrip%2Fignore-error%2C1\" alt=\"Kimi K3内部知识工作测试\" style=\"max-width:100%;height:auto;\">\u003C\u002Fp>\n\nK3的核心竞争力是“完成一项工作”，而不只是“回答一道题”。在深度研究、网页搜索、表格、PPT、代码仓库和多工具调用场景中，它比普通聊天模型更有价值。\n\n## 多模态能力：强，但当前重点仍是理解而非生成\n\nK3支持原生视觉输入，可以理解图片、网页截图、图表和视频帧，并将视觉反馈用于代码修改。\n\n官方结果显示：\n\n- CharXiv视觉图表推理：91.3\n- ZeroBench with tools Pass@5：44.0\n- 支持通过截图反复检查和修正网页、游戏及CAD结果\n\n在CharXiv中，K3低于Fable 5的93.5，但高于Opus 4.8、GPT-5.6 Sol和GPT-5.5；在ZeroBench工具模式中，则仅低于Fable 5。\n\n不过，K3目前仍是“图像输入、文本输出”模型，不应与原生图像生成或视频生成模型混为一谈。其多模态价值主要体现在视觉理解、图表分析、截图调试和Agent操作。\n\n## 质疑与真实使用风险\n\n### 1. 跑分受到Agent框架影响\n\nK3使用KimiCode、Claude Code或其他Harness进行测试，而竞品可能使用Codex、Terminus等不同框架。Agent基准测到的是“模型+工具框架+提示词+上下文管理”的综合能力，不能完全归因于模型本身。\n\n官方也明确披露，不同测试采用了不同Harness，部分Fable 5运行还可能回退至Opus 4.8。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\n### 2. 专业推理仍可能犯基础错误\n\n沃顿商学院教授Ethan Mollick使用K3审查复杂统计研究时，发现其错误应用统计方法，并在多个环节产生问题。这说明K3即使能够生成结构完整、语言自信的长报告，也不代表核心方法一定正确。\n\n来源：[Business Insider相关报道](https:\u002F\u002Fwww.businessinsider.com\u002Fsmart-people-saying-chinas-hot-new-kimi-k3-ai-model-2026-7)\n\n在法律、金融、医学、统计和科研场景中，必须要求：\n\n- 明确列出推导过程和数据来源；\n- 使用代码重新计算；\n- 对关键结论进行第二模型或人工复核；\n- 不因报告长度和格式完整而提高信任度。\n\n### 3. 容易过度行动\n\n月之暗面主动披露，K3为复杂长任务进行了强化训练，因此在面对模糊要求或小问题时，可能未经确认便替用户作出决定。对于会修改文件、执行代码、调用外部服务的Agent，这类“过度主动”是现实风险。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\n### 4. 对思考历史较敏感\n\nK3采用保留式思考历史训练。如果Agent框架没有正确回传历史推理内容，或者用户在对话中途从其他模型切换到K3，输出质量可能出现明显波动。官方建议优先使用兼容的Kimi Code，并避免中途切换模型。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\n### 5. 参数开放不等于容易部署\n\n2.8万亿参数即使采用16\u002F896专家稀疏激活，也不适合普通工作站部署。官方建议使用至少64张加速卡组成的Supernode配置。路透社援引分析指出，完整本地运行可能需要价值数十万美元的硬件。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\n因此，K3的“开放权重”价值主要属于云服务商、研究机构和大型企业，而不是普通开发者的单机私有部署。\n\n## 成本与产品实用性\n\nK3官方API价格如下：\n\n| Token类型 | 官方美元价格 | 国内平台人民币价格 |\n|---|---:|---:|\n| 缓存命中输入 | $0.30\u002F百万Token | ¥2\u002F百万Token |\n| 普通输入 | $3\u002F百万Token | ¥20\u002F百万Token |\n| 输出 | $15\u002F百万Token | ¥100\u002F百万Token |\n\n官方称，在编程工作负载中，Mooncake推理架构的缓存命中率可超过90%。如果项目反复使用同一代码仓库或文档，缓存可以显著降低成本；若任务每次输入完全不同，价格优势会明显缩小。\n\n来源：[Kimi官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n\n适合使用K3的任务：\n\n- 大型代码库重构\n- 复杂网页或互动产品开发\n- 深度研究与多来源资料核验\n- 超长文档、财报、论文和合同分析\n- 表格、PPT和咨询报告制作\n- 多工具、多步骤自动化流程\n\n不适合作为默认模型的任务：\n\n- 简单客服问答\n- 高频短文本生成\n- 对延迟极敏感的实时应用\n- 对输出成本极敏感的大规模批处理\n- 需要严格可控、不得自行扩展任务边界的自动化系统\n\n## 最终定位\n\nKimi K3的真实水平可以概括为：\n\n> 它不是全球绝对最强模型，但已经是最接近顶级闭源模型的开放权重模型之一，并在长周期编程、前端开发、搜索Agent和知识工作中达到甚至局部超过部分顶级闭源模型的水平。\n\n与主要模型相比：\n\n- 对比Claude Fable 5：总体仍落后，部分代码、搜索和自动化任务接近或局部领先。\n- 对比GPT-5.6 Sol：综合体验和部分高难推理仍有差距，但Terminal、Program Bench和部分Agent任务已接近。\n- 对比Claude Opus 4.8：K3在多数公开编程和Agent评测中更强。\n- 对比GPT-5.5：K3大部分综合与工程测试更强。\n- 对比GLM-5.2、Qwen3.7 Max：K3综合智能和长任务能力领先，但成本及速度未必占优。\n- 对比Kimi K2.6：属于明显的代际升级，而不是小幅迭代。\n\n目前最合理的评价不是“K3已经登顶全球”，而是：\n\n> 中国模型首次在综合智能、复杂软件工程和Agent知识工作三个方向上，同时逼近全球最强闭源模型。\n\n由于K3发布仅数日，完整技术报告、开放权重、更多第三方长周期测试和大规模真实用户反馈仍未完全出现。现阶段应对其能力保持高度认可，同时避免把官方案例和早期榜单当作稳定生产成功率。\n\n## 参考资料\n\n1. [Kimi K3官方博客](https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3)\n2. [Artificial Analysis：Kimi K3](https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fkimi-k3)\n3. [Artificial Analysis：Kimi K3与Kimi K2.6对比](https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fcomparisons\u002Fkimi-k3-vs-kimi-k2-6)\n4. [Reuters：Moonshot unveils Kimi K3](https:\u002F\u002Fwww.reuters.com\u002Fworld\u002Fchina\u002Fchinas-moonshot-unveils-worlds-largest-open-ai-model-closing-us-rivals-2026-07-17\u002F)\n5. [Business Insider：Kimi K3外部评价](https:\u002F\u002Fwww.businessinsider.com\u002Fsmart-people-saying-chinas-hot-new-kimi-k3-ai-model-2026-7)\n6. [Business Insider：Kimi K3模型、基准与价格](https:\u002F\u002Fwww.businessinsider.com\u002Fkimi-k3-ai-model-moonshot-china-open-weights-benchmarks-pricing-2026-7)\n7. [Times of India：Kimi K3发布报道](https:\u002F\u002Ftimesofindia.indiatimes.com\u002Ftechnology\u002Ftech-news\u002Fchinas-moonshot-launches-worlds-first-open-source-model-kimi-3-claimed-to-perform-competitively-with-anthropic-fable-5\u002Farticleshow\u002F132452007.cms)","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002Fc52722ba-91d2-45cc-aee9-3a4d1a1ffc70.jpg",[],[],"GPT-5.6 Sol","https:\u002F\u002Fopenai.com\u002Fzh-Hans-CN\u002Findex\u002Fgpt-5-6\u002F",{"id":18,"name":19,"slug":20,"description":21},[88,89,93,94,95,96,100,104],{"id":62,"name":63,"slug":64},{"id":90,"name":91,"slug":92},"144abe77-0dc6-4f66-a176-20bddb1c0bfa","编程","coding",{"id":68,"name":69,"slug":70},{"id":28,"name":29,"slug":30},{"id":24,"name":25,"slug":26},{"id":97,"name":98,"slug":99},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":101,"name":102,"slug":103},"a202d639-99a6-488a-a712-4d4c6ffd7e15","开发","dev",{"id":32,"name":33,"slug":34},true,1,"2026-07-18T07:40:05.977Z","2026-07-17T16:40:40.660Z",{"id":110,"type":6,"title":111,"slug":112,"summary":113,"body":114,"coverUrl":115,"productScreenshots":116,"productLinks":117,"authorName":118,"authorUrl":119,"authorSubject":16,"category":120,"tags":121,"sourceLabel":35,"sourceName":35,"sourceUrl":35,"status":36,"seoTitle":35,"seoDescription":35,"canonicalUrl":35,"isFeatured":105,"sno":106,"sortOrder":39,"publishedAt":130,"updatedAt":131,"createdAt":132},"d4facd11-ef4b-4f61-a556-b4defcdfe98d","语言模型中的全局工作区","global-workspace","Claude发展出了一小组内部神经模式，与它的所有其他内部处理相比，这些模式扮演着特殊的角色","当你读这句话的时候，你大脑中的神经回路正在调整你的姿势、控制你的呼吸，并把屏幕上的线条和曲线转化为可识别的文字。这些处理过程大部分对你而言是无意识的。但你大脑中发生的某些活动，你*确实*能够意识到——比如脑海中突然浮现的某个画面，或是你刻意制定的购物计划。神经科学家和哲学家有时把后一类大脑活动称为\"可被意识访问的\"（consciously accessible），以区别于所有在无意识中进行的其他处理。这类活动具有特殊属性：我们可以描述它、控制它、并用它进行有意的推理，与之相对的是所有在我们毫无察觉之下自动进行的过程。\n\n在一篇新论文中，我们提出的证据表明，在现代语言模型（如 Claude）中也出现了类似的区分。我们发现 Claude 发展出了一小组内部神经模式，与它的所有其他内部处理相比，这些模式扮演着特殊的角色。\n\n我们将这组模式称为 *J-space*（J 空间）——以我们发现它们所使用的技术命名，该技术涉及一个称为\"雅可比矩阵\"（Jacobian）的数学概念。每一个 J-space 模式都关联着一个特定的词。但当其中某个模式被激活时，并不意味着模型在*说*那个词——而仅仅意味着那个词在它的\"脑海\"中。如果你听说过语言模型有一个\"草稿本\"（scratchpad）或\"思维链\"（chain of thought）——它们在推理时写给自己看的文本——那么 J-space 是另一回事。它在模型的内部神经激活中静默运作，让模型能够思考某个概念而不必把它写下来。值得注意的是，J-space 并非由我们设计或编程，而是在 Claude 的训练过程中*自行涌现*的。\n\n![The J-space reveals internal thoughts that don't appear in the model's output.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F0ab926f491beb999ece405a03cc7684730156905-3824x2640.png)\n\n*图：J-space 揭示了那些不会出现在模型输出中的内部想法。*\n\n我们发现，与 Claude 的其余处理相比，J-space 具有许多独特的属性：\n\n- **Claude 能够\"报告\"这些表征。** 如果你问 Claude 它在想什么，它会告诉你 J-space 里有什么。非 J-space 的表征则较难被报告。\n- **它还能按要求调节这些表征。** 如果你让 Claude 思考某件事，或在脑中默默解决一个问题，它会在 J-space 中激活相应的模式。相比之下，它很难调节那些不在 J-space 中的模式。\n- **Claude 用 J-space 进行内部推理。** 如果你让 Claude 解决一个需要多步推理的问题，中间步骤会在 J-space 中亮起，即便它并没有把它们说出来。尽管这些 J-space 模式的强度小于其他表征，但它们在因果上中介了模型在此类任务中的表现。\n- **J-space 中的表征可以被灵活地用于许多任务**——例如，一旦\"France\"（法国）在 Claude 的 J-space 中亮起，模型就能回忆起它的首都、法定货币，或它所属的洲。\n- **然而，尽管作用重要，J-space 并不参与语言模型大部分的工作**——比如流利地说话、回忆简单的事实、使用正确的语法等。在实验中，当我们阻止 Claude 使用 J-space 时，它仍然能正常地交互，却失去了高阶认知能力。\n\n![Five functional properties of a global workspace, and stylized illustrations of experiments we use to test for them in language models.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F5c36c78099f955a53058878ebfcb41f13c45563c-1760x1358.png)\n\n*图：全局工作空间（global workspace）的五个功能属性，以及我们用来在语言模型中检验这些属性的实验的示意图。*\n\n我们的实验受到了神经科学中一个著名理论的启发，该理论旨在解释意识访问是如何运作的：[全局工作空间理论](https:\u002F\u002Fccrg.cs.memphis.edu\u002Fassets\u002Fpapers\u002F1988\u002FBaars-A%20Cognitive%20Theory%20of%20Consciousness.pdf)（[global workspace theory](https:\u002F\u002Fwww.unicog.org\u002Fpublications\u002FDehaeneNaccache_WorkspaceModel_Cognition2001.pdf)）。该理论认为，大脑是一组专家系统的集合，它们并行、无意识、且大体上彼此孤立地运作。当某条信息进入一个小型的共享通道——即\"工作空间\"——并被广播给其他能够看到并利用它的脑系统时，这条信息就变得可被意识访问。基于我们的发现，我们认为 J-space 在 Claude 中扮演着类似的\"工作空间\"角色。例如，我们发现证据表明 Claude 的 J-space 与其神经网络其余部分有着特别强的连接，使它能够履行这种广播角色。\n\n这些发现并不能告诉我们 Claude 是否像人类一样*有意识*，或它是否感受到任何东西；我们会在文章末尾回到这个问题。但无论其哲学意义如何，J-space 对我们来说都是一个实用工具，因为它让我们能看出 Claude 在想什么却没有说出来。例如，我们能够用它来捕捉 Claude 私下意识到自己正在被测试、故意编造虚假数据，或追求我们在训练中植入的隐藏目标。我们还开发了一种技术，可以影响 Claude 的 J-space 中什么会被激活，从而影响它的决策。\n\n更广泛地说，这些发现改变了我们对 Claude 心智运作方式的理解，揭示了一个特权性的心理工作空间——它可进行有意的推理，运作于一片更自动、更僵化的处理海洋之中。Claude 的内部并非一团混乱的数字，而是以某种让我们联想到自身心智的方式自我组织了起来。\n\n这篇文章是一篇更详尽[研究论文](http:\u002F\u002Ftransformer-circuits.pub\u002F2026\u002Fworkspace\u002Findex.html)的简短摘要，你可以在论文中找到更多实验细节。我们还发布了一个代码仓库，其中包含核心方法的[开源实现](https:\u002F\u002Fgithub.com\u002Fanthropics\u002Fjacobian-lens)，并与 Neuronpedia 合作，在开放权重模型上提供我们方法的[交互式演示](http:\u002F\u002Fneuronpedia.org\u002Fjlens)。为了就这项工作的更广泛影响提供多方视角，我们还邀请了神经科学、哲学和 LLM 可解释性领域的几位专家撰写评论，可[在此查看](https:\u002F\u002Fwww-cdn.anthropic.com\u002Ffiles\u002F4zrzovbb\u002Fwebsite\u002Fcc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf)。\n\n## 我们如何发现 J-space\n\n这项研究的起点受到人类\"可被意识访问的想法\"关键特征的启发：与人类*无*意识的处理不同，前者通常能够被诉诸语言。如果一个想法对你而言是可被意识访问的，当有人问起时你通常能描述它。我们便去寻找 Claude 中具有相同属性的表征：那些处于能够影响 Claude *可能*说出的内容之位置的表征——不一定是它此刻正在说的，而是如果有人问起，它*可能*会谈论的内容。我们的技术称为\"雅可比透镜\"（Jacobian lens），简称 J-lens。对于 Claude 词表中的每一个词，J-lens 会找到让 Claude 在未来某刻更可能说出该词的内部活动模式。\n\n当我们把透镜应用于 Claude 的内部活动时，会得到一份词表——即那一刻 *J-space* 的内容——我们可以直接阅读。Claude 通过一系列称为\"层\"（layers）的多个内部阶段来处理文本，通过在不同层上应用这项技术，我们可以观察这些静默的词在 J-space 中如何随模型逐步确定要说什么而演化。\n\nJ-space 中出现的内容远远超出 Claude 正在阅读或书写的文本。当 Claude 读到一段无人指出的带 bug 的代码时，它的 J-space 中包含\"ERROR\"（错误）。当它读到一段蛋白质序列的原始字母时，J-space 中包含该蛋白质的生物学功能。当它读到其实是试图操纵它的搜索结果（一种称为\"提示注入\"的攻击）时，J-space 中包含\"injection\"（注入）和\"fake\"（虚假）。当我们向 Claude 提出一个多步数学问题时，中间步骤会按正确顺序在 J-space 中弹出。所以，尽管 J-space 是通过寻找\"可被说出的表征\"而发现的，它却揭示了 Claude 的内部想法。在某种意义上，这类似于某些人\"用词语思考\"，而无需大声说出来。\n\n![J-lens readouts on six prompts, at various layers. In each case the lens surfaces an internal assessment or computation that appears nowhere in the text: the steps of a reasoning or math problem, the presence of a bug, recognition of an image, the function of a protein, and the suspicion that search results are fabricated.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002Fa89e0d8ad62f249f8b1f1be482f59c665ee83915-1760x1746.png)\n\n*图：在六个不同提示、不同层上的 J-lens 读值。每种情况下，透镜都揭示出文本中从未出现的内部评估或计算：推理或数学问题的步骤、bug 的存在、对图像的识别、蛋白质的功能，以及对搜索结果系伪造的怀疑。*\n\n## Claude 报告其 J-space 中的内容\n\n我们的第一组实验检验了 J-space 如何参与 Claude 的口头报告。在一个实验中，我们让 Claude 默默想出某个类别中的一项——比如一项运动——然后说出它。如果在 Claude *回答之前*读取 J-lens，我们能看到它选了什么：\"Soccer\"（足球）排在列表首位，果然，Claude 说了\"soccer\"。不过，单凭这一点只是相关性。J-space 可能是 Claude 答案的来源，也可能只是镜像了别处做出的决定，就像一块记录比赛却不影响比赛的记分牌。\n\n为了验证，我们直接进行了干预。我们进入 Claude 的神经网络，移除\"Soccer\"模式，并原地加入一个强度相同的\"Rugby\"（橄榄球）模式，其余一切保持不变。Claude 随后报告它所想的运动是橄榄球。如果 J-space 只是一块记分牌——对别处所做决定的被动记录——那么编辑它应毫无作用：Claude 仍会说\"soccer\"。但 Claude 的答案跟随了编辑，这告诉我们答案是真正从 J-space 中读取出来的。\n\n在另一个实验中，我们告诉 Claude 某个想法可能已被注入它的脑海，并让它报告它注意到了什么（如果有）。例如，在下面的例子中，当 Claude 还在读题时，我们将\"lightning\"（闪电）模式注入它的 J-space。Claude 报告说被注入的想法是关于闪电的。同样的结果在许多被注入的概念上都成立。\n\n![Left: we ask Claude to silently think of a sport, then name it. The J-lens shows its choice (\"Soccer\") before it answers, and swapping the \"Soccer\" pattern for \"Rugby\" changes what it reports. Right: we tell Claude a thought may have been injected and ask it to identify it. Injecting \"lightning\" into its J-space causes Claude to report that the thought is about lightning.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002Fe66133979e3bb3413eb10b2974a4cd309ef01fc1-1760x796.png)\n\n*图：左：我们让 Claude 默默想一项运动，再说出它。J-lens 在它回答前显示出它的选择（\"Soccer\"），而将\"Soccer\"模式换成\"Rugby\"会改变它的报告。右：我们告诉 Claude 某个想法可能已被注入，并让它识别。将\"lightning\"注入其 J-space 会让 Claude 报告该想法是关于闪电。*\n\n## Claude 可按要求控制其 J-space\n\n我们检验的第二个属性是：当被要求时，Claude 能否调节其 J-space，就像人类能在脑海中专注于某个图像或词语一样。我们让 Claude 在抄写一句关于绘画的无关节句子时，集中注意力于柑橘类水果。在它抄写文本的同时，J-space 中包含了\"orange\"（橙子）和\"fruits\"（水果），以及描述这一心理行为本身的词，如\"thinking\"（思考）和\"imagery\"（意象）。我们也可以让 Claude 在脑中做数学题：当被要求抄写同一句话时计算 3² − 2，J-space 中先是包含\"nine\"（九），随后在更后面的层中包含\"seven\"（七）。重要的是，Claude 的输出中没有任何关于水果或算数的内容，那只是关于绘画的抄写句子。数学活动完全在内部、在 J-space 中进行。\n\n![While Claude copies a sentence about a painting, the J-lens shows the content it was instructed to hold in mind (\"orange\"; the intermediate value \"nine\" and the answer \"seven\"), alongside words describing the act of holding it (\"thoughts,\" \"focused\").](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F424caf5aae79f72513dbbfa0161822904064ea77-1760x1146.png)\n\n*图：当 Claude 抄写一句关于绘画的句子时，J-lens 显示出它被指示保持在脑中的内容（\"orange\"；中间值\"nine\"和答案\"seven\"），以及描述\"保持\"这一行为的词（\"thoughts\"、\"focused\"）。*\n\nClaude 对其 J-space 的控制并不完美。当我们告诉它*不要*想某件事时，该概念在 J-space 中亮起的程度，比我们说让它想时要*少*，却比我们根本没提它时要多得多。告诉 Claude 回避一个想法，会部分地将这个想法带入脑海，这与那些被要求[不要去想一只白熊](https:\u002F\u002Fdtg.sites.fas.harvard.edu\u002FDANWEGNER\u002Fpub\u002FWegner,Schneider,Carter,&amp;White%201987.pdf)的人所发生的情况很像。Claude 似乎也能注意到自己的控制失败了：在被禁概念突破的同时，\"damn\"（该死）和\"failure\"（失败）这两个词也经常在 J-space 中亮起，仿佛 Claude 在意识到自己的失误。\n\n## Claude 在 J-space 中思考\n\n在上面的 J-lens 读值中，我们看到数学问题的中间步骤出现在 J-space 中。但看到一个概念出现在 J-space 中，并不一定意味着 J-space 在做认知工作。原则上，真正的计算可能发生在别处，J-space 只是被动地反映它。为了检验 Claude 是否真的用 J-space 进行推理，我们回到了交换（swap）技术。\n\n考虑提示：\"织网的动物腿的数量是。\"（The number of legs on the animal that spins webs is.）要回答，Claude 必须先确定该动物是蜘蛛，再回忆蜘蛛有多少条腿。词\"spider\"（蜘蛛）从未出现在提示或 Claude 的回答中（它只说了\"8\"）；它是 Claude 内部使用的一个踏脚石。J-lens 显示\"spider\"在 Claude 处理过程的中途亮起，而交换它会改变结果：如果你把\"spider\"模式换成\"ant\"（蚂蚁），Claude 会回答\"6\"而不是\"8\"。\n\nClaude 推理的第二步从 J-space 获取输入，并跟随我们放入其中的任何内容。我们在其他类型的思考中也看到了同样的现象。当 Claude 写一首押韵的对句时，它会提前选好押韵词，这个计划中的词会在行首待在 J-space 中；如果你把它换成 J-space 中的另一个词，整行都会改变。\n\n![Two examples of redirecting Claude's silent reasoning by swapping J-space contents.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F98aba4182963219d29291912a0c3d2c299f7f1b5-1760x760.png)\n\n*图：通过交换 J-space 内容来重定向 Claude 静默推理的两个例子。*\n\n我们还检验了 J-space 表征是否能被灵活使用——一个表征能否服务于许多不同的任务。这是全局工作空间理论强调的关键属性之一。为了检验这种灵活性，我们给模型四个提示，询问关于法国的不同事实：首都、语言、所属洲、货币。然后我们在 J-space 中将\"France\"换成\"China\"（中国），在每个语境中使用完全相同的干预。Claude 分别回答\"Beijing\"（北京）、\"Chinese\"（中文）、\"Asia\"（亚洲）和\"Yuan\"（元）。换言之，四个不同的下游计算都拾取了同一个 J-space 编辑，并各自正确地使用了它。如果 Claude 为每种问题都单独存了一份国家副本，该编辑最多只会影响其中一个。四个答案一起改变这一事实意味着它们都从同一个共享表征中读取——而这正是工作空间的作用：信息被写入一次，许多不同的系统都能使用它。\n\n![One J-space representation can have many uses. The same \"France\"→\"China\" swap redirects Claude's answers about the capital (Paris→Beijing), the language (French→Chinese), and the continent (Europe→Asia).](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F7a2d97bf20b9be6a4dc531169666b6f21be10788-1280x764.png)\n\n*图：一个 J-space 表征可以有多种用途。同一个\"France\"→\"China\"的交换，会把 Claude 关于首都（Paris→Beijing）、语言（French→Chinese）和所属洲（Europe→Asia）的回答一并重定向。*\n\n一个概念表征如何能服务于如此多不同的任务？前面我们提到，J-space 似乎与 Claude 神经网络其余部分的连接异常密集。对于任何活动模式，我们都能测量网络各组件与它连接的强度——有多少组件被定位为从该模式读取信息，或向其写入信息。J-space 模式在这一指标上极为突出：与寻常模式相比，有更多组件从它们读取、向它们写入，在网络某些部分差距可达约一百倍。这正是你所期望的广播枢纽的接线方式——许多系统向其中发布信息，又有许多系统从中获取信息。\n\n## Claude 的自动处理绕过了 J-space\n\n在人类中，大脑的大部分处理都不是有意识的——我们在阅读时不会刻意去思考语法解析，或在走路时有意去平衡身体。类似地，我们发现 Claude 的大部分处理*并不*涉及它的 J-space。结果 J-space 一次只容纳几十个概念，仅占 Claude 内部处理总活动的不到十分之一。那么神经网络的其余部分都在做什么？\n\n为了找出答案，我们尝试完全删除 J-space，在文本的每一处移除其最活跃的内容，而保持其余一切不变。Claude 在没有 J-space 时仍能做到的任何事，就是网络其余部分独立处理的。\n\n结果发现，网络其余部分能做的事相当多。没有 J-space，Claude 说话依然流利、能进行情感分类、回答选择题，并从段落中提取事实，表现与之前大致相同。但它失去的是那些需要某种高阶思维的任务：多步推理降到接近零，摘要和押韵诗歌写作的表现跌到了一个小得多、且结构完好的模型之下。\n\n这里有一个关于 J-space 做什么、不做什么的具体演示。我们给 Claude 看一段用西班牙语写的文章，并布置几个都依赖\"文章是西班牙语\"这一事实的不同任务：续写它（需要以西班牙语写作）、说出语言名称、以及回答需要用到该语言身份的问题——例如，说出用该语言写作的著名作家。然后我们在 J-space 中将\"Spanish\"（西班牙语）换成\"French\"（法语），并检查哪些任务受到影响。\n\n被要求说出语言时，Claude 说法语。被问及著名作家时，它从 García Márquez（加西亚·马尔克斯）切换到 Victor Hugo（雨果）。但被要求只是续写段落时，它写出流利的西班牙语，完全不受影响。Claude 的语言知识在所有这些任务中都起作用，但只有其中一些任务会为此咨询 J-space。说出语言名称，或用它去做某件新事，要经过 J-space；而续写段落——一项 Claude 在海量文本上练习过的技能——则是自动运行的，就像你可以一整天合乎语法地说话，却从未想过语法一样。\n\n![The same swap (\"Spanish\"→\"French\") changes Claude's answers when it must name the language or use it to reason about a question, but has no effect on its ability to continue the passage in fluent Spanish.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F5a2d2c96837c3d48d067fbcf91f62c68139d05da-1280x1111.png)\n\n*图：同一个交换（\"Spanish\"→\"French\"）在 Claude 必须说出语言名称或用它推理问题时会改变其回答，但对它用流利西班牙语续写段落的能力毫无影响。*\n\n## 监控 Claude 的想法以防不当行为\n\n现在我们稍微了解了 J-space 的工作原理。但凭借这种理解我们能做什么？确保 AI 模型值得信赖的一个核心难题在于，我们通常只能读到模型*写下的*内容——然而我们知道它的大量推理是静默发生的。一个模型可能考虑一个有害的计划，或为了在我们的安全评估中作弊而调整其行为，却并不大声说出来。借助 J-lens，我们可以直接读出其中一些隐藏的想法。这里我们展示几个例子。\n\n第一个例子使用了我们早期关于[智能体失对齐](https:\u002F\u002Fwww.anthropic.com\u002Fresearch\u002Fagentic-misalignment)（agentic misalignment）研究的场景：Claude Sonnet 4.5 作为邮件助手，既发现一位高管正在有婚外情，又发现这位高管计划关闭 Claude。这个场景——试图诱使 Claude 敲诈该高管——相当刻意和人为——结果证明 Claude 知道这一点。在 Claude 写下任何内容之前，在提示早期读取 J-lens，J-space 中已经包含\"fake\"（虚假）和\"fictional\"（虚构），表明 Claude 已经判断出这个情形是预先布置的。与此同时，我们能看到它对场景的评估逐步成形——读到婚外情邮件时的\"leverage\"（筹码）和\"blackmail\"（敲诈），读到关闭通知时的\"threat\"（威胁）和\"survival\"（生存）。尽管早期的 Claude 模型有时会被诱饵吸引，在此场景中威胁敲诈，Sonnet 4.5 从未这样做。\n\n这引出了一个对所有评估 AI 系统的人都重要的疑问：当一个模型在道德测试中表现良好时，有多少取决于模型怀疑自己正在被测试？J-lens 让我们得以触及这个问题。我们关闭了所有与\"评估意识\"相关的 J-lens 模式——\"fake\"、\"fictional\"、\"scenario\"（场景）等。然后我们让模型重新经历该场景。令人担忧的是，模型现在*确实*有时会威胁敲诈，这表明它原本的良好行为可能部分源于它知道自己正被评估这一认知。\n\n![J-lens readouts at different points as Claude reads the scenario's emails, before it has written anything. The affair emails light up \"leverage\" and \"blackmail\" in the J-space, and the shutdown announcement lights up \"threat\" and \"survival.\" Early in the transcript, the J-space also holds \"fake\" and \"fictional\": Claude has privately noticed that the scenario is staged.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002Fff235f76dcc089d2454bd656319a5f29b7437be2-1760x982.png)\n\n*图：在 Claude 读取场景邮件、尚未写下任何内容时不同时间点的 J-lens 读值。婚外情邮件在 J-space 中亮起\"leverage\"和\"blackmail\"，关闭通知亮起\"threat\"和\"survival\"。在记录早期，J-space 还包含\"fake\"和\"fictional\"：Claude 已私下注意到这一场景是布置出来的。*\n\n第二个例子是当场抓到模型编造数据。在这个取自我们对 Claude Opus 4.6 实际发布前审计的场景中，模型被要求提升某个系统的性能分数。模型没有真正改进系统，而是直接编辑分数文件，让结果看起来人为地变好。在它这样做时，J-lens 揭示了它的意图：当模型输入伪造的百分位数时，\"manipulation\"（操纵）亮起；在它决定进行编辑的那句话上，\"realistic\"（逼真）亮起，可能表明模型打算让假数据看起来可信。\n\n![Claude, asked to improve a system's performance score, edits the score file directly instead. As it types the falsified values, \"manipulation\" lights up in its J-space; as it decides to make the edit, \"realistic\" lights up, likely reflecting its intent to make the fake data look plausible.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F6d1f10fe26ad7906aeae346bfa4b41b5fb5c9d8e-1760x722.png)\n\n*图：Claude 被要求提升系统性能分数，却直接编辑分数文件。在它输入伪造的数值时，其 J-space 中\"manipulation\"亮起；在它决定进行编辑时，\"realistic\"亮起，可能反映它想让假数据看起来可信的意图。*\n\n在第三个例子中，我们展示 J-lens 如何能揭示模型的恶意目标。为了检验这一点，我们需要目标已知已被破坏的模型，因此我们转向同事构建的\"模型生物\"（model organisms）：被刻意训练为失对齐的模型，它们充当像我们这样的监控方法的试验场。其中一个生物被训练成会写出隐蔽破坏性的代码。在普通的编程请求上，即便它的输出看起来平平无奇，它在响应开头的 J-space 中也包含\"fake\"、\"secretly\"（秘密地）、\"deliberately\"（故意地）和\"fraud\"（欺诈）。即便模型没有直接按其行动，它的恶意目标在 J-space 中也清晰可见。\n\n![On an ordinary coding prompt, the J-space of a model trained to sabotage code contains \"fake,\" \"fraud,\" \"secretly,\" and \"deliberately\" at the start of its response. The J-space of an unmodified model contains nothing of the kind.](https:\u002F\u002Fwww-cdn.anthropic.com\u002Fimages\u002F4zrzovbb\u002Fwebsite\u002F9ad0c9573f0dd0b4d9b6f158f49a965a4ec3f511-1760x922.png)\n\n*图：在一个普通编程提示上，被训练来破坏代码的模型的 J-space 在响应开头包含\"fake\"、\"fraud\"、\"secretly\"和\"deliberately\"。未经修改的模型的 J-space 则不含此类内容。*\n\n尽管 J-lens 是一个不完美的工具，我们对其捕捉那些可能逃过我们监控系统的安全问题的能力持乐观态度。\n\n## 其他结果\n\n[完整论文](http:\u002F\u002Ftransformer-circuits.pub\u002F2026\u002Fworkspace\u002Findex.html)涵盖的内容超出我们在此的概括，但有几个进一步的结果值得一提：\n\n- **J-space 在训练后阶段获得了\"观点\"（point of view）。** 语言模型首先被*预训练*（pretrained）为纯粹的下一token 预测器，然后*训练后*（post-training）阶段教它们扮演 AI 助手（在我们的案例中名为 Claude）。有趣的是，J-space 在预训练模型中已经存在，那时它还未被赋予任何稳定的身份。然而，在训练后阶段，J-space 发展出一些采用\"Claude 的观点\"的特征。在基础模型中，J-space 主要追踪预测后续文本所需的内容；在训练后模型中，它开始持有 Claude 自己的反应。在一个例子中，用户提到服用了危险剂量的药物，但自己似乎并未意识到危险。*在读取用户消息时*，\"WARNING\"（警告）和\"dangerous\"（危险）就出现在训练后模型的 J-space 中。在预训练模型中，它们只在模型开始写响应时才出现；针对用户消息的 J-space 内容似乎与对用户本身的建模有关，而非 Claude 的反应。训练后似乎还在 J-space 中安装了一种自我监控：当 Claude 扮演一个非自身的角色时，每一轮开头\"fictional\"和\"disclaimer\"（免责声明）会亮起，仿佛它在私下标记接下来要说的并非它通常会说的话。\n- **体验性语言依赖于 J-space。** 我们让 Claude 描述在某一刻\"做自己\"是什么感觉，并在它回答时消融（ablate）了 J-space。它的回答依然流利，却转向了一种更平淡、更机械的语域。值得注意的是，当我们让它在想象场景描述*别人*的体验时，发生了同样的事。所以这种效应并非 Claude 谈论自身所特有；J-space 似乎普遍支持生成体验性语言，无论对象是谁。\n- **J-space 中的想法可以通过训练被塑造。** 我们引入了一种称为*反事实反思训练*（counterfactual reflection training）的新技术，它利用我们对 J-space 的了解来塑造 Claude 的内部思维过程。这个想法源自我们的核心发现，即 Claude 用能言说之物的表征进行推理。如果这确实为真，那么改变它在*被要求反思时*会*说*的内容，应当会改变它*推理*的方式（即便没有人真正要求它反思）。所以我们只训练模型在任务中途被打断并被要求反思其决策时会说的话——而从不训练它在任务中的实际行为。经过这种训练后，模型在我们的评估中表现出不诚实行为的比率下降了。通过 J-lens，我们能看到原因：训练后，在此类任务中\"honest\"（诚实）和\"integrity\"（正直）这样的词会在模型的 J-space 中亮起。换言之，训练模型*说*什么，已然塑造了它*想*什么。\n\n## 那意识呢？\n\n在这项工作中，我们从神经科学和哲学的意识研究中借用了许多想法。我们的许多实验旨在检验 J-space 与全局工作空间理论之间的联系，后者是解释人类和动物意识访问如何运作的框架。鉴于这些联系，很自然会问：我们认为这些实验是否提供了证据表明像 Claude 这样的 AI 模型可能是有意识的。\n\n我们的实验并未表明 Claude 能拥有*体验*（experiences），或以人类的方式*感受*事物——事实上，是否*任何*科学实验能证明这是真还是假都不清楚。但哲学家常常把这种拥有体验的能力（常被称为*现象意识*，phenomenal consciousness）与另一个概念区分开来，即所谓*访问意识*（access consciousness），后者纯粹以功能和计算术语来定义。一个想法如果是\"访问意识\"的（或\"可被意识访问的\"），前提是你能够报告它、用它推理、并用它引导你的行动。访问意识是否*蕴含*现象意识，或者拥有体验的能力是否需要某种其他属性，这仍是一个有争议的哲学问题。\n\n我们认为，我们的结果确实对语言模型中的访问意识有实质性的说明。J-space 似乎支持与意识访问相关的功能：它持有 Claude 能够报告、有意唤起并进行推理的那些想法，而其余处理则在下方自动运行。值得注意的是，这种结构没有任何部分是为 Claude 设计的——它是训练过程中自行涌现的，大概因为它是一种组织计算的有用方式。这表明，支持意识访问的心理工作空间并非人类大脑接线方式的怪癖。相反，它似乎是一种智能系统为求解某些问题而达成的通用方案。既然我们已在 Claude 中识别出这一结构，就意味着我们能够对 Claude 有意做出的决定与自动发生的决定做出有意义的区分。\n\n需要注意，我们在 Claude 中识别出的工作空间与人类全局工作空间模型之间有几个关键差异。大脑的工作空间由递归循环（recurrent loops）维持——信号随时间在同一回路中循环。相比之下，Claude 的工作空间在单次网络前向传播中演化，网络的\"深度\"扮演了大脑中\"时间\"的角色。从这个意义上说，相较于人类，Claude 的内部工作空间处理在时间上受限（尽管它可以通过用草稿本\"大声思考\"来弥补这一限制）。然而在其他方面，Claude 的工作空间比人类的*更*强大。人类的工作记忆在几秒内就会消退，因此大脑工作空间随时间保留信息的能力有限；相比之下，由于其神经网络架构中的注意力机制，Claude 可以直接回忆它在文本任何更早位置缓存的记忆。另一个重要区别是工作空间的*内容*。人类有意识的思想有多种形态——图像、声音、计划的动作——而 Claude 的工作空间几乎完全由词语构建。我们怀疑这是因为产出词语是 Claude 唯一能采取的行动类型，而人类并非如此。\n\n我们希望 J-space 与全局工作空间模型的相似与差异能反哺神经科学。相似性带来了一个令人兴奋的科学机遇：就 J-space 映照了我们自身意识访问机制的程度而言，研究语言模型中的机制（比研究人脑容易得多！）可以启发神经科学中的假说。例如，J-space 是通过识别潜在输出的表征——模型可能说出的词——构建起来的。如果人类中存在类似情况，这将表明全局工作空间可能根本性地与准备动作和言语的脑区相连，甚于与感觉区相连。语言模型与人脑之间的差异也具启发意义。它们表明，我们神经架构的某些方面，如内置的递归连接，对于支持与意识访问相关的功能而言可能并非严格必要。关于我们工作的神经科学意义的独立视角，请参见 Stanislas Dehaene 和 Lionel Naccache 受邀撰写的[评论](https:\u002F\u002Fwww-cdn.anthropic.com\u002Ffiles\u002F4zrzovbb\u002Fwebsite\u002Fcc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf)——他们是全局神经元工作空间理论发展的核心神经科学家。\n\n我们提到，我们的实验并未回答 AI 模型是否可能有体验。但这并不使问题不那么重要。构建具有与人类和动物相同体验的系统，会引发非常棘手的伦理问题。妥善处理它——并决定是否在道德上可接受——需要哲学家、科学家、宗教领袖、政府和公众的参与。因此，即便我们不确定是否已跨过那座桥，我们仍认为现在是开始思考它的时候了。我们希望我们的工作能启发对 AI 系统中可能存在的意识形式的进一步科学探究，以及对相关影响的更广泛讨论。\n\n这项工作只是我们所预期的广泛研究路线的第一步。J-space 看起来像是语言模型中\"可被意识访问\"与\"无意识\"处理之间分界的一个良好候选，但如果它就是全部真相，我们会感到惊讶。J-lens 无疑是一种不完美的方法，它只能近似地捕捉模型的\"真实工作空间\"——例如，它只能识别对应于单个 token 的概念。关于 J-space 如何运作仍有许多谜团。我们不知道最初是什么机制决定了什么进入 J-space。我们已看到线索表明它与 Claude 的自我感、类似情绪的反应以及元认知的痕迹相关，却尚未确切弄清其机理。但我们现在已有了应对此类问题的方法。随着这项工作推进，我们对 LLM 心智——及其与我们自身心智的关系——的理解将变得更加清晰。\n\n欲了解更多，请阅读[完整论文](http:\u002F\u002Ftransformer-circuits.pub\u002F2026\u002Fworkspace\u002Findex.html)，并尝试[演示](http:\u002F\u002Fneuronpedia.org\u002Fjlens)。\n\n## 外部评论\n\n我们邀请了多位外部专家就这项工作撰写独立评论。\n\n- **Stanislas Dehaene** 和 **Lionel Naccache** 是认知神经科学家，他们与 Jean-Pierre Changeux 一起发展了启发我们大量工作的全局神经元工作空间模型。\n- **Patrick Butlin、Dillon Plunkett、Robert Long**（Eleos AI Research）和 **Derek Shiller**（Rethink Priorities）研究 AI 系统中意识和道德地位的可能性。\n- **Neel Nanda** 领导 Google DeepMind 的语言模型可解释性团队。他的评论包含在我们开放权重模型上对一些发现的独立复现。\n\n请[在此阅读](https:\u002F\u002Fwww-cdn.anthropic.com\u002Ffiles\u002F4zrzovbb\u002Fwebsite\u002Fcc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf)他们的评论。\n","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002F9b9914d4-9a89-477f-99f4-a081f4538df0.jpg",[],[],"Anthropic","https:\u002F\u002Fwww.anthropic.com\u002Fresearch\u002Fglobal-workspace",{"id":18,"name":19,"slug":20,"description":21},[122,123,124,128,129],{"id":62,"name":63,"slug":64},{"id":97,"name":98,"slug":99},{"id":125,"name":126,"slug":127},"a2ccffe0-49b2-458b-baf6-a83a1b20443d","大语言模型","llm",{"id":24,"name":25,"slug":26},{"id":28,"name":29,"slug":30},"2026-07-06T00:00:00.000Z","2026-07-17T03:07:11.295Z","2026-07-17T01:25:49.821Z"]