Grok 4.5 登顶 VulcanBench 编程基准:91.3% 得分,5 种语言 23 个真实任务解决 21 个
Grok 4.5 在 VulcanBench 新编程基准中得分 91.3%,解决了横跨五种语言的 23 个真实世界软件任务中的 21 个,击败 Claude Fable 5 和 GPT-5.6 Sol,同时占据成本效率前沿。Elon Musk 随后转发推荐用户试用 Grok 4.5。
Grok 4.5 在 VulcanBench 新编程基准中得分 91.3%,解决了横跨五种语言的 23 个真实世界软件任务中的 21 个,击败 Claude Fable 5 和 GPT-5.6 Sol,同时占据成本效率前沿。Elon Musk 随后转发推荐用户试用 Grok 4.5。
Anthropic 团队成员 Thariq 透露,Claude Code 的 system prompt 被削减了 80%。他的解释是:模型越聪明,需要的指令、约束和示例就越少;移除示例反而能让模型更自由发挥。一个极端案例——某用户的 CLAUDE.md 从 12.8MB 占满 95% 上下文窗口,瘦身至 2.1MB 仅占 18% 后,模型专注度与结果均优于此前。Thariq 建议在新模型发布时主动修剪上下文,为最新模型留出更多运行空间。
Kimi K3(2.8T 参数,100 万 Token 上下文)发布后请求量远超预期,GPU 算力逼近极限。月之暗面宣布即日起暂停 C 端新用户订阅,全部算力用于服务已有用户。K3 输入费用为每 100 万 Token 2 元(缓存命中)或 20 元(缓存未命中),输出费用 100 元。
同时,月之暗面计划将会员拆分为两个独立计划:面向 Web/App/Work 的 Kimi Membership,以及面向编程工作流的 Kimi Code Membership——用独立计费通道将编程场景的算力需求与其他场景隔离。
Anthropic 内部对谈指出,套在模型外层的代码(harness)正在变薄。原因很直接:harness 编码了大量"模型做不到什么"的假设,而这些假设正随模型能力提升而快速过期。旧 harness 像一条写死的流水线——每一步都硬编码了模型的能力边界;新架构更像一个会挑战术的教练,不站在流水线上,而是根据当前局面决定用哪种阵型打。
宝玉分析了 FDE(Field Delivery Engineer,现场交付工程师)在 AI 模型公司中的角色本质。FDE 的工作链条是:帮企业落地 Agent → 消耗 Token → 把企业知识沉淀成 Skills → 将 Skills 内化到模型。每个项目应该为下一个项目打工——沟通记录、方案、修改原因都沉淀为结构化资料,最终形成 Agent 知识库和评估标准。飞轮一旦转起来,公司核心资产不再是明星员工,而是一套不断复利的交付系统。
Moonshot 的 Kimi K3 上线 2 天即成为 OpenRouter 第 10 大模型,日处理约 140B token。但负载已导致吞吐量从 30 tok/s 降至 13 tok/s,端到端延迟达 72 秒。Deedy Das 估算,服务量化版 K3 需至少 8 块 B300(约 $50 万),推荐 GB300 NVL72 机架则需约 $400 万。他指出前沿模型价格 3 年仅降 4-5 倍,而需求增长超 3 个数量级——算力锁定者将获得巨大价值。
OpenAI 通过 GitHub PR #33972 将 Codex 模型的上下文窗口从 37.2 万 token 缩减至 27.2 万 token。变更通过 backport 将刷新后的 GPT-5.6 模型指令和上下文窗口元数据同步至 0.144 稳定版客户端。更新还涉及推理摘要、技能、权限和自动审查目录元数据。GPT-5.6 Sol 不包含超快服务层级。
Feyn Labs 发布 SQRL(Text-to-SQL)模型族,核心设计是在生成查询前先用只读探针检查数据库 schema。旗舰版 SQRL-35B-A3B 在 BIRD Dev 基准上达到 70.6% 执行准确率,超越 Claude Opus 4.6。该模型还蒸馏出可自托管的 4B 和 9B 检查点。
Codex 重度用户日常内存占用约 6GB,常因后台残留 MCP 进程飙高至卡死。官方建议:完全退出重启 Codex,默认关闭高占用的 XcodeBuildMCP(0.84 GB)和 Blender MCP(0.3 GB),保留低占用常用 MCP,同时 active 任务控制在 1-2 个。优化后常态内存可从约 5.7 GB 降至 3.4-4.0 GB。
xAI 发布 Grok Build 0.2.105 更新:Grok 4.5 成为默认模型,支持高、中、低三档推理努力度。新增 /summarize 命令用于即时会话摘要。本地 Shell 工具现在继承用户的环境变量、别名和函数——这意味着 agent 可以直接使用你 .zshrc / .bashrc 里定义的 alias 和 PATH。此外改进了长会话压缩、全局规则发现以及负载下的滚动流畅度。
同期,xAI 工程师 Andrew Milich 预告下周将发布 Grok CLI 重大更新。