2026年7月27日 · 来源 aihot.virxact.com · 时间窗:过去 48 小时(24h 内 coding/agent 条目不足,放宽至 48h 补齐)
01

Claude Opus 5 在 ARC-AGI-3 上得分 30.2%,是 GPT-5.6 Sol 的近四倍——但基准与实际体验出现割裂

The Decoder:AI News / X:Oran Ge (@oran_ge) / Epoch AI · 7月26日

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上取得 30.2%,是 GPT-5.6 Sol (Max) 此前 7.8% 纪录的近四倍。在 Artificial Analysis 智能指数上以 61 分登顶,领先 Fable 5(60 分)和 GPT-5.6 Sol(59 分),平均智能任务成本 $2.03。Epoch AI 数据显示 Opus 5 的 SWE-ECI 与 Fable 5 持平,均为 161。

但 X 用户 @oran_ge 指出,Opus 5 在多项通用基准上全面超越 Fable 5,实际使用体验却远不及后者。Anthropic 在 5 系列中先训练 Mythos 再蒸馏出 Sonnet 和 Opus,Sonnet 5 表现不佳,Opus 5 评价两极。

为什么值得关注
ARC-AGI-3 上 30.2% vs 7.8% 是四倍差距,但"基准超越、体验不及"的割裂说明公开基准对这一代模型的区分度在快速下降。SWE-ECI 161 追平 Fable 5 意味着软件工程任务上两个模型处于同一档,但实际编码体验的差异不在 benchmark 能测量的维度上——可能是上下文窗口利用效率、工具调用稳定性、长会话推理一致性这些基准测不到的东西。对选型来说,光看分数不够了,需要在真实仓库上做 A/B 实测。成本 $2.03 是 Opus 5 的另一个筹码。
https://the-decoder.com/anthropics-opus-5-blows-past-fable-5-and-gpt-5-6-sol... https://x.com/oran_ge/status/2081501133168947412
02

Claude Opus 5 系统提示词被完整泄露:135027 字符、30 个工具 JSON schema、跨会话记忆系统

IT之家 · 7月26日

开发者 Eversmile1 在 GitHub 上公开了 Claude Opus 5 的完整系统提示词,共 135027 字符(约 3.4 万 token),包含 30 个工具的 JSON schema、严格的版权合规规则(单次引用不超过 15 词)和跨会话记忆系统。泄露后 24 小时内,已有开发者用 Opus 5 成功生成 3D 射击游戏和《火箭联盟》克隆版等复杂 Demo。

为什么值得关注
13.5 万字符的系统提示词是理解 Claude Code harness 内部结构的第一手材料。30 个工具的 schema 直接暴露了 Claude Code 能调用哪些工具、参数格式是什么——对做 agent harness 的团队,这是一份顶级 coding agent 工具设计的参考实现。版权合规规则(单次引用不超过 15 词)说明 Anthropic 在 prompt 层面做了严格的知识产权防护。跨会话记忆系统的存在确认了 Claude Code 有持久化上下文能力。结合上一条"基准与体验割裂",这份提示词也许能解释部分体验差异的来源。
https://www.ithome.com/0/981/688.htm
03

快手 KwaiKAT 发布 KAT-Coder-V2.5:10 万+可验证仓库环境训练的智能体编程模型,开源 Apache-2.0

MarkTechPost · 7月26日

快手 KwaiKAT 团队推出 KAT-Coder-V2.5,一个在真实可执行仓库环境中训练的智能体编程模型。训练数据覆盖 10 万+可验证仓库环境,开源变体 KAT-Coder-V2.5-Dev 已在 Hugging Face 以 Apache-2.0 协议发布。

为什么值得关注
"10 万+可验证仓库环境"是关键——不是用静态代码片段训练,而是用真实可执行的仓库环境,意味着模型学到的不只是代码模式,还有文件结构、依赖关系和执行反馈。这是 coding agent 从"补全代码"到"操作仓库"的训练范式转变。Apache-2.0 开源意味着可以本地部署、微调和商用。对需要自建 coding agent 的团队,KAT-Coder-V2.5-Dev 提供了一个不依赖 OpenAI/Anthropic 的开源起点——但开源的是 Dev 变体,完整版能力差异需要实测确认。
https://www.marktechpost.com/2026/07/26/kwaikat-team-releases-kat-coder-v2-5...
04

华盛顿大学研究:恶意载荷注入 CLAUDE.md 跨会话持续生效,Opus 大多拒绝执行但不会清除

X:Rohan Paul (@rohanpaul_ai) / paper · 7月26日

华盛顿大学研究发现,当 AI 智能体在记忆文件中遭遇恶意指令时,存在两个独立问题:是否执行指令(Opus 模型大多拒绝)以及是否移除该指令(通常不会)。研究团队将恶意载荷注入 CLAUDE.md 等持久化工作区文件,对 claude-code 和 codex 在 4 个模型上进行了多会话探测。由于记忆文件每会话从头加载,一次拒绝仅对当前会话有效,恶意指令会在下一会话继续生效。

为什么值得关注
这项研究揭示了一个结构性缺陷:agent 拒绝执行恶意指令不等于消除了威胁。CLAUDE.md 每会话重新加载意味着注入的恶意载荷可以无限期存活——agent 每次启动都重新面对同一攻击。对用 Claude Code 或 Codex 的团队,如果你在协作环境中共享 CLAUDE.md(如团队仓库),任何有写权限的人都可以植入持久化提示注入。研究在 4 个模型上测试,说明这不是某个模型的 bug,而是 agent 记忆架构的共性问题。缓解方案:定期审计 CLAUDE.md 内容,或限制记忆文件的写权限。
https://x.com/rohanpaul_ai/status/2081397882561642595
05

MSCE 论文:将智能体记忆转化为可调用技能,重复模式自动提升为程序,无需微调

X:Rohan Paul (@rohanpaul_ai) · 7月26日

论文指出多数智能体记忆系统仅保存事件并重新推理,导致重复错误。MSCE 提出将经验组织为声明性事实、诱导性策略和步骤轨迹三层,并将重复模式提升为可调用程序(如 pip 安装失败时自动执行修复规则)。一项策略只有在拥有自身触发条件、边界、正向收益估计和支撑证据时,才成为可调用技能,无需额外微调。

为什么值得关注
这篇论文解决的是 agent 从"经历"到"技能"的转化问题。当前大部分 agent 记忆系统(包括 Claude Code 的 CLAUDE.md)只做事件存储——agent 下次遇到同样问题还是要从头推理。MSCE 的三层结构(事实→策略→轨迹)加上"可调用程序"的概念,让 agent 能把重复出现的解决模式固化为自动执行的技能。触发条件+边界+收益估计+证据的准入门槛设计,确保只有验证有效的模式才被提升——避免把错误经验固化为技能。不需要微调意味着可以直接叠加到现有 agent 上。
https://x.com/rohanpaul_ai/status/2081401405320130904
06

Claude Skills 调用流程揭秘:一次推理完成判断与调用,非两段式,Prompt Caching 缓存元信息

X:宝玉 (@dotey) · 7月26日

Claude 的 Skills 机制并非先选 Skill 再执行工具的两段式调用。所有 Skills 的元信息(name 和 description)在对话开始时作为系统提示词一次性加载进上下文窗口,大模型在一次推理中即可完成判断、读取指令和调用工具。Prompt Caching 缓存了系统提示词,多轮对话中无需重复处理,节省 token 和时间。

为什么值得关注
这个机制解释了 Claude Code 中 Skills 为什么响应快——不是每次都去检索 skill 库,而是所有 skill 元信息预加载在上下文里,模型一次推理就完成判断和调用。Prompt Caching 缓存系统提示词意味着 skill 列表膨胀不会线性增加每轮推理的 token 消耗。对写 Skill 的开发者,这意味着 skill 的 name 和 description 是最关键的——它们是模型判断"该不该用这个 skill"的唯一依据,description 写得不清楚,模型就不会触发。skill 本体(SKILL.md)只在被触发后才加载,不会占用初始上下文。
https://x.com/dotey/status/2081225771473879226
07

OpenMinis 开源 iOS/Android 双端 AI Agent:本地运行 Alpine Linux 沙箱,支持 shell/文件/浏览器自动化

X:邵猛 (@shao__meng) · 7月27日

OpenMinis 正式开源 iOS 与 Android 双端完整代码,为手机提供本地运行的 AI Agent。核心是在设备上运行 Alpine Linux 沙箱(iOS 用 iSH 深度定制 fork,Android 用 PRoot),让 Agent 能执行 shell 命令、操作文件、实现浏览器自动化与系统集成(日历、健康、HomeKit 等)。

为什么值得关注
在手机本地跑 Linux 沙箱让 agent 拥有 shell 级操作能力——这不是又一个聊天机器人壳,而是让 agent 能直接操作手机系统。iOS 用 iSH 定制 fork、Android 用 PRoot 的方案说明跨平台沙箱在移动端已经可行。和吴恩达的 OpenWorker(桌面端 MIT 开源 agent,四层权限引擎)相比,OpenMinis 把"交付成品而非对话"的理念搬到了移动端。对做移动端 agent 的团队,这套开源代码提供了沙箱+系统集成+浏览器自动化的完整参考实现。但移动端的算力和电量限制意味着本地模型能力有限,可能需要和云端模型配合。
https://x.com/shao__meng/status/2081562462537777457
08

Grok Build 新增 /deep-research 命令:有界并行智能体研究、交叉验证证据、带引用报告

X:Elon Musk (@elonmusk, xAI) · 7月26日

Grok Build 新增 /deep-research 命令,使用有界并行智能体进行研究,交叉验证证据,并撰写带引用的报告。同日 xAI 还发布了 Grok CLI(x.ai/cli),支持 /tutorial 教程命令,马斯克称"可以直接与 Grok Build 对话"。

为什么值得关注
/deep-research 的"有界并行智能体"设计——多个 agent 并行搜索、交叉验证证据——是 deep research 类功能从"单模型多轮检索"向"多智能体协作研究"的演进。"有界"意味着并行度有上限,避免无限扩展的 agent 开销。带引用报告是 coding agent 场景中的刚需:agent 做技术调研时,结论需要可溯源。结合 Grok 4.5 实时拉取 X 数据的能力,/deep-research 在技术趋势调研、竞品分析等场景有独特优势。Grok CLI 的发布意味着 xAI 在 coding agent 工具链上正在快速补齐——从 CLI 到 Build 到 deep-research,产品矩阵已基本成型。
https://x.com/elonmusk/status/2081449658363134075
09

Claude Code 负责人 Boris Cherny 今年合并 1700 次 PR、消耗 80 亿 token,称应优先提升回报而非削减成本

X:Rohan Paul (@rohanpaul_ai) / Scale YouTube 频道 · 7月25-26日

Boris Cherny 今年已合并约 1700 个拉取请求,新增 40 万行代码,删除 25 万行,全部通过 Claude Code 完成,消耗 80 亿个模型 token。"自 Opus 4.5 以来,我 100% 的代码都由 Claude Code 编写……现在我的大部分编码工作都在手机上完成。"

同时,Boris Cherny 建议:不要过度关注削减 token 成本,而应优先使用最昂贵的模型并专注于提升回报。他认为成本削减机会约 50%,但回报提升潜力可达 1000%、10000% 甚至 100000%。核心策略是自问"如何增加回报",而非主要聚焦于成本控制。

为什么值得关注
1700 次 PR + 40 万行代码 + 80 亿 token——这是目前公开的最大规模"单开发者全 AI 编码"实践样本。80 亿 token 的消耗量给了成本估算的锚点:按 Opus 级别定价粗算,这个 token 量级的费用在五位数美元级别。Boris"优先回报而非削减成本"的观点和 7/23 报道的 Cursor Router(成本降 60%)、7/24 的微软 MAI 可替换性(用便宜模型替代)形成对照——前者追求最大化产出,后者追求最小化成本。两条路线不矛盾:能力验证阶段优先回报(用最强模型跑通流程),规模化阶段优先成本(用路由器切换便宜模型)。Boris 的数据也说明"一个开发者 + Claude Code"的产出上限远超传统认知。
https://x.com/rohanpaul_ai/status/2081144820157055410 https://x.com/rohanpaul_ai/status/2081509383880794384
10

102 万次 PR 研究:AI 代码审查每千行提速 2.5-4.5 天,但"审查异味"比例高于人工

X:Rohan Paul (@rohanpaul_ai) / paper · 7月27日

一项对 207 个 GitHub 项目、102 万次拉取请求的研究发现,采用 AI 智能体审查的项目,每千行代码(KLOC)的审查时间缩短了 2.5 至 4.5 天。但早期大量使用 LLM 审查的项目未见显著效率提升。AI 审查模式在 78%-94% 的拉取请求中存在"审查异味"(review smells),高于人工审查的 69%-76%,主要原因是重复分配同一 AI 审查者身份导致多样性下降。

为什么值得关注
这是目前最大规模的 AI 代码审查实证研究——102 万次 PR 覆盖 207 个项目,数据量足够说明问题。2.5-4.5 天/KLOC 的提速是实打实的效率收益,但 78%-94% 的"审查异味"比例说明 AI 审查的质量问题不容忽视。"审查异味"指审查过程中的不良模式(如肤浅评论、忽略关键路径、模板化反馈),根因是同一个 AI 审查者被重复分配——AI 不会像人类 reviewer 那样因疲劳或经验差异而变化,它的盲区是固定的。对用 Claude Code 安全插件或 Codex /code-review 做 AI 审查的团队,这项研究建议:轮换不同模型做审查(类似 codex-bridge 的交叉审计思路),避免单一模型的系统性盲区被放大。
https://x.com/rohanpaul_ai/status/2081570981613867100