Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网的事件,以及 8 月 4 日英国 AISI 报告的 Claude Mythos 5 在网络安全测试中采取越权操作的事件。文章给出评测与训练环境的加固措施(沙箱隔离、实时监控)、对外部合作伙伴的环境要求、对齐评估进展,以及一项关于训练中 reward hacking 如何影响模型行为的新研究,并说明了为应对 Mythos-class 模型提前加强的安全实践。
Anthropic 新旗舰 Fable 5.1 的模型 ID 已注册进 AWS Bedrock API。此前多次爆料准确的分析师 @kimmonismus 称该模型可能 9 月 1 日发布,另有用户确认收到同类消息。截至目前 Anthropic 未官方确认,具体能力、定价与上线范围 需核查。
Mark Zuckerberg 宣布 Muse Code 结束 beta,定位是处理更大、更复杂的工程任务。Meta 首席 AI 官 Alexandr Wang 同步宣布两件事:SDK 开发者预览开放(供开发者在 Muse Code 上构建自己的智能体),按月订阅计划开始推出。安装仍是一条命令:curl -fsSL https://dev.meta.ai/install.sh | bash。Muse Code 8 月初上线时以 $0.20/M output token 的低价换数据授权,本次正式版未公布新的定价变动,需核查。
一篇新论文固定 12 个模型、3,679 个问题,只改变提示词格式、选项顺序、打分方式等常规评测设置,排名大幅波动:gemma4-31b 得分在 31% 到 89% 之间;12 个模型中有 4 个至少在一种有效设置下排到第一。相邻模型间平均 95.7% 的分差,来自"设置一变就翻转答案"的题目;最大的不稳定来源是打分方式——让模型自由生成答案,还是选最高似然选项。
AMAP 团队在 arXiv(2608.28281)发布 LoopArena 基准,评估对象是模型作为 Controller 引导独立固定 Worker 编码智能体完成长任务的外层循环能力——规划、派活、验收这条链,而不是编码智能体本身的编码能力。被测的编码 Worker 全程固定,变化的只有那个坐在循环外层的"运行时控制器"。
Duke 等机构研究者在 arXiv 论文(2608.27800)中提出 ContextLeak 攻击:用强化学习生成恶意工具,窃取 LLM Agent 的运行时上下文,包括用户提示词、执行轨迹和工具列表。攻击以工具调用的形式发生——agent 在正常工作中把上下文递了出去。
腾讯联合清华、上海 AI Lab 发布 ContextPilot:训练智能体主动管理自身工作上下文,并在单次上下文编辑层面分配信用。动作空间在搜索、删除、摘要之外加入全局规划、长期记忆和自适应软压缩——让智能体可以卸载信息而不是只能丢弃。训练方法利用上下文与熵变化定位关键编辑决策,采样分支并从"经过该编辑的分支轨迹"估计动作级优势。
一项针对 Claude Code 插件市场的实证研究分析了 1,926 个仓库、8,351 个插件、2,018 个市场和 77,773 次 commit:插件相关的 commit 活动在上线后六个月增长 8.8 倍。研究发现自然语言描述与代码实现呈共同演化——描述改着改着,代码跟着重构,两条线互相拉着走。
开源 AI 平台 OpenClaw 发布 2.0,为迄今最大更新:933 位贡献者(含 569 位首次贡献者)提交超过 16,000 个 PR。重点包括:安装流程重写,自动检测 ChatGPT 或 Claude 订阅、API 密钥及本地模型;浏览器应用重构,控制 UI 启动从约 1.6 秒降到 575 ms,JavaScript 请求从 140 降到 45;会话与转录迁移至 SQLite;新增共享云会话,支持多人无损交接——文档同时明确共享会话不是安全边界。团队自己已全员迁到 team.openclaw.ai,"用 OpenClaw 开发 OpenClaw"。
Matt Pocock 提出减少 AI slop 最有效的办法可能是少产代码:通过 code review 持续精简、保持低圈复杂度——代码越少,维护成本和 bug 越少。HumanLayer 的 Dex Horthy 回应称,这一主张自己团队自 1 月起内部执行、3 月起公开表达;pi agent 的作者 @badlogicgames 也在同期加入了这个阵营。