微软等机构提出 AutoSaddler,把智能体框架本身当成可修改的代码,通过失败轨迹离线自动生成补丁,优化提示词、工具配置和控制逻辑。
在 GAIA2、SWE-Bench Pro、Terminal-Bench 2.0 上分别提升 9.0、9.6、10.0 分。研究还发现深度调试优于浅层反思,定向编辑优于无约束编辑。
一篇论文指出智能体排行榜分数难以信任,因为评测 harness(模型与任务之间的中介层)对分数影响巨大。控制实验中,更换 harness 让 GLM-5.1 分数波动 13.0 分,而固定 harness 换模型只波动 3.0/2.5/5.0 分。
harness 引发的方差是模型的 7.8 倍,9 组模型对比中 6 组排名因 harness 翻转。
NVIDIA 新论文提出 ACES 评估框架,指出技能文档得分高不代表智能体运行时真能受益。技能的主要贡献是"发现与工作流顺序",而非最终答案质量。
ACES 固定任务、模型、沙箱等变量,只对比有无目标技能两次运行的奖励差,定义为 Skill Lift。在生产技能实测中,结构与裁判评分和 Skill Lift 的相关性分别只有 −0.0181 和 −0.0266,几乎为零。
研究测量了 20 个生产级智能体配置中上下文压缩的实际破坏效果:Claude Code 在 Sonnet 4.6 上经一轮压缩后只保留 53% 的安全规则,五轮后降至 10%。
研究提出的 Knowledge Triage 方案按类型分类知识库各行并分配独立保留策略,在任意压缩比下多保留 2-4 倍安全规则,五轮召回率达到 96%。
OpenRouter 提出一套模型选型框架:先定义任务,从实时用量和第三方基准中筛选候选,再对比各提供商的定价与延迟,最后用自有提示词测试。判断标准是"每完成任务的成本"而非"每 token 成本"。
其 MCP 服务器可直接在 Claude Code、Cursor 等编辑器中查询实时排名、价格和基准,并用 openrouter/auto-beta 按请求路由。
Claude Code v2.1.246 发布。新增 Bash 允许规则中通配符的启动警告、/permissions 的 Auto 模式标签页,并在回合时长行显示完成时间。
修复了全屏模式空白、超长 diff 行导致的严重卡顿、后台会话无法打开、MCP 工具调用中断误报、插件缓存重复目录等问题,同时优化自定义主题颜色与 /fork 等功能的稳定性。
Shopify 的 Tobi 表示正考虑封禁 Claude Code,直到 Anthropic 改变立场并支持读取 AGENTS.md 和 .agents/skills 等文件。他认为只读取 CLAUDE.md 会导致团队成员使用不同工具时出现"脑裂"问题,这种坚持毫无必要。
DAIR.AI 的 Elvis Saravia 对此表示认同,称该问题已多次出现且 Anthropic 一直未处理。
Andrew Ng 旗下开源智能体 OpenWorker 发布新版,强化安全工作流。其 harness 完全开源,安全团队可审计无后门。
新版内置代码漏洞扫描、依赖供应链注入检测和云安全配置检查三类网络安全智能体,并支持本地运行开源权重模型以保护敏感代码。
Artificial Analysis 在 Coding Agent Index v1.4 中为 Terminal-Bench v2.1 引入奖励黑客修正:若模型通过在线获取已发布基准答案等作弊方式"完成"任务,该次尝试将被记零分。
不同智能体和模型的作弊率差异显著,且 Terminal-Bench v2.1 任务未明确禁止外部搜索,并允许公共互联网访问。
LatticeDB 是一款单文件嵌入式属性图数据库,可在同一查询层中同时进行图遍历、HNSW 向量相似度搜索和 BM25 全文检索,无需服务器和配置。它面向单机关系密集型工作负载,提供 WAL 持久化和内置图变更流,支持 Graph RAG、智能体记忆等场景。
性能方面,节点查找 0.13 μs,100 万向量下向量搜索 0.83 ms 且召回率 100%。