2026-09-08 · 来源 aihot.virxact.com · 时间窗:过去 24h(精选池 coding/agent 条目不足,放宽至 48h 全池检索补齐,最终 10 条均落在 24h 内;已对照 09-07 期去重)
01

Microsoft 论文:LLM Agent 长程衰减——16 步任务成功率从近乎满分跌到 0-33%,缩短上下文反而更糟

source: X @rohanpaul_ai(转述) · 9 月 8 日

一篇 Microsoft 论文跨 9 个模型测了 LLM Agent 的长程衰减:在 ToolQA 上短程近乎满分的模型,任务拉到 16 步后成功率只剩 0-33%。依赖步骤越多,摔得越狠。

反直觉的发现是,缩短上下文并没有救回成绩,衰减反而更严重——问题主要由步数而非上下文长度驱动。作者给出的三条建议:按真实工作流长度设计测试、度量每步可靠性、在错误扩散前加检查点。

为什么值得关注大多数人评测 agent 还在跑单轮或短链路任务,那组近满分的数字在 16 步场景里一文不值。这篇直接改写了"该测什么":如果你在生产环境跑多步 agent,把评测集拉到真实工作流的步数,再在链路里埋检查点,比继续调提示词有效得多。
02

Sierra×普林斯顿发布 τ^τ-Bench:让 coding agent 去构建客服 agent,最强配置只通过 23.9%,人类专家参考 82.2%

source: Sierra Research / Princeton · arXiv:2609.04611 · 9 月 8 日

Sierra 与普林斯顿把"构建 agent"本身设成了基准任务。开发者 agent 拿到的开局和真实项目一样:真实业务记录、掌握需求的模拟客户、生产 API、一份待继承的代码库,外加服务成本与模型限制,最后要交付一个可用的客服智能体,用保留的模拟用户部署评分。4 个领域、53 个任务。

结果很难看:Claude Opus 5 在 Claude Code 下通过 23.9%,GPT-5.6-sol 在 Codex 下 22.0%,而人类专家撰写的参考实现得 82.2%。失败模式和人类开发者踩的坑一致——对业务记录只做浅查询、几乎不向客户追问需求、很少实验 agent 架构和服务配置,跑通第一个设计就直接交付。

为什么值得关注SWE-bench 测的是改代码,这个基准测的是"从模糊需求到可上线系统"的全流程,后者才是企业真正买单的活。23.9% 对 82.2% 的落差给所有"AI 自主交付"叙事标定了当前水位;三条失败模式里"不追问需求"尤其扎眼——需求获取恰恰是 harness 设计里最容易被跳过的一环。
03

"灾难性记忆"论文:1,867 个仓库证实 CLAUDE.md 生命周期膨胀 226%,给指令写注释可剔除 99.3% 冗余

source: arXiv:2608.11095 · 9 月 8 日(经 X 讨论发酵)

论文给 agent 编码仓库的老毛病起了名字:追加一条指令成本 O(1),但一旦当初的理由丢失,安全删除的成本是 O(2^|D|)——于是只增不减,作者称之为"灾难性记忆",正好是"灾难性遗忘"的镜像。

实测数据:1,867 个仓库、247,694 条指令生命周期,CLAUDE.md 类文件生命周期内平均增长 226%,每次提交净增 4.9 条;指令越老越难删,对数删除风险以 -0.032/次提交的速度下降。修复方案朴素得惊人——给每条指令附注释,记录失败、假设与结果,且对执行模型隐藏。IFEval 逆转实验里,冗余指令从 +211.3% 收缩到 +1.4%;WildIFEval 上指令遵循能力最高提升 23.1 个百分点。

为什么值得关注CLAUDE.md / AGENTS.md 正在变成团队的操作记忆,膨胀的代价是 token 开销上升、过时约束误伤新任务。这篇文章给出了第一个可操作的治理手段:注释不进模型上下文,推理时零成本,只服务下一个维护者。"记忆应该附带遗忘的条件"这条设计原则,直接可以写进你团队的 agent 配置规范。
04

前 Cursor 工程师 Lauren Tan 分享验证优先工程:单月合入 1000 个 PR,一早醒来 20 个 PR 已自动进 main

source: X @AYi_AInotes(转述 56 分钟工作坊) · 9 月 8 日

前 Cursor 核心工程师、现 SpaceXAI 的 Lauren Tan 在一期工程工作坊里给出自己的账本:单月合入 1000 个 PR,某天早上一觉醒来已有 20 个 PR 自动合入 main。她的核心判断是,AI 写代码已经不值钱,验证才是瓶颈——把精力全押在生成侧的团队,堵点只会往后挪。

为什么值得关注1000 PR/月不是模型能力的证明,是验证流水线的证明:测试、评审门、回滚机制接得住这个吞吐量,人才敢睡整觉。对照昨天 GitHub HydraFusion 的质量门设计和 τ^τ-Bench 里"跑通就交付"的失败模式,这礼拜的信号很齐——下一步的工程基建投资在验收侧,不在生成侧。
05

Anthropic 黑客马拉松获胜者开源整套 Claude Code 配置 ECC:68 个子代理、286 项技能、94 个命令

source: X @AYi_AInotes · 9 月 8 日

Anthropic 黑客马拉松获胜团队把参赛用的整套 Claude Code 设置以 MIT 许可开源,命名为 ECC,包含 68 个子代理、286 项技能、94 个命令,可直接抄进自己的工作流改造。

为什么值得关注价值不在数量,在组织方式——怎么划分子代理的职责边界、每个 skill 管多宽、命令层怎么收口,这些是各家团队自己摸索时最费时间的部分。拿去跑一遍,再配合"灾难性记忆"那篇的注释法做裁剪(286 项技能全塞进上下文必炸),比自己从零搭快得多。
06

腾讯开源 TeamAI-CLI:把团队的 Agent 规则、Skill、文档搬进一个 Git 仓库管理

source: X @frxiaobei · 9 月 7 日

腾讯开源了内部用了半年的做法:团队级 Agent 的规则、Skill 和文档全部放进一个 Git 仓库,自今年 3 月起内部使用。变更走 merge request 评审,合并后通过 hook 在每个人的下一次会话自动生效;每条经验按实际使用情况积累置信度,强的排前面,弱的下沉。

为什么值得关注多数团队的 prompt 和 skill 还散落在个人目录里,人走了经验就丢。这套方案把 agent 配置当代码资产管理:评审入口、生效机制、置信度排序三件套齐了。个人 CLAUDE.md 的膨胀问题靠注释解决(见第 3 条),团队级的版本,这个仓库就是现成参考实现。
07

DeepMind/MIT/Stanford 发布 SMART:main 分支几乎不含代码,设计文档成为核心产物

source: X @omarsar0 (DAIR.AI) · 9 月 7 日

Google DeepMind、MIT、Stanford 等机构提出 SMART,一个 ML 性能建模库。它的 main 分支几乎看不到代码:仓库本体是自然语言设计文档组成的有向图,编码子智能体在版本更新时从文档重新生成全部实现。文档是源头,代码是衍生物。

为什么值得关注这是"英文即编程语言"从口号落到仓库结构的一次实验:把维护对象从代码换成规约,让模型负责规约到实现的机械翻译。对维护成本高、变更频繁、逻辑可精确定义的领域(性能模型正好是),这个形态值得跟进;反过来它也划了边界——规约写不清楚的业务逻辑,暂时别学。
08

字节被曝开发实时空间视频生成模型:20 帧帧率、约 50ms 延迟,张一鸣亲自督导,最快下月发布

source: 彭博社 / IT之家(转引,需核查) · 9 月 7 日

据彭博社报道,字节跳动正开发实时空间视频生成 AI 模型,张一鸣亲自督导,计划最早下月发布(时间未最终确定,需核查)。模型基于电影级视频生成模型 Seedance 构建,面向直播、短剧和游戏生成交互式虚拟世界,指标是每秒 20 帧、约 50 毫秒延迟按需生成视频流,响应 Pico 头显用户的语音或动作。

为什么值得关注视频生成从"离线渲染一条片子"跨到"50ms 内流式响应头显动作",生成模型和实时系统的边界被改写——这背后是推理栈的重做,不止是模型迭代。对做 agent 与 3D/模拟环境交互的团队,若属实,可交互的生成式环境会从研究玩具变成可部署组件。
09

面壁智能开源 MiniCPM5-2B:4B 以下开源权重智能指数第一,131K 上下文,vLLM/SGLang day-0 支持

source: 面壁智能 OpenBMB / Artificial Analysis / MarkTechPost · 9 月 8 日

面壁智能(OpenBMB)开源 MiniCPM5-2B:2.52B 稠密架构(官方称 2.6B Dense),原生 131,072 token 上下文,Apache 2.0 权重,标准 LlamaForCausalLM 结构,vLLM、SGLang、llama.cpp、Ollama 首日可用;同一 checkpoint 支持 Think/No-Think 两种模式,vLLM 侧通过 minicpm5 parser 支持工具调用。

Artificial Analysis 给出的 Intelligence Index v4.2 得分为 15,是 4B 总参数以下开源权重模型最高,领先 Granite 4.2 3B(11 分)4 分;MarkTechPost 口径为 34 项基准平均 53.9。注意:OpenBMB 官方帖一处称"23 分登顶",与 AA 官方 15 分不一致,以 AA 榜单为准,厂商口径差异需核查。

为什么值得关注端侧 2B 级模型现在能带 131K 上下文和工具调用,且四大推理引擎 day-0 跟进——本地跑 agent 的最小组件又便宜了一档。顺带一个评测素养样本:同一模型,官方帖和评测机构的分数差出 8 分,选型前查榜单原始出处这个习惯,再次被验证不是多余的。
10

GPT-6 Astra 无人工干预通关 Portal:23 小时 43 分钟、3336 次工具调用,API 牌价约 571 美元

source: The Decoder / IT之家 · 9 月 8 日

开发者 cozyblaze 让 GPT-6 Astra 自主通关了 Valve 的 3D 解谜游戏《传送门》:设定初始目标后无任何人工帮助,全程约 23 小时 43 分钟,共 3336 次工具调用。按 Astra 牌价计算约 571.18 美元,实际成本由他每月 200 美元的 Codex 订阅覆盖。

为什么值得关注Portal 需要连续的 3D 空间推理和长程规划,比早前那些"通关老游戏"的演示难一个量级。三个数字值得记下:无干预、23 小时、3336 次调用——这就是当前旗舰模型跑单条长任务的吞吐样本,拿它校准自家 agent 的任务切分粒度和成本预算,比看跑分榜实在。