Uber 发布《Running a Software Factory Efficiently at Uber Scale》。核心数字:全公司超过 70% 的 PR 归属本地或云端 agent;工程师自建 3,600 多个 agent skill,每天执行 3 万次以上;2 月至 8 月中,周活用户涨 7 倍、周 agent 请求量涨 9.4 倍,而总 AI 支出从 4 月起基本持平。
固定单一模型做对照(2 月到 7 月)后,每千次模型请求成本较峰值下降近 34%,单次会话成本较 6 月峰值下降 52%。Uber 把总支出拆成六个相乘的项——用户数 × 人均会话 × 每会话轮次 × 每轮请求 × 每请求 token × 每 token 单价。前两项是需求,要涨;中间三项是"agent 替自己干的活"(多余轮次、重复子代理调用、膨胀上下文),是优化主战场;最后一项靠路由解决。托管 agent 的成本按结果计价:每次合并 PR、每次代码评审、每次告警、每次清理各算一份,质量侧看回滚率、F1、MTTR。
Axios 补充的几条具体措施:交互式会话硬上限 40 万 token(哪怕模型支持 100 万);prompt cache 的 TTL 从 5 分钟改到 1 小时,因为工程师经常把会话晾着超过 5 分钟;终端上直接显示本次会话的实时花费;任务按成本-能力路由到不同模型。
OpenAI 加快 Astra 发布节奏,新增 mozaik-alpha-fdm 测试阶段以扩大内部测试范围。流出的演示样本显示,该模型一次对话交互就能生成类《侠盗猎车手 2》的游戏,以及精细网站、3D 对象和体素环境;代价是推理时间比 GPT-5.6 Sol 长得多。
另有消息称 Astra 正以代号 ultima-alpha 向部分合作伙伴测试,若本周末反馈积极,下周扩大早期访问,目标 9 月 3 日至随后一周内广泛上线;更新版 GPT-Image 2 的发布窗口相近,可能同步推出。外界普遍猜测 Astra 即此前所称的 GPT-6,参数规模或达 10 万亿——这一点尚无官方确认,需核查。
新论文验证了一件事:agent 技能文件没法靠"不公开"来保护,攻击者只要正常使用你的服务就能把它重建出来。在最弱的访问级别下,Daydreaming 方法在 7 个技能、4 个受害者模型上恢复了原始技能 86.8% 的能力,约为 SigLeak 的 4 倍;中位只需 32 次调用;而且在披露防御机制开启的情况下依然有效。
Anthropic 宣布 9 月 14 日起,Pro、Max、Team 及按席位计费企业版的 Claude Code 标准周限额永久上调 25%。当前执行的临时 50% 增幅延续到 9 月 13 日。以原始限额为 100% 计,新额度是 125%——也就是说,跟现在这周的 150% 相比,实际到手少 17%。过程有点狼狈:官方先发了一条"削减 25%"的帖子,删掉重算后才以"仅降 17%"重新发布。
同一天 OpenAI 反向操作:给所有 Codex 和 ChatGPT Work 付费用户重置用量,并修复一批导致额度空转的 bug,覆盖压缩、记忆、目标、自动化、子代理、MCP 等环节——部分用户每周额度被这些问题吃掉 15% 到 70%。修复后同等额度能多跑 10% 到 50%。OpenAI 还做了架构调整防止复发,并会把用量去向直接显示在应用里。
WeaveBench 用 114 项混合 GUI 与命令行的任务测长程 agent,官方报告的最佳通过率只有 41.2%。观察是:当前模型能处理局部步骤,但必须靠显式审计状态才能保持全程不偏轨。论文据此提出 LongHorizon-Harness,主张长程可靠性取决于模型外围那层 harness,而不是模型本身。
开发者 Jordy Zomer 在做漏洞研究时遇到一个老问题:agent 跑久了会把已确认的结论弄丢,然后开始编。他的做法是借鉴程序分析,写了 Lemmalog——一个面向 LLM 的 Datalog 引擎。分工很明确:模糊的信息抽取交给模型,确定性的规则推导交给引擎。当某条观察事实被推翻时,引擎自动作废所有依赖它的结论,不需要模型重新推理一遍。
Agent Seer 的思路是:给一个 MCP 规范,自动合成多轮 agent 测试场景,不需要示例、不需要实时调用真实工具、也不需要领域微调。在 7 个 MCP 规范上做了验证,小中型规范能实现完整工具覆盖。两个结论反直觉:参数模式的复杂度比工具集规模更能预测质量差异;参数值准确性是主要失败模式。
vLLM 发布 v0.28.0,584 个提交来自 270 位贡献者。模型侧两个重点:Kimi-K3 获得 DCP 支持、融合 FlashKDA 内核,DSpark 场景下的 TTFT 改善约 60%;DeepSeek V4 实现端到端稀疏 MLA。
Anthropic 官宣 Claude Code 桌面端与终端会话打通:在桌面端用 /resume 就能调取 CLI 里开过的历史会话,完整对话记录和代码片段原样迁移,检查点机制和 /rewind 回退照常可用。团队工程师 Lydia Hallie 的个人统计是 1,240 次会话、1.624 亿 tokens。
限制:目前只有终端发起的会话支持跨端,桌面端新建的会话暂时搬不回终端。
美国风投 Dimension Capital 合伙人访华后致出资人的内部信流出。信里的几个数字:中国开源模型在 OpenRouter 上的 token 消耗份额,18 个月内从不足 2% 升至 45%;Qwen 成为 Hugging Face 上最快突破 10 亿次下载的模型家族;约 80% 的美国 AI 初创已经部署了中国开源模型。信中把成因归结为出口管制倒逼出的全栈效率文化。(内部信内容为转述,具体数字需核查)