2026-08-30 · 来源 aihot.virxact.com · 时间窗:过去 24 小时

01Uber 公开软件工厂账本:70% PR 由 Agent 提交,请求量半年涨 9.4 倍,总账单从 4 月起走平

AI coding 落地成本工程Uber Engineering 博客(Uday Kiran Medisetty)· 2026-08-30 08:54 北京时间

Uber 发布《Running a Software Factory Efficiently at Uber Scale》。核心数字:全公司超过 70% 的 PR 归属本地或云端 agent;工程师自建 3,600 多个 agent skill,每天执行 3 万次以上;2 月至 8 月中,周活用户涨 7 倍、周 agent 请求量涨 9.4 倍,而总 AI 支出从 4 月起基本持平。

固定单一模型做对照(2 月到 7 月)后,每千次模型请求成本较峰值下降近 34%,单次会话成本较 6 月峰值下降 52%。Uber 把总支出拆成六个相乘的项——用户数 × 人均会话 × 每会话轮次 × 每轮请求 × 每请求 token × 每 token 单价。前两项是需求,要涨;中间三项是"agent 替自己干的活"(多余轮次、重复子代理调用、膨胀上下文),是优化主战场;最后一项靠路由解决。托管 agent 的成本按结果计价:每次合并 PR、每次代码评审、每次告警、每次清理各算一份,质量侧看回滚率、F1、MTTR。

Axios 补充的几条具体措施:交互式会话硬上限 40 万 token(哪怕模型支持 100 万);prompt cache 的 TTL 从 5 分钟改到 1 小时,因为工程师经常把会话晾着超过 5 分钟;终端上直接显示本次会话的实时花费;任务按成本-能力路由到不同模型。

为什么值得关注这是目前少见的一份"量涨了、钱没涨"的完整账本,而且给出了可抄的拆解方式。三件可以立刻做的事:把 agent 支出写成那六项乘积,先测出你们自己的"每会话轮次"和"每请求 token";把成本指标换成结果计价(每次合并 PR 多少钱)而不是 token 计价;质量信号里加上回滚率和 MTTR——Uber 用这两个指标兜底,防止省下的钱以线上事故的形式还回去。对照 Meta 上周那组数字(代码变更 +220%、用户可见功能 +36%、事故 +40%),差别不在模型,在于有没有把 agent 当工程系统来度量。

02Astra 首批演示样本流出:一次交互生成类 GTA 2 游戏,代号 ultima-alpha 测试中,目标 9 月 3 日前后铺开

新模型OpenAIIT之家 + X @kimmonismus · 2026-08-30 00:04 / 13:25 北京时间

OpenAI 加快 Astra 发布节奏,新增 mozaik-alpha-fdm 测试阶段以扩大内部测试范围。流出的演示样本显示,该模型一次对话交互就能生成类《侠盗猎车手 2》的游戏,以及精细网站、3D 对象和体素环境;代价是推理时间比 GPT-5.6 Sol 长得多。

另有消息称 Astra 正以代号 ultima-alpha 向部分合作伙伴测试,若本周末反馈积极,下周扩大早期访问,目标 9 月 3 日至随后一周内广泛上线;更新版 GPT-Image 2 的发布窗口相近,可能同步推出。外界普遍猜测 Astra 即此前所称的 GPT-6,参数规模或达 10 万亿——这一点尚无官方确认,需核查。

为什么值得关注"一次交互出一个能玩的游戏"把长程生成的验收标准抬高了:以前比能不能编译,以后比一次成型的可玩性和完整度。但推理时间是硬约束——生成质量换来的延迟,对交互式开发场景不一定划算,值得等正式上线后实测你自己那类任务的端到端耗时,再决定放进 workflow 还是留给离线批处理。GPT-Image 2 若同期发布,多模态资产生成这条线可以一起评估。

03藏起来的 Skill 文件照样能被偷:正常使用服务即可重构,7 个技能上恢复 86.8% 能力,中位只要 32 次调用

skill 安全论文研究X:DAIR.AI · 2026-08-30 05:00 北京时间

新论文验证了一件事:agent 技能文件没法靠"不公开"来保护,攻击者只要正常使用你的服务就能把它重建出来。在最弱的访问级别下,Daydreaming 方法在 7 个技能、4 个受害者模型上恢复了原始技能 86.8% 的能力,约为 SigLeak 的 4 倍;中位只需 32 次调用;而且在披露防御机制开启的情况下依然有效。

为什么值得关注和上周 EvoMal 那条(共享技能库被投毒)正好构成一组:一个讲技能怎么被污染,这条讲技能怎么被搬走。32 次调用、86.8% 能力恢复,意味着把 SKILL.md 当"商业秘密"锁起来的策略不成立——真正的护城河在技能背后的数据、评测集和领域判断力,不在那份文件。对外提供 agent 服务的团队要重新评估:技能提示词里有没有写死的内部流程、阈值、客户名单,这些都可能在几十次调用里被重建出来。

04本周配额账本:Claude Code 9 月 14 日起永久 +25%(相对现在净降 17%),Codex 重置并修掉吃额度的 bug(+10%~50%)

coding 工具配额Anthropic(ClaudeDevs)+ IT之家 + OpenAI(Tibo / Testing Catalog)· 2026-08-30 00:43 至 11:02 北京时间

Anthropic 宣布 9 月 14 日起,Pro、Max、Team 及按席位计费企业版的 Claude Code 标准周限额永久上调 25%。当前执行的临时 50% 增幅延续到 9 月 13 日。以原始限额为 100% 计,新额度是 125%——也就是说,跟现在这周的 150% 相比,实际到手少 17%。过程有点狼狈:官方先发了一条"削减 25%"的帖子,删掉重算后才以"仅降 17%"重新发布。

同一天 OpenAI 反向操作:给所有 Codex 和 ChatGPT Work 付费用户重置用量,并修复一批导致额度空转的 bug,覆盖压缩、记忆、目标、自动化、子代理、MCP 等环节——部分用户每周额度被这些问题吃掉 15% 到 70%。修复后同等额度能多跑 10% 到 50%。OpenAI 还做了架构调整防止复发,并会把用量去向直接显示在应用里。

为什么值得关注两边的差额值得算清楚:Claude Code 用户 9 月 14 日后实际可用额度比现在少 17%,排期长任务时别按本周的手感估算。Codex 用户则相反——额度不变但漏损补上了,被"周中见底"困扰的人可以重新跑一轮压测。顺带记下 OpenAI 那个 bug 清单(压缩、记忆、子代理、MCP),这些正是自建 harness 时最容易埋额度漏洞的位置:上下文压缩反复触发、记忆文件被整篇重写、子代理并发不受控、MCP 工具输出不做截断,四样都能让你的成本曲线莫名上翘。

05WeaveBench:114 项混合 GUI-CLI 任务,最强模型只过 41.2%,论文的结论是可靠性长在 harness 上而非模型里

评测基准harness 工程X:Rohan Paul · 2026-08-30 00:03 北京时间

WeaveBench 用 114 项混合 GUI 与命令行的任务测长程 agent,官方报告的最佳通过率只有 41.2%。观察是:当前模型能处理局部步骤,但必须靠显式审计状态才能保持全程不偏轨。论文据此提出 LongHorizon-Harness,主张长程可靠性取决于模型外围那层 harness,而不是模型本身。

为什么值得关注41.2% 这个数字可以直接拿去校准排期——别按"agent 能自己跑完长任务"做计划。更值得抄的是"显式审计状态"这个动作:它把里程碑检查从可选优化变成必选项,具体落地就是在长任务里定期让 agent 输出结构化状态快照(已完成/待办/阻塞/假设),由外部或另一个模型核对是否跑偏。这和昨天 SKILL.state 的显式状态、阿里 Scroll 的查询时决策指向同一件事:状态外置正在从技巧变成默认架构。

06Lemmalog:给 LLM 记忆配一个 Datalog 引擎,事实被推翻时依赖它的结论自动失效

harness 工程记忆管理pwning.systems(Jordy Zomer)· 2026-08-30 14:44 北京时间

开发者 Jordy Zomer 在做漏洞研究时遇到一个老问题:agent 跑久了会把已确认的结论弄丢,然后开始编。他的做法是借鉴程序分析,写了 Lemmalog——一个面向 LLM 的 Datalog 引擎。分工很明确:模糊的信息抽取交给模型,确定性的规则推导交给引擎。当某条观察事实被推翻时,引擎自动作废所有依赖它的结论,不需要模型重新推理一遍。

为什么值得关注这条把"记忆"从存储问题改成了依赖追踪问题。多数团队的做法是把历史结论堆进上下文或向量库,越堆越乱且无法回溯;Datalog 那套"事实+规则+依赖"的结构天然支持撤销——一条前提错了,下游结论连带失效。做长时任务 agent(漏洞研究、代码审计、竞品调研这类结论会互相引用的场景)值得照这个思路试一版:模型只负责产出带置信度的观察,剩下的推导和失效交给确定性代码。这也顺带给"agent 记忆该不该可回滚"提供了一个可实现的答案。

07Apple 发布 Agent Seer:拿一份 MCP 规范就能自动合成多轮评测场景,参数模式复杂度比工具数量更能预测成败

评测自动化论文研究X:Elvis Saravia(DAIR.AI)· 2026-08-30 00:43 北京时间

Agent Seer 的思路是:给一个 MCP 规范,自动合成多轮 agent 测试场景,不需要示例、不需要实时调用真实工具、也不需要领域微调。在 7 个 MCP 规范上做了验证,小中型规范能实现完整工具覆盖。两个结论反直觉:参数模式的复杂度比工具集规模更能预测质量差异;参数值准确性是主要失败模式。

为什么值得关注做 agent 评测最贵的一步是造场景——要么人工写、要么先接真工具再抓轨迹。这条路线把成本压到"有规范就行",对 MCP 工具越加越多的团队可以直接试:先给自己的工具集自动生成一轮场景,看覆盖率和失败分布。那两个结论也该写进工具设计清单:工具不是越多越难,参数结构复杂才是真难点;失败大多出在参数值填错,而不是选错工具——所以工具描述里参数示例和取值约束,比多写两行功能说明管用。

08vLLM v0.28.0:584 个提交、270 位贡献者,Kimi-K3 的 DSpark TTFT 快约 60%,DeepSeek V4 上了端到端稀疏 MLA

推理基础设施开源vLLM 官方 Release · 2026-08-30 10:13 北京时间

vLLM 发布 v0.28.0,584 个提交来自 270 位贡献者。模型侧两个重点:Kimi-K3 获得 DCP 支持、融合 FlashKDA 内核,DSpark 场景下的 TTFT 改善约 60%;DeepSeek V4 实现端到端稀疏 MLA。

为什么值得关注如果你在自建 Kimi K3 或 DeepSeek V4 的服务,这一版的收益是可以直接量出来的——升级前后跑一遍首 token 延迟和长上下文吞吐,别只看版本号。TTFT 改善 60% 对交互式 coding agent 尤其关键,用户感知的"卡不卡"基本由它决定。顺带留意 vLLM 对国产开源模型的适配速度:K3、V4、Qwen 系列现在几乎都是发布即支持,自建推理栈的选型空间比一年前宽得多。

09Claude Code 桌面端打通终端:/resume 直接调起 CLI 里开过的会话,检查点与 /rewind 照常可用

coding 工具Claude CodeIT之家(Anthropic 官宣)· 2026-08-29 15:13 北京时间

Anthropic 官宣 Claude Code 桌面端与终端会话打通:在桌面端用 /resume 就能调取 CLI 里开过的历史会话,完整对话记录和代码片段原样迁移,检查点机制和 /rewind 回退照常可用。团队工程师 Lydia Hallie 的个人统计是 1,240 次会话、1.624 亿 tokens。

限制:目前只有终端发起的会话支持跨端,桌面端新建的会话暂时搬不回终端。

为什么值得关注以前在终端开的长任务,想接着干就得回终端;现在可以把它拉到桌面端继续,配合 /rewind 回退到某个检查点再分叉。对习惯"终端起任务、GUI 审代码"的人,这道墙拆掉了。用之前注意那个单向限制——重要会话尽量从终端发起,桌面端起的会话暂时回不去。1,240 次会话、1.624 亿 token 这个量级也说明,重度用户的历史会话本身已经是一份需要检索的资产,值得想清楚本地怎么归档。

10一份美国 VC 的访华内部信:中国开源模型在 OpenRouter 的 token 消耗份额,18 个月从不足 2% 涨到 45%

行业格局开源生态X:阑夕(转述 Dimension Capital 内部信)· 2026-08-29 21:49 北京时间

美国风投 Dimension Capital 合伙人访华后致出资人的内部信流出。信里的几个数字:中国开源模型在 OpenRouter 上的 token 消耗份额,18 个月内从不足 2% 升至 45%;Qwen 成为 Hugging Face 上最快突破 10 亿次下载的模型家族;约 80% 的美国 AI 初创已经部署了中国开源模型。信中把成因归结为出口管制倒逼出的全栈效率文化。(内部信内容为转述,具体数字需核查)

为什么值得关注如果 45% 这个份额属实,"选模型默认看美国闭源"这件事已经过期了。对做 agent 的团队,模型选型清单里至少该常驻 Qwen、GLM、Kimi、DeepSeek 这几家,并按任务类型分别跑成本-通过率曲线,而不是整体替换。技术栈地理集中度也是新的风险项——依赖单一区域开源模型的同时,把权重镜像和自建推理的退路准备好。数字出自转述,建议等原始信源或第三方统计确认后再引用。