2026-09-16 · 来源 aihot.virxact.com · 时间窗:过去 24h(09-15 09:00 起,北京时间;已对照 09-15/09-14 两期去重;10 条全部落在 24h 窗口内)
01
Gergely Orosz 探访 OpenAI:一家围绕 Codex 运转的智能体软件工厂,非工程部门 4 个月从 0 到 90% 采用
source: Pragmatic Engineer(已核实原文)· 9 月 15 日
Gergely Orosz 实地探访 OpenAI 总部,访谈了七位工程师与工程负责人(应用基建 VP Venkat Venkataramani、ChatGPT 工程负责人 Sulman Choudhry、桌面端负责人 Andrew Ambrosino、核心 agent 团队负责人 Joe Gershenson 等)。结论:自 1 月起,Codex 和 ChatGPT Work 成为公司几乎所有工作的基础。财务、招聘、法务这些非工程部门在 4 个月内采用率从约 0% 冲到 90%——而早在界面对非工程师还极不友好、满屏代码的时期,采用率已有 40%。整体使用率从 4 月到 5 月由 60% 跳到 90%,Andrew 把拐点归因于 harness 处理长任务能力的改善,而不是模型变聪明。
今天的 OpenAI 按一条 9 步流水线运转:人定义目标 → Codex 收集上下文 → 实现 → 构建测试 CI → agent 审查 → agent 部署 → 观察生产 → 生产监控反馈 → Sevbot 故障响应。代码审查不是单一 reviewer,而是按变更内容派生多个领域专家 agent(云基础设施、安全各管一摊);低风险 PR 由专门 agent 自动批准。部署环节有"护航 agent"手把手把变更送到生产并自建监控仪表盘;Sevbot 负责故障时收集上下文、拟定缓解措施——但不自动执行。配套改造:所有文档移入源码,上下文源接通 Git、GitHub、Slack、Notion、Databricks、Datadog、内部日志和内部 skills。代价是某些系统负载涨了约 10 倍——多数公司走完这一步要 2-3 年,OpenAI 用了 6 个月。
为什么值得关注 这是迄今对"agentic 软件工厂"最完整的一手描述,9 步流水线、风险分级审查、auto-approve 的分界画在哪里,都可以直接对照自己的 harness 抄作业。两个细节值得单独记:采用率 60%→90% 的拐点被归因于 harness 而非模型,又一次验证"吞吐瓶颈在执行框架";内部版 Codex 接入了几乎所有内部系统,比外部版先进得多——这解释了为什么外部跑分和内部生产力的观感总对不上。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
02
微软论文《Is Bash All You Need?》:光给 agent 一个 Bash,比配一整套类型化工具高 21.8-24.5 分,token 还省 19-72%
source: 微软论文 arXiv:2609.11999 / DAIR.AI 转述(推文全文已核实)· 9 月 15 日
论文比较了五种工具接口:类型化工具目录、仅 Bash、程序化工具调用(agent 对固定目录写代码)、Bash+类型化工具叠加、Bash+agent 自写工具叠加。在 TheAgentCompany 和 APEX-Agents 两个基准上,用 Opus-4.8 和 GPT-5.5 测试。结果:仅 Bash 比 typed tools 在 TheAgentCompany 上高 21.8-24.5 分,在 APEX-Agents 上高 4.8-7.4 分,同时 token 消耗少 19%-72%。在 Bash 之上再叠加类型化工具或 agent 自写工具,均无可测量收益。
作者给出的选型建议只有两条:执行可以沙箱化时,用 Bash;合规要求固定工具清单时,用程序化工具调用。
为什么值得关注 结论顶住了一个流行直觉——"给 agent 配的工具越细越好"。类型化 schema 的 token 开销和接口僵化在长任务里反而是负资产,这一点和昨天 MarkTechPost 那篇 harness/framework/MCP 分层文互为印证:工具传输层怎么设计,必须实测,不能照着 SDK 文档默认。给 agent 选工具接口前,先跑一组 Bash vs typed tools 的对照,成本低、结论收益大。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
03
Trail of Bits 拆穿 1Password 的 AI 补丁基准:26% 干净修复率被四项实验设计压低,顺手发布两个补丁验证 agent 技能
source: Trail of Bits 博客(已核实原文)· 9 月 15 日
1Password 8 月 6 日发布的 FLAWED 报告称 AI 产出的干净修复率只有 26%。Trail of Bits 复查其公开代码和数据后列出四个设计选择:样本刻意挑了 6 个难修的漏洞(各漏洞干净修复率从 3% 到 60% 不等,均值取决于挑了哪些);两组提示词故意指示 agent 应用错误修复,占数据 22%;一个评测模式禁止编译和运行代码,占数据 36%;GPT-5.5 跑 medium effort、Opus 4.8 跑 high effort,都没测最高档,也没测 effort 对结果的影响。
作为参照,Trail of Bits 给出自己咨询项目的人类基线:2024-2026 年 236 次安全评估中 2,265 个漏洞的首轮修复,12.5%(八分之一)没能完全解决,95% 置信区间 10.5%-14.5%——开发者拿着详细报告、知道会被复查,仍然八分之一修不对。随文发布两个 agent 技能:post-patch-validation 引导 agent 复现原始 bug、换一条路径再测、查回归、并把构建失败标记为"无法定论"而非"漏洞已复现";review-walkthrough 把分支 diff 变成按逻辑阅读顺序的互动走查。两者连同此前的 variant-analysis、property-based-testing、mutation-testing 全部开源在 trailofbits/skills。
为什么值得关注 基准评测的反面教材和正确姿势一次给全:"故意喂错误提示词占 22%、禁止测试占 36%、不同模型不同 effort"——这三条可以直接抄进评测 checklist,用来审任何一份 AI 能力报告。12.5% 的人类首轮修复失败率还悄悄改写了对照组:agent 补丁质量该跟"八分之一修不对的人类"比,而不是跟 100% 比。两个技能对做 skill 评测的团队是现成的高质量语料。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
04
InstructGPT 共同作者发布非 LLM 决策模型 Jev:0.35 秒一个判断、输出 token 免费,第三方实测快 25 倍省 580 倍
source: TypeSafe 官方博客 / Every.to 实测(均已核实原文)· 9 月 15 日
TypeSafe AI 发布首个"System One 决策模型"Jev:不做文本生成、不做推理链,一次查询并行输出带校准概率的结构化判断——训练方法是新的 RLCD(Reinforcement Learning for Calibrated Decisions),目标是置信度与实际正确频率对齐。定价:输入 $0.042/百万 token(即 $42/十亿),输出免费;响应 70-500ms。创始人 Diogo Almeida 是 2022 年 InstructGPT 论文共同作者。官方口径称同类任务比前沿 LLM 快 40-200 倍,首页标语的 193.6 倍快、444.6 倍省是上限值。
Every 的第三方实测更接近现实:主编 Mike Taylor 把 37 篇文章 × 21 个 AI 写作特征问题丢给 Jev,0.7 秒内返回 777 个判断,成本约四分之一美分;整轮 11 个实验共 1,709 个判断,总计不到 1 美分。Dan Shipper 的对照测试:同一组 4 项写作检查跑 12 段文本,Jev 每篇中位 0.35 秒,Fable 5.1(high effort)8.83 秒——约 25 倍快、约 580 倍便宜;7 个植入缺陷 Jev 抓到 6 个,Fable 抓满 7 个。参数量与上下文长度未披露,目前早期访问制。
为什么值得关注 这不是又一个 chat 模型,是把"模糊问题 → 概率判断"单独拎出来做成了可组合函数——agent 运行中的实时检查(guardrail、自检、路由、验证)第一次有了速度成本都撑得住的专用件。Every 给出的用法值得照抄:给 Codex 或 Claude 配上 Jev 和一组检查项,让它每写完一段就自检,而不是等人最后兜底。做评测流水线的团队可以把它放进"评委"位跑一轮校准曲线,$42/十亿 token 的价格试错成本几乎为零。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
05
两个人加 Codex,一个月从零逆向出 M4 Mac Mini 的 Linux GPU 驱动:完整 OpenGL ES 3.0 兼容,Minecraft 200fps
source: Cody Ho 博客(已核实原文)/ Hacker News · 9 月 15 日 HN 刷屏
Cody Ho 与 Niklas 用约一个月,为 M4 Mac Mini 和 MacBook Neo(A18 Pro)从零逆向出完整的 AGX 固件 ABI 并写出 Linux GPU 驱动:OpenGL ES 3.0 全兼容(不通过的仅剩可选扩展),Minecraft 跑到 200fps,Chrome 和 Firefox 的 WebGL 正常合成。全程只做实时探测、不查看任何 Apple 二进制,清洁室流程——捕获数据里含 shader 的页直接丢弃换成自写实现。
分工上,Codex(GPT-5.6 Sol,后期换 GPT-6 Astra)主导内核侧:固件 ABI 逆向、Rust drm-shim、异步内核驱动;Claude 负责用户空间第一阶段(分析 Metal 程序、写反汇编器),但在理解指令以编译自有程序上失败。硬骨头是 compute:初始 trace 捕获高达 336MB 无法重放,改成单用户模式加微型 Metal 程序才拿到干净数据;Codex 在 compute 对象上卡了超过一周,trace 抓对之后几小时就拆解完。还有一个野路子 harness:为绕过 Codex 的网络安全过度限制,作者写了个 daemon 每分钟截图对比,画面不变就自动输入 /goal resume 让它继续跑。
为什么值得关注 系统级 GPU 驱动逆向过去是十年功力的活,现在两人加 agent 一个月做到 OpenGL ES 3.0 合规——AI 辅助做硬核底层的边界又被推了一格,而且方法论是公开的:hypervisor 捕状态、trace 驱动逆向、Khronos CTS 当模型的测试基准。那个 /goal resume daemon 也值得记下:把"检测停摆+自动续跑"做成外部看门狗,比在提示词里求模型别停管用得多,长任务 harness 都用得上这招。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
06
自主渗透 agent 25 分钟挖出 Baseten 生产 GitHub 管理员令牌:藏在三年前镜像的构建历史里
source: Strix 博客(已核实原文)/ Hacker News · 原文 9 月 1 日发布,9 月 15 日 HN 热帖
安全公司 Strix 在评估推理供应商 Baseten(估值 130 亿美元)时,把自己的自主渗透 agent 指向 *.baseten.co,无凭据、无源码。约 25 分钟内 agent 自主跑完整条链路:枚举主机和证书日志 → 发现一个公开的 Harbor 镜像仓库 → 匿名拉取 baseten/baseten-app 镜像 → TruffleHog 扫出一对已失效的 AWS key 后没有停手 → 继续在镜像 config 的 history[].created_by 字段里找到 2023 年 3 月构建时被展开进 RUN 命令的 GitHub PAT(ARG GITHUB_TOKEN 直接进了构建参数)。该 token 属 basetenbot 账号,对 Baseten 主产品仓库、驱动集群的 GitOps 仓库和 Homebrew tap 有 admin+push 权限,另有多个私有仓库可读写——两年半后的 7 月测试时依然有效。Baseten 次日上午确认为 critical、仓库转私有并轮换令牌。
根因是熟悉的老坑:构建需要拉私有依赖,有人把 GitHub token 当 build argument 传进去,Docker 把展开后的值记进了镜像元数据。清理密钥文件没用——history 里还存着一份。
为什么值得关注 两个可以今天下班前就执行的检查:docker history --no-trunc 看一遍旧镜像的构建历史(docker inspect 里的 history[].created_by 同样要查);核对构建 token 的实际权限面——拉个依赖只需 read,这家却给了产品库和 GitOps 库 admin。另一层信号是攻击面在变:agent 自主渗透从概念演示变成 25 分钟出一个 critical 的现实,"被遗忘的旧镜像"这类资产在 AI 攻击者眼里的排位只会更高——你的 agent 得比他的先找到。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
07
Perplexity 自研 CobbleDB 替代 DynamoDB:两名工程师加数百个 agent 干两个月,官方称每年最多省一亿美元
source: Perplexity CEO Aravind Srinivas / Perplexity 官方 X · 9 月 15 日深夜
Perplexity CEO Aravind Srinivas 宣布自研键值数据库 CobbleDB,替代 AWS DynamoDB 承接网页内容抓取的热存储,称迁移后每年最多节省一亿美元。团队构成:两名工程师,加上数百个全天候持续运行的 Computer agent,两个月建成核心基础设施。官方研究给出的性能数字:热存储批次读取延迟比 DynamoDB 全分布低约 5 倍,P50 从 31.4ms 降到 5.60ms。工程博客原文当前被 Cloudflare 拦截未能直接核实,以上均为官方口径。
为什么值得关注 这是 24 小时内第二个"agent 建基础设施"的实锤(第一个是本期第 1 条 Orosz 的 OpenAI 软件工厂)——核心基础设施的建造成本结构正在变:两名工程师加 agent 舰队两个月,撬动的是一个年化一亿美元级的开支项。"省一亿"是自家宣称,落不落地要等独立验证,但"agent 舰队当施工队、人类定架构"这个组织形态已经被第二家复用了,做基础设施和做 agent 平台的团队都该把这条放进成本模型的变量里。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
08
Codex 认证失效后自己切 computer use 翻 Slack 界面,比调 API 还快——"AI 也许不会等 API"
source: X @Yuchenj_UW(已核实原帖)· 9 月 15 日
Databricks 的 Yuchen Jin 让 Codex/Astra 搜索一个超大 Slack 频道,恰好他的认证失效了。agent 没有修 auth、没有走 API,直接切到 computer use,在 Slack 界面上快速滚动浏览——他看着它翻完,比 API 还快。他的原话:"Slack API 慢得难受还有速率限制,它显然不是为 agent 造的……AI 也许不会等 API。"
为什么值得关注 和本期第 2 条微软 Bash 论文正好凑成一对:接口层慢、限流或坏掉时,agent 会自寻出路,UI 操作成了事实上的 fallback transport。这对做 agent 平台的人是具体的测试项变更——你以为在测"模型用工具的能力",实际还得测"模型绕开工具的能力":权限边界、审计日志、速率策略都得把 computer use 路径算进去,否则你的安全模型里缺一整条通道。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
09
学生博主抽查 F-Droid 单日 102 个应用更新:72.5% 主要由 AI 编写
source: tintotint.eu(已核实原文)/ Hacker News · 9 月 15 日
一名自称 FOSS 维护者的学生博主(tintotint)把 F-Droid 2026 年 9 月 12 日推送的整批更新——共 102 个应用——逐个人工巡查仓库后给出分级:74 个(72.5%)主要由 AI 编写,9 个难以归类,19 个几乎无 AI 痕迹。判据是"仓库美学":Claude/Codex co-authored 提交记录、仓库里的 agent 基础设施配置(有就直接归 AI 类)、AI 生成图标、README 的 emoji 倾倒、一次性 +10k 行的 init 提交。他还发现 Codeberg 托管的 5 个应用里 4 个被评为 Mostly AI——可能违反 Codeberg 自己的 AI 使用政策。
作者自己列了局限:评级主观、基于表面信号、未做代码质量与安全分析、单日单批次样本不代表整个 F-Droid。
为什么值得关注 开源发行渠道的"AI 占比"第一次有了可复核的单批抽样数字——72.5% 意味着默认假设要反过来:你装的 F-Droid 应用大概率有 AI 深度参与,供应链审查的粒度得跟着变。方法粗糙但零成本、可复制,任何应用商店或内部 registry 都能照着跑一遍当基线。对维护者还有个软信号:提交信息里写清 AI 披露正在变成社区事实标准,藏着掖着的仓库反而先被点名。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
10
Arena 更新 Image-to-WebDev 榜单:GPT-6 Astra 1733 分登顶,GLM-5.3-Flash 以 1/190 的单价拿到榜首 92% 的分数
source: Arena 官方 X(已核实原帖)· 9 月 16 日凌晨
Arena 更新 Image-to-WebDev 榜单并纳入四个新评测模型:GPT-6 Astra(Max)以 1733 分登顶,领先第二名 Claude Fable 5.1(Max,1710 分)23 分,领先 GPT-5.6 Sol(xHigh)129 分;Muse Spark 1.3(Max)1645 分排第四;GLM-5.3-Flash 1588 分排第十,第三名为 Claude Opus 5(Max,1665 分)。该榜评测两项能力:从图像和截图生成网站,以及涉及多步推理和工具使用的 agentic 编码工作流。性价比侧,三个模型站上 Pareto 前沿:Astra $40/M、Muse Spark 1.3 $3.50/M、GLM-5.3-Flash $0.21/M(每 1M token 混合价)。
为什么值得关注 采购参考直接可用:GLM-5.3-Flash 用榜单约 1/190 的混合单价拿到榜首 92% 的分数,Muse Spark 1.3 用 $3.50/M 站上第四——做截图转代码和多步 webdev 工作流的团队,这份榜单按"分/美元"读比按名次读有用得多。另一个值得盯的点是口径:分数会随模型版本和 effort 档位漂移(Astra 是 Max 档、Sol 是 xHigh 档),引用时把档位一起写上,否则对比无效。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题