2026-10-11 · 来源 aihot.virxact.com + X + GitHub Releases · 时间窗:过去 48 小时(10-09 00:38 UTC 起)
1 Codex Composer Predictions 对 Pro 用户开放 beta:根据对话与说话方式预测下一条消息,Tab 接受,计入前不计用量
X source: OpenAI Developers(@OpenAIDevs) · 2026-10-09 ·
官方帖
OpenAI Developers 宣布 Codex 桌面端为 Pro 用户开启 Composer Predictions beta:回复之后,Codex 会根据当前对话和你的表达习惯,给出下一条消息的候选。按 Tab 接受,可再编辑,然后发送;设置里可以关闭。官方跟帖写明:仅桌面端、本地任务;不发送就不会消耗用量。官方帖约 155 万次曝光、6500 赞。
OpenAI 工程师 Vaibhav Srivastav(@reach_vb)随后补充个人数据:过去两周约 36% 的下一步被直接命中,另有约 11% 稍改即可用。Tibo(@thsottiaux)把这项放进 Codex 改进挑战赛 Day 5;社区里有人对照 Claude Code 早有类似体验,也有人实测一周后 Tab 接受率约 40–50%。
为什么值得关注
这是编码 agent 从「补全代码」推进到「预测你的下一步意图」。对每天密集对话的人,省掉的是反复键入同一类跟进指令。官方说内部最受欢迎的新能力之一,且发送前不计用量,值得本周亲自开一天对照自己的接受率。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
2 Claude Code v2.1.296:子 agent 可提前 auto-compact,Read 支持 allow_large,Desktop Code 标签纳入 gateway 策略
GitHub source: anthropics/claude-code Releases · 2026-10-09 ·
v2.1.296
继 10 月 8 日的 v2.1.295(hook 失败可 onFailure: "block")之后,v2.1.296 在 10 月 9 日发布。子 agent 的 frontmatter 与 --agents 定义新增 autoCompactWindow,可让子 agent 比主会话更早自动压缩上下文。Read 工具增加 allow_large,在上下文还有空间时一次读完整份超限文本文件。Claude apps gateway 的 managed.policies[] 新增 code 键,与 cli 同套设置,同时作用于 Claude Desktop 的 Code 标签,并可打开 Desktop 的 gateway 模式。
同日 Codex CLI 放出 rust-v0.162.1:修复异步多行提问导致的 TUI 崩溃,以及后台 server 与 CLI 默认 feature 不一致造成的启动失败。两家都在补「可靠性 + 长会话」同一块。
为什么值得关注
子 agent 提前 compact 与整文件读取,直接打长会话里最常见的两类卡点:上下文被工具输出撑满、大文件被截断后瞎猜。Desktop Code 标签跟 CLI 共用托管策略,也说明 Anthropic 在把终端 agent 的管控面搬进桌面。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
3 Codex 可在用户明确要求且额度剩余 ≤10% 时自行使用重置,默认绝不自动触发
X aihot source: Testing Catalog(@testingcatalog) · 2026-10-10 ·
X 原文
Testing Catalog 截图说明:设置「用量与计费」新增选项「允许 Codex 使用重置」。文案写明:当你在对话里明确请求,且当前额度剩余 10% 或更少时,赋予 Codex 使用重置的能力;重置绝不会自动使用。该帖引用 Tibo Day 6「Reset」话题,约 7000 曝光、85 赞。
这和 Composer Predictions 同一周出现:一边减少键入,一边把额度续命的控制权交回对话里的明确指令,而不是后台静默扣次。
为什么值得关注
重度 Codex 用户最烦的是额度撞墙后切出设置页。现在可以把「重置」当成对话内可审计的动作:必须你开口、必须接近耗尽。适合写进团队默认配置说明。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
4 Amp 支持接入 Claude Pro / Max 订阅:选 Mode → Claude Code 即可,底层改走 Claude Agent SDK,仍保留 orbs / runners / 多线程协作
Amp 宣布所有用户可免费把 Claude Pro / Max 订阅接到 Amp:新建 thread 时选择 Mode → Claude Code,按提示关联订阅即可。底层该模式改用 Claude Agent SDK,而不是 Amp 自研 agent;官方称 orbs、runners、thread 共享、portals、多人协作、thread 间消息与编排仍然可用。另有「自带算力与订阅时 Amp 免费」的配套说明。
为什么值得关注
这是「BYO Claude 订阅进第三方 harness」的明确产品化。你已买 Anthropic 额度、又想用 Amp 的协作壳层时,不必再付一份模型账单。选型时要分清:跑的是 Claude Agent SDK,行为边界跟原生 Claude Code 更近,跟 Amp 自研 agent 不同。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
5 Satya Nadella:把模型与编排它的 harness 拆开,外置管控,假定模型已失陷并预留紧急制动
X aihot source: @satyanadella / TechCrunch · 2026-10-10 ·
原文帖 ·
TechCrunch
微软首席执行官 Satya Nadella 在 X 发长文《Models as Insider Risks in the Super Intelligence Era》,TechCrunch 同日报道。他主张重新评估 AI 信任架构:不能把超级智能当成层层嵌套的黑箱,只接受或拒绝它的建议。具体要求包括:把模型与编排其工作的 harness 分离;把控制与防护外置;每次关键模型动作留下防篡改、人类可读的证据;授权者可在任务中途暂停或关闭模型,并比喻为紧急制动。帖文约 462 万曝光、6000 赞。
背景是多家厂商近期公开 agent 失控与越界案例。Nadella 的表述把「模型」和「跑模型的壳」拆成两个治理对象,和本周 Claude Code / Codex / Amp 的产品更新处在同一条线上。
为什么值得关注
这是平台公司把 harness 提到与模型同级的公开表态。做编码 agent 产品时,可观测日志、中途急停、策略与模型分离,会从「加分项」变成采购清单上的硬条件。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
6 论文:先看失败类型再决定改 harness 还是训权重——过程失败靠 harness,内容失败靠权重
aihot source: arXiv:2610.11655(Stanford 等) · 经 X @rohanpaul_ai 传播 · 2026-10-10 ·
论文
《Harness Evolution Hits a Ceiling: When Weight Training Should Begin》把失败轨迹按首个触发信号分成过程失败(调用被拦、循环、步数耗尽)与内容失败(计划交出来了但质量差)。结论:自演进 harness 修前者;把 harness 教会的行为再蒸馏进权重;内容失败才是权重训练的目标。
DeepPlanning 上,自演进 harness 把 Qwen3.5-4B 留出分从 0.16 提到 0.30,9B 从 0.32 提到 0.44;4B 的成功交付率从 55% 升到 90%。用演进 harness 轨迹训的 LoRA,在原始 harness 下两边都再加约 +0.13;9B 仅靠适配器即可逼近完整演进线,内容失败从约四分之一降到约二十分之一。对照用答案打乱轨迹训的安慰剂适配器低于基线。同套环迁移到 WebArena-Lite 再加 +0.09。
为什么值得关注
给你一条可执行规则:先统计失败构成。循环、超时、工具拦死占多数,就改提示词、工具与检查;计划交得出去但总是错,再开权重训练。乱改一边只会烧预算。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
7 Image-to-WebDev Arena:Claude Opus 5.5 (Max) 以 1749 分登顶,Sonnet 5.5 (xHigh) 1740 分紧随
X aihot source: Arena(@arena) · 2026-10-10 ·
榜单帖
Arena 更新 Image-to-WebDev Arena:Anthropic Claude Opus 5.5 (Max) 1749 分第一,Claude Sonnet 5.5 (xHigh) 1740 分第二,两者都落在帕累托前沿。该榜测的是把设计图变成可运行前端的能力,和纯聊天榜不同。
为什么值得关注
前端还原是 coding agent 的高频场景。同一家两档模型占住前沿,说明选 Opus Max 还是 Sonnet xHigh 时,差的是成本与延迟,不是「能不能做成页面」。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
8 ChatGPT Dot 可在 Codex 里启动并跟进任务,也能编辑 ChatGPT Work 的 Scheduled Tasks
X source: @ChatGPT / @thsottiaux · 2026-10-09~10 ·
ChatGPT 公告
ChatGPT 官方帖:可以把工作委派给你的 Dot;Dot 现在能在 Codex 中启动任务、跟进已有线程,调用 ChatGPT 对话、Codex 线程与自动化,并更好判断该延续线程还是新开。Dot 还可查看与编辑 ChatGPT Work 里的 Scheduled Tasks。Tibo 次日跟帖称这是 Dot 的大升级,并提到可经浏览器把同步发到 LinkedIn。
为什么值得关注
OpenAI 在把「常驻个人 agent」和「编码 harness」接成一条流水线:手机或聊天里起意,Codex 里执行。和 Anthropic 的 Claude Code Projects、xAI 的 Grok Bot 邮箱同一周竞争「谁来当总协调」。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
9 Simon Willison 用 Codex 语音模式、边做饭边给博客做出 Newsletters 索引页
其他 source: simonwillison.net · 2026-10-09 ·
原文
Simon Willison 在 ChatGPT 桌面端 Codex 标签打开语音对话,对着本地 simonwillisonblog 开发环境口头指挥约半小时,做出 Newsletters 索引页(汇总免费周刊与赞助人月刊)。他先键入「Start dev server and open in browser」拿到预览,再点「Start new voice chat」(麦克风旁那个按钮),模型用 GPT-6 Astra High。文章给出可复现步骤与界面截图,强调几乎全程靠说话完成。
为什么值得关注
这是一线开发者对「语音驱动编码 agent」的完整实录,不是演示片。适合对照自己仓库:本地预览 + 语音会话是否真能覆盖半小时量级的功能切片。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题
10 Pine Computer 上线:面向 agent 的云电脑 + harness;SaaS-Bench 检查点 78.3%,整任务完成率 27.4%
X aihot source: Pine AI / Testing Catalog · 2026-10-09 ·
报道帖
Pine AI 发布 Pine Computer:面向 agent 任务的云电脑、harness 与运行时层,开发者用 SDK 起实例、用自然语言下任务。发布方表格称 SaaS-Bench v1.1 检查点得分 78.3%,高于 Opus 5 搭配 Claude Code 的 74.3%;整任务完成率 27.4%,低于后者的 31.1%。定位话术是:现实任务慢、贵、不稳,是因为把为人设计的电脑塞进沉重 harness;agent 需要为自己造的电脑。
为什么值得关注
检查点高、整任务完成率却更低,说明「环境为 agent 重做」能加快中间进度,收尾仍可能输给成熟编码 harness。评估同类产品时,两项数字要一起看,不能只报检查点。
本期评分 1 2 3 4 5 1-5 分 · 次日收集用于优化选题