2026-08-22 · 来源 aihot.virxact.com · 过去 48 小时
01
Nvidia 研究:模型外的"缰绳"才是长时程任务的关键,定制 harness 让 Claude Opus 5 在 ARC-AGI-3 上拿下 100% 满分
NvidiaHarnessARC-AGI-3Claude Opus 5

8 月 21 日,TechCrunch 报道 Nvidia 的最新研究:长时程任务里,模型本身的能力不再是决定因素,包裹在模型外的"缰绳"——也就是 harness——扮演更关键的角色。研究人员用定制 harness 并加入"监督者"组件,让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上跑出了 100% 满分;不开 harness 的同一基线只拿到约 30%。

研究的副产物是一套叫 AVO(Agentic Variation Operators)的变换方法:通过有监督的"扰动-筛选"循环自动生成更好的 harness 变体,把模型在一个任务上做对的做法,蒸馏成可以迁移到其他任务上的执行策略。Nvidia 在开发者博客同步放出完整论文与代码。

为什么值得关注:这是 8/19 报"harness 比模型重要"那波讨论之后第一份带量化对照的实证。Opus 5 不加 harness 30%,加上之后 100%——这种级别的差距不是"模型再训一代"能补上的,意味着做 coding agent 的人只要改 harness 就能在 ARC-AGI-3 这类任务上跑赢一轮新模型。对做 prompt/skill 评测的人来说,AVO 框架本身就是一份新评测工具:评测问题不再是"哪个模型更好",而是"哪个 harness 把模型用得更好"。这一篇也给后续好几天的 harness 综述、SkillOpt 迁移研究(8/6)、Grok Build 体验爆发(8/19)一连串事件都提供了一个共同的理论支点。
来源:TechCrunch · Nvidia Developer Blog · 2026-08-21 查看原文 →
02
DeepSeek 上线首个多模态实验模型 V4-Flash-Vision-Exp:智能体基准接近 Opus 4.8,单图最多计 384 tokens
DeepSeekV4-Flash-Vision-Exp多模态开源

8 月 21 日,DeepSeek 在 API 更新日志同步发布实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,调用方式为设置 model='deepseek-v4-flash-vision-exp'。模型在保留 V4-Flash 文本推理能力的基础上加入视觉理解,内部智能体基准测试成绩接近 Opus 4.8。

关键工程细节:图片按 token 计费,单张图片最多折算 384 tokens,不另收视觉附加费。兼容 OpenAI 与 Anthropic 两家 API 格式,支持 Base64 输入。DeepSeek Harness 0.1.1 已发 Day-0 适配,文档同时给出视频处理方式(先抽帧再喂,不要直接上传视频文件)。

为什么值得关注:V4-Flash-Vision-Exp 是 DeepSeek 主线 V4-Flash 系列里第一个看图模型,价格还是 Flash 档——意味着编码/agent 工作流可以直接加眼睛而不需要换模型系列。对做 harness 的人,多模态接入成本从"换更贵的模型"变成了"加一段图片预处理",现金流和组织结构都不用动。Opus 4.8 级智能体基准给它留出了一个有意思的位置:如果你现在用 Opus 做多模态 agent,但成本敏感,V4-Flash-Vision-Exp 是一个可以放进横向对比表里的样本。DeepSeek Harness Day-0 适配这件事也得记一笔——继 7/28 Kimi K3 SGLang Day-0 之后,又一次见到模型厂当晚同步出 harness 支持。
来源:DeepSeek API 更新日志 · The Decoder · 2026-08-21 查看原文 →
03
Anthropic 把 Claude Mythos 5 塞进 Claude Security,企业可自助扫代码库漏洞,附 3500 万美元 Defender Advantage Fund
AnthropicClaude Mythos 5Claude Security0xDAF

8 月 21 日,Anthropic 在官方博客宣布 Claude Mythos 5 已接入企业版 Claude Security,企业客户可自助启用此扫描能力,无需直接访问模型本身。该功能为公开测试版,扫描按现有计划的常规 token 用量计费,无单独模型附加费。

每项发现都附 CWE 分类、严重等级,并建议补丁。同时启动 3500 万美元的 Defender Advantage Fund(代号 0xDAF),定向资助把 Mythos 5 接入开源安全工具的开发者。配套合作伙伴包括多家已有网络安全防御产品线的厂商。

为什么值得关注:Mythos 5 是 Anthropic 能力最强的模型,原本藏在 API 后——这次它通过 Claude Security 间接抵达企业,安全团队不需要单独采购 API、没有 prompt injection 的入口,但能拿到 Mythos 级别的漏洞判断。这等于 Anthropic 把"模型即扫描器"的产品形态稳了下来:和 7/29 报过的 Mythos 60 小时自主挖出 HAWK/AES 漏洞的内部能力是同一条技术线,但这次是把它做成可订阅的产品。0xDAF 的金额不算大,但信号很明确——Anthropic 在把"防御端"的生态位填成一项可投资的赛道。
来源:Claude Blog · 2026-08-21 查看原文 →
04
OpenAI 把 GPT-5.6 Sol 的 API 价格下调逾两成,限时三个月,Codex 与 ChatGPT Work 的额度同步打折
OpenAIGPT-5.6 Sol降价Codex

OpenAI 开发者账号 8 月 21 日宣布,GPT-5.6 Sol 的 API 价格在未来三个月内下调超过 20%。同时,在 Codex 与 ChatGPT Work 中以 token 为单位购买的额度也更耐用,订阅内含使用量保持不变。Pro、Plus、Business 套餐不在此次调价范围内。

多名行业观察者把这次调价解读为对 Anthropic 的竞争压力。Testing Catalog 给的数字更具体:降幅 20%,周期三个月(至 11 月 21 日前后),同步适用于 Codex 积分与 ChatGPT Work 月费额度。

为什么值得关注:价格战重新回到编码模型赛道。这次不只是模型 API 降价,而是连带 Codex 额度都跟着打折——意味着 OpenAI 在押注"把开发者绑在 Codex 上"比单纯抢 API 客户更值钱。对正在做模型选型的人,三个月窗口期是一份免费的横向对比预算:之前因为"Opus 太贵、Fable 5 更贵"避开 GPT-5.6 Sol 的工作流,可以现在跑一轮,对比不打折的 Anthropic 侧,拿到一份时间锁定的成本/质量数据。但价格战反过来会逼 Anthropic 跟进,对 Claude Code 的企业客户来说可能是好事。
来源:X / OpenAI、OpenAI Developers · Testing Catalog · 2026-08-21 查看原文 →
05
Salesforce 论文:记忆型自我改进智能体的"提升"大部分来自任务顺序,按 WebArena 默认顺序打乱了反而下降 4.5 分
SalesforceReasoningBank记忆智能体WebArena

Rohan Paul 8 月 21 日转发了一篇 Salesforce 的研究,对基于记忆的自我改进智能体做了一轮更严格的评估。研究测试了两种记忆型方法(包含 ReasoningBank),把任务顺序这一变量纳入控制:按 WebArena 默认顺序跑,性能提升 +1.5 分;打乱任务顺序后,同样方法性能反而掉 4.5 分。

另一个不那么令人放心的发现:记忆系统会把错误经验也一并沉淀,例如智能体在"API 暂时不可调用"的环境下生成的失败经验会被持久化,反复触发同样的死循环。补充详细评分标准与环境反馈只能部分救场。

为什么值得关注:这是和 8/21 #08 那篇"自我改进增益或为评估噪声"异曲同工的另一击:单次运行、固定顺序的评测给的数字和真实泛化性能之间存在系统性高估。论文给出的修复路径很明确——多次运行取方差、随机化任务顺序。两个补救加起来应该作为 agent 和 skill 评测的下限要求。对做 harness 的人,记忆系统不再是"开了就涨"的免费午餐,需要在 prompt 里设计"何时该写记忆、何时不该写"的策略,不然训练数据分布外的地方会反噬。
来源:X / Rohan Paul (@rohanpaul_ai) · 2026-08-21 查看原文 →
06
Claude Code v2.1.239 上线:成本估算纳入数据驻留工作区 1.1× 推理溢价,Bedrock/Vertex/Foundry 引入全屏渲染器,新增 /claude-api 升级命令
Claude Codev2.1.239Bedrock成本估算

Claude Code 在 8 月 21 日发 v2.1.239,距离上一次 v2.1.238(8/20)不到 48 小时。核心变更:/cost 命令、状态栏花费、--max-budget-usd 三处成本估算点位都把"数据驻留工作区"算作 1.1 倍的美国专属推理溢价。基于云厂商部署(Bedrock、Vertex AI、Foundry)的 Claude Code 增加了全屏渲染器。

新命令 /claude-api upgrade 引导用户从 Anthropic SDK 迁移到官方 Claude API。当日共修复 38 个 bug,覆盖 Remote Control 路径、网关/重定向缓存、Windows 长会话内存等。

为什么值得关注:成本估算第一次被官方做到命令级别——以前 Claude Code 的 token 账单是事后才能算清的,现在 /cost 给实时数字。这对企业内做预算的人是关键变化:可以给单个项目设 --max-budget-usd,超支自动停。1.1× 溢价给的多半是动因——把数据放在 AWS 美国区的隐性成本以 multiplier 形式标出来,避免月底收到账单才发现。/claude-api upgrade 看似不起眼,但实际是 Anthropic 在引导 Bedrock/Vertex 客户往直接 API 走——值得留意是不是价格策略的一部分。
来源:GitHub Releases · 2026-08-21 查看原文 →
07
Anthropic 发布 AI 原生 SDLC 实战手册:把六阶段流水线改造成 intent.md + Skills + 持续评估 + 强制人工关口的闭环
AnthropicAI 原生 SDLCintent.mdSkills

8 月 21 日 Claude 博客上线"The AI-Native SDLC Playbook",主张当代码不再是开发瓶颈时,规划、审查、部署这些"人速环节"才是新约束。手册把 Plan / Design / Build / Test / Deploy / Maintain 六阶段重排为 AI 嵌入每个环节的闭环。

关键工程动作:把需求先压成 intent.md,再被拆解为可调用的 Skills 和 committed artifacts;每个 stage 之间用版本化的工件串联,确保下游能反查到上游决策。建议性控制与强制性控制被明确区分——前者由 AI 提示给人类,后者走 hook / CI 校验 / 评审必经门。手册里反复强调"committed artifacts = audit trail",意思是所有阶段产出物都进 git,以备回溯与 PR review。

为什么值得关注:对做 harness 工程的人,这份手册等于把"AI 编码团队该怎么组织"这件事给出了一份结构化答案。和 8/06 提的 SkillOpt 跨 harness 迁移是同一条线的两端:SkillOpt 解决"skill 怎么从一套 harness 跑到另一套上去",AI 原生 SDLC 解决"在企业内部,skill、intents、commitments 三者怎么组合成一条流水线"。X 你之前的工作方向里 SkillOpt 是重点参考——这两份连起来读,能看到 skill 评测的下一步不再是单点 benchmark,而是要嵌入到这条 SDLC 流水线里被测。
来源:Claude Blog · 2026-08-21 查看原文 →
08
Anthropic /ELI5 技能:内部被高频使用,输入"想被解释的话题"后输出带大图少文字的 HTML 讲解页
Anthropic/ELI5Skill内部用例

Anthropic 的 Thariq 8 月 21 日在 X 上分享了最近在 Anthropic 内部高频使用的一个技能:/ELI5。调用方式是 /eli5 <你想被解释的内容>,触发后 Claude 会按预设风格——"像对完全不懂这个话题的人解释一样"—输出一份"带大图、少文字"的 HTML 页面。

和 8/21 #02 报道的 Matt Pocock /wayfinder 路径相反:wayfinder 是当目标模糊时探索路径;/ELI5 是当目标已经清楚时把答案讲简单。一个管前端的"该去哪",一个管后端的"听懂没"。

为什么值得关注:这是 X 你关注方向里 skill 评测一栏的素材。/ELI5 之所以值得专门拎出来,是因为它展示了"好用的 skill"可以被压缩得多么简洁:触发词一个、参数一个、风格约束一段。和 Matt Pocock 的 grill-me / wayfinder 一脉相承——好的 skill 不是越复杂越好,而是触发意图清晰、约束条件可枚举。和 7/22 报过的 Claude Cowork 录屏→skill 转换是同一条线:从内部使用习惯中提取通用技能模式。对做 skill 评测的人来说,/ELI5 是一个天然的对照样本——它短得可以全文放进 SKILL.md,又能稳定地产出可读性强的产物。
来源:X / Thariq (@trq212) · 2026-08-21 查看原文 →
09
Codex 接入 Atomic Bot:合上笔记本电脑,任务在云端持续跑——智能体可被指派去持续改进仓库和发现漏洞
OpenAICodexAtomic Bot云端后台

Testing Catalog 8 月 21 日宣布 Codex 已正式登陆 Atomic Bot。卖点相当直接:"合上你的笔记本电脑吧。"——Codex 任务可以在云端持续运行,不再依赖本机会话。

用户可以把代码仓库交给智能体,让它在云端持续改进代码、发现并修复漏洞、跑更多任务。任务在用户的本地 Claude Code / Codex 客户端关闭后仍在后台推进。用户重新开客户端时直接拿到结果与 pull request 列表,而不是等一个长 session 跑完。

为什么值得关注:之前 coding agent 的边界是"你打开了,它在跑;你关掉了,它停了"——这种"在线才干活"的模式让"晚上睡前扔进去、早上起来看结果"的工作流不可能。Codex Atomic Bot 把边界推到云端持续运行,意味着 Coding agent 的 SLA 类比对象不再是 IDE 而是 CI:可以接受异步派发、长任务排队、客户端关闭后继续。对做 harness 的人,这是异步 / 队列化执行环境的又一次落地(之前 8/09 Claude Code 会话互发消息、8/14 Claude Code Subagent forking 都在朝这个方向走),但这次是 OpenAI 第一次把它默认打包到产品里给开发者。
来源:X / Testing Catalog (@testingcatalog) · 2026-08-21 查看原文 →
10
Viktor 公测 OpenAI 兼容 API + 托管 MCP 服务器:76 秒从 opencode 构建并发布品牌贪吃蛇游戏,已通过 Slack 学习品牌指南
ViktorOpenAI 兼容 APIMCP品牌学习

DAIR.AI 8 月 21 日转发 Viktor 公开测试。Viktor 同步推出 OpenAI 兼容 API 和托管 MCP 服务器。用户可以把现有 OpenAI SDK 指向 Viktor 的 API,也可以把 Viktor 作为 MCP 服务器添加到团队客户端,设置只从设置页复制一段代码。

演示视频里有个数字值得专门拎出来:Viktor 在 76 秒内从 opencode 构建并发布了一款"品牌贪吃蛇游戏"——事前没有给游戏代码,只通过 Slack 把品牌指南喂给了它。换句话说,Viktor 不仅能跑编码任务,还能从企业沟通工具里自动学习品牌资产(配色、字体、措辞)并落到产出物里。

为什么值得关注:Viktor 这一波把"OpenAI 兼容 API + 托管 MCP + 学习品牌资产"三件事合并起来呈现了一个新形态:智能体不再只跑你的代码生成任务,它还从企业协作工具里反向吸收你们的设计/语言规范。对做 harness 的人,问题是"skill 是被预定义在文件里,还是从 Slack/Notion 这类数据源即时提炼"——Viktor 给出了后者的一种实现路径。76 秒端到端构建并发布的数字也意味着它的 agent loop 不会在每一步重排队——它值得被加进选型清单做横向对比,但也要留意演示样本是一个游戏,不是更复杂的业务系统。
来源:X / Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-21 查看原文 →