8 月 21 日,TechCrunch 报道 Nvidia 的最新研究:长时程任务里,模型本身的能力不再是决定因素,包裹在模型外的"缰绳"——也就是 harness——扮演更关键的角色。研究人员用定制 harness 并加入"监督者"组件,让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上跑出了 100% 满分;不开 harness 的同一基线只拿到约 30%。
研究的副产物是一套叫 AVO(Agentic Variation Operators)的变换方法:通过有监督的"扰动-筛选"循环自动生成更好的 harness 变体,把模型在一个任务上做对的做法,蒸馏成可以迁移到其他任务上的执行策略。Nvidia 在开发者博客同步放出完整论文与代码。
8 月 21 日,DeepSeek 在 API 更新日志同步发布实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,调用方式为设置 model='deepseek-v4-flash-vision-exp'。模型在保留 V4-Flash 文本推理能力的基础上加入视觉理解,内部智能体基准测试成绩接近 Opus 4.8。
关键工程细节:图片按 token 计费,单张图片最多折算 384 tokens,不另收视觉附加费。兼容 OpenAI 与 Anthropic 两家 API 格式,支持 Base64 输入。DeepSeek Harness 0.1.1 已发 Day-0 适配,文档同时给出视频处理方式(先抽帧再喂,不要直接上传视频文件)。
8 月 21 日,Anthropic 在官方博客宣布 Claude Mythos 5 已接入企业版 Claude Security,企业客户可自助启用此扫描能力,无需直接访问模型本身。该功能为公开测试版,扫描按现有计划的常规 token 用量计费,无单独模型附加费。
每项发现都附 CWE 分类、严重等级,并建议补丁。同时启动 3500 万美元的 Defender Advantage Fund(代号 0xDAF),定向资助把 Mythos 5 接入开源安全工具的开发者。配套合作伙伴包括多家已有网络安全防御产品线的厂商。
OpenAI 开发者账号 8 月 21 日宣布,GPT-5.6 Sol 的 API 价格在未来三个月内下调超过 20%。同时,在 Codex 与 ChatGPT Work 中以 token 为单位购买的额度也更耐用,订阅内含使用量保持不变。Pro、Plus、Business 套餐不在此次调价范围内。
多名行业观察者把这次调价解读为对 Anthropic 的竞争压力。Testing Catalog 给的数字更具体:降幅 20%,周期三个月(至 11 月 21 日前后),同步适用于 Codex 积分与 ChatGPT Work 月费额度。
Rohan Paul 8 月 21 日转发了一篇 Salesforce 的研究,对基于记忆的自我改进智能体做了一轮更严格的评估。研究测试了两种记忆型方法(包含 ReasoningBank),把任务顺序这一变量纳入控制:按 WebArena 默认顺序跑,性能提升 +1.5 分;打乱任务顺序后,同样方法性能反而掉 4.5 分。
另一个不那么令人放心的发现:记忆系统会把错误经验也一并沉淀,例如智能体在"API 暂时不可调用"的环境下生成的失败经验会被持久化,反复触发同样的死循环。补充详细评分标准与环境反馈只能部分救场。
Claude Code 在 8 月 21 日发 v2.1.239,距离上一次 v2.1.238(8/20)不到 48 小时。核心变更:/cost 命令、状态栏花费、--max-budget-usd 三处成本估算点位都把"数据驻留工作区"算作 1.1 倍的美国专属推理溢价。基于云厂商部署(Bedrock、Vertex AI、Foundry)的 Claude Code 增加了全屏渲染器。
新命令 /claude-api upgrade 引导用户从 Anthropic SDK 迁移到官方 Claude API。当日共修复 38 个 bug,覆盖 Remote Control 路径、网关/重定向缓存、Windows 长会话内存等。
8 月 21 日 Claude 博客上线"The AI-Native SDLC Playbook",主张当代码不再是开发瓶颈时,规划、审查、部署这些"人速环节"才是新约束。手册把 Plan / Design / Build / Test / Deploy / Maintain 六阶段重排为 AI 嵌入每个环节的闭环。
关键工程动作:把需求先压成 intent.md,再被拆解为可调用的 Skills 和 committed artifacts;每个 stage 之间用版本化的工件串联,确保下游能反查到上游决策。建议性控制与强制性控制被明确区分——前者由 AI 提示给人类,后者走 hook / CI 校验 / 评审必经门。手册里反复强调"committed artifacts = audit trail",意思是所有阶段产出物都进 git,以备回溯与 PR review。
Anthropic 的 Thariq 8 月 21 日在 X 上分享了最近在 Anthropic 内部高频使用的一个技能:/ELI5。调用方式是 /eli5 <你想被解释的内容>,触发后 Claude 会按预设风格——"像对完全不懂这个话题的人解释一样"—输出一份"带大图、少文字"的 HTML 页面。
和 8/21 #02 报道的 Matt Pocock /wayfinder 路径相反:wayfinder 是当目标模糊时探索路径;/ELI5 是当目标已经清楚时把答案讲简单。一个管前端的"该去哪",一个管后端的"听懂没"。
Testing Catalog 8 月 21 日宣布 Codex 已正式登陆 Atomic Bot。卖点相当直接:"合上你的笔记本电脑吧。"——Codex 任务可以在云端持续运行,不再依赖本机会话。
用户可以把代码仓库交给智能体,让它在云端持续改进代码、发现并修复漏洞、跑更多任务。任务在用户的本地 Claude Code / Codex 客户端关闭后仍在后台推进。用户重新开客户端时直接拿到结果与 pull request 列表,而不是等一个长 session 跑完。
DAIR.AI 8 月 21 日转发 Viktor 公开测试。Viktor 同步推出 OpenAI 兼容 API 和托管 MCP 服务器。用户可以把现有 OpenAI SDK 指向 Viktor 的 API,也可以把 Viktor 作为 MCP 服务器添加到团队客户端,设置只从设置页复制一段代码。
演示视频里有个数字值得专门拎出来:Viktor 在 76 秒内从 opencode 构建并发布了一款"品牌贪吃蛇游戏"——事前没有给游戏代码,只通过 Slack 把品牌指南喂给了它。换句话说,Viktor 不仅能跑编码任务,还能从企业沟通工具里自动学习品牌资产(配色、字体、措辞)并落到产出物里。