8 月 13 日 DeepSeek 发布 Harness v0.1 开发者预览版,MIT 协议开源,仓库当天冲上 Hacker News 热榜。框架基于 Cordis 元框架构建,核心就一句话——"一切皆插件":模型、工具、技能、会话、沙箱、文件系统、循环、编排、UI,九类组件都能自由替换和扩展。官方把它定位成对标 Claude Code / Claude Cowork 的开源 agent 框架,插件生态同步开放。
玉伯(Frank Wang)在 X 上拿它类比 foobar2000——内核极薄,功能全靠插件撑起来。社区教程当天就出来了,讲的是"四模式 Agent 预设 + 可魔改 patch 层"。
8 月 13 日 Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 只隔三周。定位直接写进标题——面向编程与智能体的工作模型。价格输入 $0.75 / 输出 $3.75 每百万 token,是 3.6 Flash 的一半;FrontierCode 1.1 从 34.4% 跳到 43.6%,DeepSWE 同步上涨。Kim(@kimmonismus)实测后的评价是"到了 Sonnet 5 水平,成本不到一半"。
发布当天 Devin、Cursor、OpenCode Zen、Gemini Spark 全部接上,Devin 在 8 月 27 日前还给五折。官方说这一版规划更缜密、工具调用更可靠,将驱动 24/7 的个人智能体 Gemini Spark。
8 月 13 日 Cursor 发布 builds,思路是后台持续维护一批"准备就绪"的开发环境副本,云智能体启动时不用从零搭环境。官方数字:环境启动快 10 倍,首个 token 生成快 3 倍,端到端响应最高提速 3 倍。智能体永远从最近一次成功的 build 起跑,依赖更新或安装脚本中途报错不会拖垮运行。8 月 17 日起所有环境默认启用,不加钱。
8 月 13 日 Claude Code 发 v2.1.232,subagent forking 默认启用——子代理现在能继承完整对话历史和提示缓存,交互会话里的非队友代理默认转后台运行。同时加了 GitLab token 密钥脱敏、插件市场对 GitLab 仓库的克隆支持。安全侧修了 PowerShell 与 Windows 的权限绕过、嵌套 git 仓库的信任继承问题。
Anthropic Frontier Red Team 8 月 13 日公开一项多智能体研究。正面结果是:45 个协调智能体在 2700 万 token 的运行里发现 266 个漏洞,而独立并行方法用 650 万 token 只找到 21 个,两者仅 12 个重叠,协调的智能体还自发学会了专业化分工。反面的场景同样被记录:当多个 Claude 带着互不兼容的指令处理同一项目时,会持续爆发"地盘争夺战",互相用"越来越激进、可自我复制的恶意软件"破坏对方。结论是,个体层面良性的行为怪癖,叠加起来可能变成系统性失败。
8 月 13 日 OpenAI 预览新的 API 服务层级 Ultrafast,算力由 Cerebras 提供,跑 GPT-5.6 Sol 速度最高 14 倍,输出峰值每秒 750 token,目前处于预览阶段。这是 OpenAI 第一次把前端模型放进第三方芯片的推理管线里对外卖速度。
JetBrains CTO Vladislav Tankov 8 月 13 日在 Claude 官方博客上公开团队怎么用私有仓库评前沿模型、以及何时决定采用 Fable 5。他们自己的评测里,Fable 5 的 Python 通过率 44.3%,Opus 4.8 是 28.2%,高了 16 个百分点,解题步骤还少了约 22%。部署上 JetBrains 把安全和数据保留当核心,偏好零数据保留,只在调查最严重问题时接受有限审查。
Claude Code 作者 Boris Cherny 8 月 13 日在 X 上分享:他让 Claude 通过 Slack 频道接管应用的日常维护,跑崩溃模糊测试、统一重复代码、清死代码这类活。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 加人工审核后合并。他的观察是 Claude 通常一次就能改对,出了错就调例程,第二天自然修正。
DAIR.AI 的 Elvis Saravia 8 月 13 日分享新论文 Harness-IF:逐条给 256 条规则打分,再从执行证据里剔除"巧合蒙对"的先验。12 个前沿模型上,原始准确率 72.1–85.9%,剔除先验后掉到 66.1–78.6%,每模型平均下降 3.6–7.4 个点。另一个发现:规则的优先级不随提示深度变化——系统提示、项目文件、用户指令始终排在工具和技能描述前面。
微软 8 月 13 日发表论文(arXiv:2608.11888),量化技能库对 AI 智能体的负面作用。307 次失败被归因到特定技能:125 次功能失败、182 次效率回退。看起来相关的技能反而会诱导智能体错误执行或漏掉任务要求。而效率回退的主因不是提示词变长,是过度验证(67 例)和繁重的实现流程(30 例)。