2026年8月3日 · 来源 aihot.virxact.com · 时间窗:过去 48 小时(24h 内 coding/agent 条目仅 3 条,放宽至 48h 补齐)
01

OpenAI 内部预览 Astra 模型家族:多智能体协作长时任务,Sam Altman 已向华府演示,将成首个接受美国新 AI 审查框架的模型

The Decoder · 8月1日

OpenAI 正在开发代号 Astra 的新模型家族,定位是"通过协调多个智能体处理长时任务和复杂问题",目标是让模型能连续工作数小时甚至数天。CEO Sam Altman 本周已向政界和监管者演示该模型。Astra 将作为首个接受美国政府新 AI 审查框架的模型,发布前需获联邦批准;该框架预计本周末前敲定。The Information 报道,OpenAI 尚未决定其将以 GPT-6 还是 GPT-5.7 发布,目前仍处测试阶段。

另一条线索显示,Astra 已以约 2000 美元(按 Sol API 价计)的成本解决 10 个此前未解的数学问题。Anthropic 研究员 24 小时后用 Claude Fable 复现了其中 5 项,其中 4 项或为独立证明。

为什么值得关注
Astra 不是"更强的 GPT",而是 OpenAI 第一次把"多智能体协作"作为模型家族的主定位公开化——这意味着 GPT-5.6 的单模型路线和 Astra 的多智能体路线在 OpenAI 内部并存。"先演示再发布"对应了 7/30 晨报中 Sam Altman 关于"应放慢节奏"的表态,这次产品节奏被监管审批卡住,对企业用户的影响是:评估 Astra 之前需要等联邦审查框架落地的具体标准(透明度、可解释性、风险等级)。Fable 24 小时内复现 5 项 Astra 数学突破这个事实直接冲击了"Astra 不可替代"的叙事——模型层差距正在缩小,护城河更多在 harness 与 agent 设计上。
https://the-decoder.com/openai-is-reportedly-building-astra-a-model-family-designed-to-work-on-problems-for-hours-or-days https://x.com/testingcatalog/status/2083472959218340231
02

DAIR.AI 提出 ATWZ:基于 Claude Code Agent Teams 的文件系统操作层,为每个智能体分配工作站目录以持久化工作状态

X:Elvis Saravia(@omarsar0,DAIR.AI) · 8月1日

DAIR.AI 创始人 Elvis Saravia 提出 ATWZ(Agent Team Work Zones),一个基于 Claude Code 原生 Agent Teams 构建的文件系统操作层。核心机制:为每个智能体分配独立的工作站目录以持久化工作状态,并设置定期备份机制让知识在上下文压缩后仍可恢复。

该方案直指四类问题:终端关闭导致工作状态丢失;压缩模糊了工作细节;决策被压缩对话困住形成技术债;交接时需要编写长提示词。ATWZ 的设计是让智能体在工作区之间互传文档来替代多数交接提示词。

为什么值得关注
多智能体协作的痛点从来不是"模型不聪明",而是"上下文丢失和交接摩擦"。ATWZ 用文件系统作为持久化层而非内存或数据库——这是个可立刻复现的工程选择:在 Claude Code 的 Agent Teams 基础上给每个 agent 分配目录、用 git 或 rsync 做定期备份、让 agent 之间用文件而非 prompt 传递状态。和 7/31 晨报中 Cursor Cloud MCP(#3 用 MCP 工具让 agent 自检环境)是同一个方向:把可观测性、持久化、状态管理从 agent 身上卸载到环境层。区别在于 Cursor 修的是开发环境,ATWZ 修的是多智能体的工作空间。对用 Claude Code 跑多 agent 流程的团队,这个思路不需要依赖 Claude Code 内部 API,用文件目录就能落地。
https://x.com/omarsar0/status/2083556612971913569
03

Supabase 开源 Evals:用真实任务评测 Claude Code、Codex 和 OpenCode,驱动 supabase.com/evals 公开排行榜

MarkTechPost · 8月1日

Supabase 开源了 Supabase Evals,一个用真实任务(构建 schema、调试 Edge Function、修复 RLS 策略等)评测 Claude Code、Codex 和 OpenCode 等编码智能体的基准与框架,并直接驱动 supabase.com/evals 公开排行榜。任务全部基于 Supabase 自己的生产代码场景,没有用合成题目。

为什么值得关注
Supabase Evals 与 7/31 晨报中 HANDBOOK.md(#6)形成对照:HANDBOOK.md 测试"agent 是否能遵守长政策文档",Supabase Evals 测试"agent 能否在真实生产场景中完成真实任务"——前者是合规性评测,后者是能力评测。关键差异:任务来自 Supabase 自己的生产 codebase(schema 设计、Edge Function 调试、RLS 策略修复),不是合成 SWE-bench 题目,这意味着评测结果更接近企业实际部署 coding agent 时的预期。公开排行榜的设计让任何团队都能跑同一基准横向对比——不再依赖厂商自己声明的能力数字。OpenCode 进入评测范围这点值得注意:OpenCode 是开源 fork 系 coding agent,被纳入企业级基准测试,说明它已经从个人项目走到生产候选位置。
https://www.marktechpost.com/2026/08/01/supabase-releases-evals-an-open-source-benchmark-that-scores-claude-code-codex-and-opencode-on-real-supabase-tasks
04

Claude Code 创始人 Boris Cherny:仅当把 Claude 置于业务中心、逐环节数字化并消除流程瓶颈,才能从 AI 集成中拿到真实生产力

X:Rohan Paul(@rohanpaul_ai) · 8月1日

Claude Code 创始人 Boris Cherny 引用 1996 年哈佛商业评论关于 IT 投资回报的研究,解释为何许多公司在 AI 集成中看不到显著生产力提升。结论:仅将 AI 作为辅助工具、保留原有流程的公司难见成效;真正受益者会把 Claude 放在业务中心,逐一数字化并消除流程瓶颈,做彻底重构而非叠加。

为什么值得关注
Boris Cherny 拿 1996 年的 HBR 研究给当下 AI 落地难下结论——这本身就是种态度:80 年代企业花了大钱装 ERP 系统,效益差距在十年后才显现,AI 集成大概率走同一路径。Cherny 的观点比"AI 工具能让你效率翻倍"这种说法硬得多:把 AI 当 chatbox 用不会有质变,必须重写工作流。这与 7/27 晨报中 Boris Cherny"1700 次 PR、80 亿 token"那套实践互相印证:他自己做的事就是"用 Claude Code 重写工作流"而非"在原流程上加 AI"。对正在评估 AI 工具 ROI 的团队,这个判断意味着:单纯计算"用 AI 省了多少小时"会低估真实价值,真正的衡量指标是"用 AI 重构后整条业务链路的成本/速度/质量变化"。
https://x.com/rohanpaul_ai/status/2083657147318218756
05

DoorDash 因用月之暗面 Kimi K2.6 写代码遭美国众议院两委员会调查;创始人称组合在内部测试中已超越 Sonnet 4.6 + Opus 4.8

IT之家 · 8月1日

美国众议院两个委员会主席联合要求 DoorDash 提供其使用的中国 AI 大模型相关信息。DoorDash 创始人公开表示,公司内部测试显示,月之暗面 Kimi K2.6 与 Anthropic Fable 5 的组合在编码任务上可超越 Anthropic Sonnet 4.6 + Opus 4.8 的组合,且成本更低,公司已通过模型路由服务将底层任务委托给 Kimi K2.6。DoorDash 回应称支持美国 AI 领先,愿与调查委员会合作。

为什么值得关注
这是美国大型科技公司第一次因"用中国大模型写代码"被国会正式调查——与 7/23 晨报中"美国财长威胁制裁月之暗面"和 7/24 微软评估 K3 接入 Copilot 那条线是同一趋势的政治升级。DoorDash 创始人敢于公开"组合超过 Sonnet + Opus"这种对比数字,说明中国模型在 coding 任务上对美国旗舰模型的成本/性能比已经具有可量化的吸引力——否则一个上市公司 CEO 不会拿这种事冒险。短期影响:美国上市公司使用 Kimi/DeepSeek/通义千问的合规风险显著上升,需要准备模型供应链多元化和"如果被要求停用"的回退方案。中期影响:模型路由(根据任务自动选择最合适模型)这种架构本身可能成为合规审查对象。
https://www.ithome.com/0/984/647.htm
06

DeepSeek V4-Flash-0731 公测:经大量后训练,代码 Agent 能力大涨,价格不变;国家超算互联网已上线 API 与模型文件

IT之家 · 8月2日

DeepSeek 7 月 31 日通过 API 文档发布日志上线 V4-Flash-0731 正式版。ArtificialAnlys、lmarena 等基准平台 8 月 1 日同步更新结果,显示其单任务成本比 GPT-5.6 Luna 低约 60%、是 Fable 1/105。国家超算互联网已正式上线 V4-Flash-0731 的 API 调用服务和模型文件下载,企业和开发者无需环境配置,一键接入即可调用;平台 AI 社区汇集 1700 余款国产开源大模型,成为全国首个十万卡级超智融合算力资源池。

为什么值得关注
DeepSeek 在 48 小时内密集发声的 V4-Flash-0731 是后训练强化版本(不是架构升级)——这意味着 DeepSeek 选择的是"反复打磨同一模型"路线而非"训练更大的下一代"。V4-Flash 在 8 月 1 日单日处理了 8T tokens(5T 免费 + 3T 来自 OpenCode Go),用量级直接说明价格策略在需求端的拉动效果。但要警惕:V4-Flash 是 Flash 档位(轻量推理),不是 K3 那种旗舰档;用 V4-Flash 跑 SWE-bench 级别的复杂任务和 K3 比仍有差距。编码 agent 团队应按"Flash 跑简单/批量任务,K3 跑复杂/规划任务"分层使用——这和 #7 中 DeepSeek 自研 Harness 的方向呼应。
https://www.ithome.com/0/984/747.htm https://www.ithome.com/0/984/645.htm
07

DeepSeek 招募 Agent Harness 开源开发者内测自家 Harness,模型厂正式下场做 Harness 生态

X:Tianyi Cui(@tianyi) · 8月1日

DeepSeek 团队成员 Tianyi Cui 发文招募 Agent Harness 相关开源项目的开发者参与 DeepSeek Harness 内测,要求附上 GitHub id 和开源代表作。联系语气显示这是定向邀请而非公开注册。

为什么值得关注
这是国内大模型厂商第一次公开为 Harness 单独招人——之前 Harness 在国内语境里更多是"怎么写 system prompt"的口语化讨论。DeepSeek 现在要做的是把 Harness 当作可独立发展的产品线,单独面向开源生态招募贡献者。意义有两层:一是模型层和 harness 层未来可能解耦(用 DeepSeek 模型的团队可以直接用 DeepSeek Harness 而不必自己拼);二是模型厂可能开始打造"模型 + Harness + Skill"的捆绑生态——和 7/29 晨报中阿里云 Qoder 开源 Better Harness 是同一波,但 DeepSeek 选择自营、阿里云选择开源。对开发者来说这是机会:Agent Harness 经验比纯 prompt 工程更具长期价值,相关开源项目会被模型厂主动收编。
https://x.com/tianyi/status/2083519855203078320
08

NVIDIA NeMo 团队发布 Molt:PyTorch 原生智能体强化学习框架,RL 代码 8.6K 行,比 verl 小 7 倍

MarkTechPost · 8月2日

NVIDIA NeMo 团队发布 Molt,一个 PyTorch 原生的智能体强化学习框架。RL 代码仅约 8.6K 行,比 verl 小约 7 倍。框架组合 Ray、vLLM 与 NVIDIA AutoModel(均未 fork 上游),通过 token 精确的 loopback 服务器支持原生 OpenAI 或 Anthropic SDK 来训练智能体。

为什么值得关注
Molt 解决的是"训练 coding agent"这个具体问题:之前业界做 RL 训练智能体要么 fork verl/trl 自己改,要么用 OpenRLHF 这种偏 SFT/对齐的工具;Molt 的差异点是用 Ray 调度 + vLLM 推理 + AutoModel 模型这一套现成组件(不 fork)拼出一个智能体 RL 框架。token 精确的 loopback 服务器是关键设计:让 OpenAI/Anthropic SDK 不用改就能用,意味着你之前用这些 SDK 写的 agent 逻辑可以直接被 Molt 训练。"比 verl 小 7 倍"对应的是可读性和可调试性——智能体 RL 比 LLM RL 难调 10 倍,一个 8.6K 行的小框架比百万行大框架更可能让研究者改得动。NVIDIA 这步棋对应的是它在 7/24 晨报中提到的"英伟达机器人上下文扩至 8K"(RoboTTT)那套——智能体 RL 和机器人 RL 用同一套底层基建。
https://www.marktechpost.com/2026/08/01/nvidia-ai-releases-molt-a-pytorch-native-agentic-reinforcement-learning-framework
09

Cloudflare 启动 Agents Week:现有云为人设计,Agent Cloud 需同时构建智能体原生底层并充当现有网络的转换层

Cloudflare Blog · 8月2日

Cloudflare 启动为期五天的 Agents Week,核心议题是"Agent Cloud"应具备何种形态。其判断:现有云和网络皆为人设计,而智能体在速度、结构与访问上有独特需求,因此 Agent Cloud 需要同时构建面向智能体原生的底层能力,并充当现有网络与智能体网络之间的转换层。本周将围绕执行层、智能体开发生命周期、安全控制及智能体网络等主题展开。

为什么值得关注
Cloudflare 把"Agent Cloud"作为本周主题——这是 CDN/边缘计算厂商第一次在公开博客里把"为 agent 而非为人设计"作为核心论点。对比参考:7/22 晨报中 Cursor 公开了"云智能体开发环境架构"(anydev CLI + Cloud MCP + Cloud Doctor),那是给单个公司的 coding agent 跑的开发环境;Cloudflare 在做的是面向所有 agent 的运行时层。逻辑是:agent 跑得快(毫秒级决策)、访问模式不同(高频 API 调用而非 Web 页面浏览)、结构化(JSON 协议而非 HTML 渲染)——这三点和 CDN 当年解决的"静态资源分散到边缘"问题同构,所以 Cloudflare 有动机也有能力做 Agent Cloud 基建。Agents Week 五天议程(执行层/SDLC/安全/网络)值得逐日跟踪,每条都可能预示 Cloudflare 后续的产品发布。
https://blog.cloudflare.com/agents-week-welcome
10

Google DeepMind 发布 SkillSmith 论文:把前缀 KV 缓存当作输入模态,推理时为冻结的 Gemma 3 4B 模型生成新技能而无需重训

X:Rohan Paul(@rohanpaul_ai) · 8月2日

Google DeepMind 发布论文 SkillSmith,提出将前缀键值缓存视为一种输入模态:在推理时通过前向传播为冻结的 Gemma 3 4B 模型生成新前缀缓存,无需针对新任务重新训练模型权重。这意味着"技能"以 KV cache 形式存在,可以像权重一样被组合、复用、传输。

为什么值得关注
SkillSmith 走的是一条和"传统 skill/工具调用"完全不同的技术路线——传统 skill 是文本指令或工具 schema,SkillSmith 把 skill 编码为模型的前缀 KV cache。本质上是用神经网络内部状态当 skill 的"存储介质",推理时通过前向传播生成新的 cache 来"安装"新技能到冻结模型上。如果这条路走通,意味着:(1) 技能可以像 LoRA 一样被组合和分发,但不需要合并到权重;(2) 技能学习不需要重训整个模型,成本低一个量级;(3) 技能可能成为模型即服务(MaaS)之外的第二种商品化形式——卖"技能 cache"而不是卖"模型 API"。对 harness engineering 团队,这条路一旦成熟,今天调 prompt/写 tool schema 的工作流都会被改写。Gemma 3 4B 是个能跑的小规模实验对象,论文成果可立刻在消费级 GPU 上复现。
https://x.com/rohanpaul_ai/status/2084016126095466982