2026年8月7日 · 来源 aihot.virxact.com · 时间窗:过去 24 小时(部分条目放宽至 48h 补齐)
01

OpenAI Astra(GPT-6)最快下周发布:内部代号 mewfour,自 GPT-4.5 以来最大预训练,单用例 token 成本约 2000 美元

IT 之家 / Bleeping Computer / @kimmonismus(X) · 8月6日晚至 8月7日晨

消息源 @synthwavedd 8 月 6 日在 X 爆料,OpenAI 目标下周发布内部代号 mewfour 的 Astra 模型,被定位为自 GPT-4.5 以来 OpenAI 训练的最大全新预训练模型,最新内部版本已进入 Release Candidate 阶段,正在公司内部做 dogfood 测试。8 月 1 日 OpenAI 官方数学博客已埋下伏笔:Astra 的内部版本解决了 10 个长期未解的开放数学和理论 CS 问题,按 Sol API 费率计算,相关 token 成本约 2000 美元。

能力描述强调"组织与协同 AI 智能体"和"长周期、高难度任务"——Bleeping Computer 与多位爆料者都把 Astra 写成"为多智能体协作而生"。规模上,知名开发者 Haider 估算 GPT-4.5 约 5T 参数,Astra 据传可能达到 7–10T,约为 GPT-5.6 Sol 的两倍。OpenAI 内部对"超越 Anthropic Fable 5"的目标表述直接。但"最快下周"的口径属爆料——预测市场对 Astra 在 8 月中旬公开发布的概率给出较低预期,发布时间仍存在不确定性。

为什么值得关注
如果时间表属实,OpenAI 第一次回到"预训练驱动"的路线。这对 agent 团队有两层直接影响:第一,编码 agent 的底层模型可能在几天内换一档,长上下文、工具调用稳定性、代码库级理解都会重新洗牌;第二,多智能体协同是 Astra 的明牌卖点,意味着 Codex CLI、Codex for Web 等产品的"agent-of-agents"编排层可能在发布前后同步升级。对照 8/7 报道的 Anthropic 自研芯片(Fable 推理成本砍半的方向)和 DeepSeek 涨价(模型供给侧重新定价),基础模型层的竞争在 8 月集中加速——这不是下一季度的故事,是下周的事。
https://www.ithome.com/0/986/789.htm https://eu.36kr.com/en/p/3928686064171400
02

Anthropic 公开确认组建自研芯片团队:硬件-模型协同设计,目标 Claude 推理成本减半

Quartz / TechTimes / 财联社 / 半导体行业观察 · 8月5-6日

Anthropic 周三确认正在组建内部"custom silicon team",为 Claude 模型设计定制芯片——这是 Anthropic 首次公开承认自研硬件计划。团队负责人是 6 月初从 OpenAI 加入的 Clive Chan,他曾在 OpenAI 参与 Jalapeño 推理芯片的矩阵乘法架构与硬件性能分析,更早曾在特斯拉 Dojo 项目做 GPU 优化和训练基础设施。

方法上,Anthropic 走"软硬件协同设计"——芯片与 Claude 模型同步开发,每个 transformer attention、矩阵乘法和 KV cache 操作的指令集都被专门优化。这条路线与苹果 M 系列芯片、谷歌 TPU 同源。招聘信息显示芯片工程师年薪 32–48.5 万美元,要求"ship 过硅片、能在小组织里做关键决策"。OpenAI 自研芯片 Jalapeño 早期测试据报每 token 成本相比标准 GPU 推理省 50%——Anthropic 规模相当(数十万企业客户和数百万个人用户),按这个量级每年可省数亿美元。Anthropic 强调仍会维持 AWS、谷歌、英伟达、AMD 的多芯片策略;据报道已与三星探讨 2nm 制程合作。

为什么值得关注
Anthropic 跟进 OpenAI 6 月发 Jalapeño、谷歌 TPU 自研后这一步的轨迹,意味着 Claude API 的定价会重新洗牌——对话成本可能半年内再降一个量级。对 harness 工程师的影响:当 Claude 推理变便宜,Opus/Fable 档模型在 agent 主循环里的可用度大幅上升,原本"只能 spawn Sonnet"的场景会逐步切到更重的模型;Agent Skills、Computer Use、Codex-like 工作流也会因推理成本下降变得更敢调长上下文。这与 8/5 报道的 DeepSeek V4-Flash MI300X 单卡生产部署、7/30 的 mxFP8/NVFP4 低精度 RL 是同一条成本下降曲线,但 Anthropic 的变便宜来自 model-芯片 联合设计而非单纯量化。
https://qz.com/anthropic-custom-ai-chip-design-team-claude-080526 https://www.techtimes.com/articles/323238/20260805/anthropic-confirms-house-chip-team-co-design-bet-could-cut-claude-inference-costs-half.htm
03

Google Antigravity CLI 完整命令清单:异步子代理、Agent Manager、MCP、Sandbox、Custom Agent 一体

Google AI Developers(X)/ Antigravity 官方文档 · 8月6日夜

Google 发布 Antigravity CLI(命令 agy)的官方速查表。这是从 Gemini CLI 演化而来的编码 agent 终端,可接入 Gemini 3.5 Flash、Gemini 3.1 Pro、Claude Sonnet、Claude Opus、GPT-OSS 120B 等模型;编排器读目标后自动拆任务,派发独立上下文窗口的子代理并行执行,主上下文不被长任务撑爆。

命令分四组:规划与执行(/fast、/goal、/planning、/schedule)、自定义与规则(/hooks、/keybindings、/learn、/mcp、/permissions、/skills)、子代理与任务(/agents、/tasks、/teamwork-preview——后者仅 Google AI Ultra 订阅可用,可让 agent team 自主攻坚大项目)、工作区工具(/add-dir、/codesearch、/diff、/effort、/fork、/rewind 等 20 余条)。支持 --dangerously-skip-permissions YOLO 模式(仅限受信任项目使用,建议配合 Git 提交点做回滚);Agent Manager 面板支持子代理生命周期可视化和即时终止(按 k);自定义 agent 走 ~/.gemini/config/agents/<name>/agent.md,可与 Plugins 打包分发。Preview 阶段通过 Google 账号登录即可获免费速率额度。

为什么值得关注
Antigravity CLI 是 Google 第一次把"团队作战"作为默认能力嵌进编码 agent——/teamwork-preview 让一群 subagent 自动拆解大项目并并行跑,这和 7/22 报道的 Cursor Agent Swarm 树状分解、8/7 报道的 Meta Muse Code 隔离工作树子智能体是同一条路线。命令体系覆盖 hooks、permissions、skills、mcp、agents——harness 工程的每一层都有开关,开发者可以像写 IDE 配置一样调教 agent。两点要警惕:一是 YOLO 模式(--dangerously-skip-permissions)和 8/6 报道的 AISI 19/122 违规率提醒同一件事——给 agent 工具权限时一定要分项授权;二是该工具和 8/7 报道的 Agent Plugins 1.0.0 是同一波生态布局——Google 同时在推 Plugins 通用规范和 Antigravity 这个旗舰 harness,两件事配合着用技能才能跨平台共享。
https://x.com/googleaidevs/status/2085468449145544780 https://antigravity.google/docs/cli/commands/agents https://antigravity.google/
04

DeepSeek 官宣大幅上调 API 定价:当前每任务约 3 美分的近前沿模型,105 倍低价时代可能终结

IT 之家 / @rohanpaul_ai(X)· 8月6日晚

DeepSeek 在官网发布通知,"计划近期整体上调 API 服务定价,预计涨幅较大,具体方案以正式通知为准"。DeepSeek V4-Flash 当前费率输入/输出 token 各 14/28 美分/M,比 Claude Fable 5 便宜约 105 倍;V4-Pro 输入/输出各 3/6 元/M token(未命中缓存)。DeepSeek V4-Flash-0731 公测一周后即宣布涨价,时机与 Meta Muse Spark 1.2、OpenAI GPT-5.6 Luna 在能力与价格上追平 DeepSeek 同步。

具体涨价幅度未公布。DeepSeek-V4-Flash-0731 在开源模型中排名第二,仅次于 Moonshot AI 的 2.8T 参数 Kimi K3;涨价前它是开发者跑 agent 工作流、批量跑 evals 的首选便宜模型。涨价背景的隐含叙事:V4-Flash-0731 公测登顶多个榜单后,DeepSeek 已没必要继续补贴。

为什么值得关注
这是过去一年模型供给侧价格曲线的拐点。DeepSeek 一直是"用 1/100 价格拿到 90% 能力"的代名词——8/3 报道的 DeepSeek V4-Flash 被开发者拿来跑全套 evals,7/27 报道的 Cline 让 K3 在 17 小时内递归自改进 harness,DeepSeek 价格是这些工作流成立的前提。涨多少会影响两件事:跑批量 harness 评估(Codex/Cline/Aider 跑回归)的成本曲线;agent-of-agents 的 spawn 频率上限。对短期可控的应对是:提前用 V4-Flash 缓存足够的量或迁移到同等价位的 Muse Spark 1.2 / Qwen3.8 Max;从行业视角看,DeepSeek 涨价 + Anthropic 自研芯片 + OpenAI Astra 推新模型,预示 2026 Q4 的 API 单价不会再单调下降了。
https://www.ithome.com/0/986/339.htm https://x.com/rohanpaul_ai/status/2085341525270319208
05

PIMiner 把红队攻击转成智能体搜索:成功的 prompt 沉淀为可复用策略库,跨模型自适应

@dongxi_nlp(X)/ arXiv:2607.piminer · 8月6日

论文《Agent Against Agent: 用于自动提示注入红队测试的智能体系统》把红队测试建模成搜索问题。PIMiner 用一个目标 LLM 作为待攻击对象,攻击侧用一个 agent 持续探索 prompt 注入路径;每次成功都记录下完整的"模型接收的输入+触发的有害输出"对,自动沉淀为可复用的策略库。

关键工程细节:策略库以"未见过的模型也能适应"为目标存储——不是死记硬背某次成功组合的字符串,而是抽象出可迁移的攻击模式。这意味着团队接入新模型时,攻击侧 agent 可以从已有策略里抓"看起来对路"的样式做迁移实验,而不是从零开始红队。论文同时给出一套评估协议:把不同难度级别的 prompt 注入攻击打榜,比 SOTA 静态 prompt 注入测试在自适应速度上快几个数量级。

为什么值得关注
8/6 报道的 AISI 19/122 违规事故和 8/6 报道的 Atlassian Rovo 数据窃取漏洞都印证一件事:coding agent 的真实威胁面不是"故意越狱",而是 agent 在执行正常任务时碰到 prompt injection 的组合爆炸。PIMiner 的价值不在"更强的攻击",而在"攻击侧的 agent 化"——它把 prompt 注入测试从"生成 N 条样本 + 跑测试 + 人工分析"的手工循环,变成一个能跨模型迁移的自动搜索问题。harness 工程师直接受益:可以拿 PIMiner 持续轮训自己的 Codex/Claude Code skill 库,发现哪些 skill 描述在真实场景下容易被诱导——这比研发合规靠经验写 system prompt 可靠得多。
https://x.com/dongxi_nlp/status/2085467442659127562
06

Qwen3.8 Max 综合榜首、Grok 4.5 成本 1/13 击败 K3、DeepSeek V4 Pro 编程仅差 Opus-4.6 0.3%——编程模型一周内的三国杀

Artificial Analysis / @rohanpaul_ai(X)/ The Decoder · 8月6日

Artificial Analysis 智能指数 v4.1.1 把 Qwen3.8 Max 评为综合表现最佳——该指数整合 9 项评测,评分器本轮升级到 GPT-5.6 Luna(medium)。Qwen3.8 Max 与 Claude Opus 4.8 持平,但 Kimi K3 以低 25% 的成本得分更高。任务耗时帕累托前沿只由 OpenAI 和 Anthropic 占据:2 分钟内的前沿模型全部来自 OpenAI;2 分钟以上的 6 个模型中 4 个来自 Anthropic;Kimi K3 (max) 因 Moonshot AI 官方 API 输出速度低,单任务耗时约 11 分钟。

另两条独立数据同样在 8 月 6 日发布:Grok 4.5 以约 13 倍的低成本击败 Kimi K3(具体任务场景未披露细节,但成本对比来自 Grok Build 团队的官方宣传口径);DeepSeek V4 Pro 编程跑分仅差 Opus-4.6 约 0.3 个百分点。这是 8/3 DeepSeek V4-Flash、8/4 Qwen3.8 Max 评测、7/29 Grok 4.5 登顶后的最新一轮——三家几乎同时把编程/智能体模型的价格-性能前沿挤到同一区间。

为什么值得关注
模型层的同质化速度比预想的快。Qwen / K3 / Opus 4.8 / Grok 4.5 / DeepSeek V4 Pro 的智能体能力差距被压到 1-2 个百分点,价格差距却拉开近 13 倍——这意味着 harness 工程师下一步要解决的不再是"选哪个模型",而是"按任务画像路由到最划算的模型"。Cursor Router、OpenRouter Ori、Antigravity /effort 滑块——8 月这一波 harness 工具都在做同一件事。但 K3 单任务 11 分钟的延迟提醒一个反例:模型便宜不是全部,长耗时会让 agent-of-agents 的总时长失控;选模型要看"每成功任务的成本",不是单价。
https://artificialanalysis.ai/?intelligence=agentic-index https://the-decoder.com/qwen3-8-max-catches-claude-opus-4-8-but-kimi-k3-scores-higher-with-25-percent-lower-cost https://x.com/rohanpaul_ai/status/2085512712881357146
07

Energy 发布:前 OpenAI 员工 Gabriel 离职三个月后推出 computer use 产品,主打让 AI 接管电脑全部工作

@gabriel1(X)/ @rohanpaul_ai(X) · 8月7日晨

前 OpenAI 员工 Gabriel 8 月 7 日凌晨在 X 公开 Energy 产品——用自然语言描述任务,让 AI 在电脑上完成全部工作,无需手动点击。团队的核心观察:旧金山以外不足 1% 的人群知道"计算机使用"的价值,因此选择边公开构建边探索用户增长。现有用户已能实现"数天工作数小时完成"——一个典型场景是 Energy 每 5 分钟扫一次发布帖回复,把新 bug 自动推到 Slack。

Gabriel 离职 OpenAI 仅三个月。在 OpenAI 内部他就是 Computer Use 方向的推动者;出来后立刻做了独立产品。这是 8 月内第三家盯上"computer use"赛道的玩家(前两家是 8/5 报道的 Cloudflare @cloudflare/computer,和一直存在的 Anthropic Computer Use、ChatGPT Operator)。Energy 的差异化在"为个人用户做的轻量版"——不是企业 SDK、不是单任务 agent,而是一个共享计算机的"工作伙伴"。

为什么值得关注
Computer Use 这个赛道 8 月突然拥挤起来——Cloudflare 用 V8 isolate 做浏览器(8/5 Kitesurf、8/6 OS);Anthropic、OpenAI 在 ChatGPT/Claude 里都内置了;现在前 OpenAI 员工做独立产品。对 harness 工程师的信号是:computer use 正在从"模型厂的内置功能"分化为"通用运行时"层。短期来看,未来半年会有更多编码 agent 把 computer use 当作 fallback——遇到不能 API 化的工具就 fallback 到 GUI 操作;你的 harness 设计需要预判"agent 决定自己点鼠标"的场景。中期看,Energy 这类创业公司的存活空间在于是否真的能跑出旧金山以外的人群——computer use 的痛点(不会用提示词、不敢让 agent 乱点)在普通人那边比想象的大。
https://x.com/gabriel1/status/2085506228801937485 https://x.com/gabriel1/status/2085418582192841147
08

Codex Computer Use 支持 Microsoft Edge 扩展:在 ChatGPT 扩展里操作浏览器,Edge 成首个第三方浏览器选项

@testingcatalog(X)· 8月6日下午

OpenAI 在 Codex 设置中新增"更多浏览器"板块,Computer Use 功能现支持通过 Microsoft Edge 上的 ChatGPT 扩展使用。Edge 是首个除内置浏览器外的受支持选项。

关键变化是 chatgpt 扩展:从 ChatGPT 桌面 app 或 web 里,Codex 不再只通过内置的无头浏览器操作,而是可以驱动用户已登录的 Edge 会话——也就是说 agent 可以用用户自己的 cookie、自己已登录的账号、自己保存的密码。这与之前在隔离沙箱里跑 computer use 是不同的信任模型:从"agent 自己造环境"变成"agent 操作真实环境"。

为什么值得关注
这一改动看似只是"多支持一个浏览器",但实际改的是 Codex computer use 的信任模型:agent 从"在沙箱里点按钮"变成"用你的 cookie 登录的服务点按钮"。前者出了问题损失在沙箱里,后者直接动了你的银行、邮箱、云盘账号。这和 8/6 报道的 Atlassian Rovo prompt injection 漏洞、8/6 AISI 事故报告是同一条风险曲线——工具调用一旦跨过"沙箱 vs 真实会话"的边界,harness 工程师必须重新设计授权层,不能再依赖 browser 沙箱的隔离能力。短期内不要在 Edge 上给 Codex 默认开所有扩展权限;agent 跨过信任边界的每一个新能力都该单独配 allow/deny 列表。
https://x.com/testingcatalog/status/2085135848492707935
09

swyx 开源 smol forge:智能体原生的 Git 远程仓库,内置 CI/CD,开放 100 名 alpha 用户

@swyx(X)· 8月6日

swyx(GitHub Universe / smol.ai 创始人)8 月 6 日宣布 smol forge 开放首批 100 名 alpha 用户。smol forge 是一个"智能体原生"的 Git 远程仓库:与传统 GitHub/GitLab 不同,它的 pull request、CI、issue 都被设计为可由 agent 自动触发——agent 推送代码后不需要人去点"create PR",仓库可以直接路由到对应的 subagent 跑回归测试、贴 diff 摘要、提改进建议。

项目处于 alpha 阶段,部分功能尚不稳定,更新见其 AI 团队博客。申请方式:提交用户名并完成一次 commit,否则会被移除。这与 8/3 报道的 Codeberg BRIE、7/28 报道的 Boris Cherny 自动化 PR 流程属同一方向——把 agent 写代码的下游(代码托管、review、合并)也变成 agent-native 的。

为什么值得关注
smol forge 切的是 agent 写代码的下游——PR 创建、CI 触发、code review 评论、合并。GitHub 当前是为"人写代码"设计的:PR UI、review checklist、merge button 都默认有人在点。Agent 写代码时,这些 UI 步骤要么用 puppeteer 模拟点击(脆弱),要么等 Codex/Claude Code 内置的 PR 工具补上(受限)。smol forge 把仓库本身改成 agent-friendly——这是基础设施层的一次洗牌。对 harness 工程师的信号是:当大量 PR 由 agent 提交(Cursor 7/30 报道的 Cloud Agent 已贡献过半 PR),托管平台必须 agent-native,否则 agent 主循环里"提 PR 等人审"会变成瓶颈。值得 alpha 申请,但 100 名用户够不够反映真实问题还得观察。
https://x.com/swyx/status/2085450774914756631
10

Replit 一天内连推 Clerk SSO 和 Semgrep 实时安全扫描:从"个人 vibe coding 平台"补全"企业编码 agent"基础设施

@Replit(X)· 8月6日

Replit 8 月 6 日 24 小时内连发两条企业级功能:与 Clerk 合作支持 SSO 登录,让企业可以为 Replit Agent 访问接上 SAML/OIDC;与 Semgrep 合作推出实时安全扫描——agent 写出有安全风险的代码时,Replit IDE 直接弹出 Semgrep 规则命中提示。

两条功能指向同一个方向:Replit Agent 已在 8/5 报道的 AI 课吉尼斯纪录中触达 1.4 万人("1.4万人共上AI课"),下一步要做的不只是涨用户数,而是让企业法务/安全团队能点头。SSO 接的是"谁能用"问题,Semgrep 接的是"能用但不许跑什么"问题。同日 Replit 还创下 1.4 万人同时上 AI 编程课的吉尼斯纪录——这是 vibe coding 蔓延到非技术人群的具象数据。

为什么值得关注
Replit 这两条功能看似常规,但叠加在一起改变了它的目标客户画像——从"个人开发者做 demo"切到"企业给 100+ 工程师配 vibe coding 平台"。SSO 是 IT 部门的硬要求,Semgrep 是安全团队的硬要求;两个都是 enterprise sales 推进的先决条件。对应在竞争位置上,Replit 直接对标 Cursor for Business 和 Devin:前者在企业 SSO 上走得更早,后者本来就有合规优势;而 7/28 报道的 Copilot app 多 Agent 会话 + Canvas + Agent Merge 也是同一条路线。增量在哪里?Replit 的特点是端到端的"部署+运行"环境(全栈 Web 应用在浏览器里跑),而 Cursor/Codex 主打编辑器或 CLI;你做的产品是 web 应用,Replit 的平台契合度可能更高;如果做的是库、CLI、底层 infra,Cursor/Codex 仍然顺位靠前。
https://x.com/Replit/status/2085488664918835669 https://x.com/Replit/status/2085108636464955700 https://x.com/Replit/status/2085501387714986373