xAI 8 月 12 日发布 Grok 4.6,定位在长时运行智能体(long-running agents)和更复杂的交互/视觉任务。模型在多项 agentic coding 与知识工作基准上达到 frontier 水平:Artificial Analysis Intelligence Index 61 分(与 GPT-5.6 Sol 持平)、GDPVal-AA v2 1753 分、CursorBench v3.2 69.9%、DeepSWE v1.1 65.9%、FrontierCode v1.1 61.3%。
定价维持 Grok 4.5 水平:$2 / 百万输入 token、$6 / 百万输出 token,快速版翻倍。首批在 Cursor 和 Grok Build 中可用,首周提供 2 倍用量额度;同时通过 API、OpenRouter、Vercel、Cloudflare 等渠道开放。xAI 披露训练时使用了 Grok 4.5 重新生成的 SFT 轨迹,并在知识工作、通用编程、内核优化、Web 开发、计算机辅助设计等领域做了大量 agentic RL。
DeepSeek 8 月 12 日发布 V4 Pro 0813 正式版(GA),为大规模 MoE 模型,上下文窗口 1M。OpenRouter 上的生产定价为 $0.435 / 百万输入 token、$0.87 / 百万输出 token,缓存命中 $0.003625 / 百万;P50 延迟 1.56 秒,吞吐量 60 tok/s。
OpenRouter 实测基准:Artificial Analysis Intelligence Index 45.3、Coding Index 59.4、Agentic Index 37.8;GPQA Diamond 88.8%、Humanity's Last Exam 37.5%、Terminal-Bench Hard 46.2%、SciCode 50.0%。OpenRouter 上的流量数据显示,Claude Code 是其第四大调用来源(733M token),说明该模型已被多个 coding agent 直接采用。
Anthropic 8 月 12 日宣布,Claude in Chrome 扩展的侧边栏不再是独立会话,而是直接运行 Claude Cowork 会话。用户在浏览器中启动的任务可以在 Claude 桌面、Web 和移动应用之间无缝接力,技能和连接器(connectors)在浏览器内同样可用。
首批向 Max 和 Team 订阅开放,Pro 用户将在未来几周逐步推出;企业版默认关闭,管理员可限制到批准的域名。Claude in Chrome 可点击链接、输入文本、在页面间导航、填写表单,并使用用户已有的登录态访问内部仪表板或旧系统。Anthropic 在“自动批准”模式下增加了对关键动作(提交表单、发送消息、下载文件)的事前检查,与用户原始请求不匹配的动作会被拦截。
Zed 8 月 12 日发布 Delta(delta.dev),一个专门用于与 AI 智能体协作编码和 review 的多人环境,同日启动私有 beta。Delta 的核心是 DeltaDB:在 git 提交之间实时复制对话与工作目录,让评论锚定在任意一行代码上,并随代码演进保持位置。
Delta 支持 cloud runner:关闭笔记本后,agent 仍可继续运行,对话和代码与线程保持同步。通过链接分享的线程可在浏览器中打开,无需安装,且是同一个 Rust 应用编译为 WebAssembly、通过 WebGL 渲染。Delta 还接入第三方 agent harness,首发支持 Claude Code,终端里的 Claude Code 会话可实时同步到 Delta 线程中。Zed 强调 Delta 中的 diff 和 transcript 保持完整,不做折叠或摘要。
微软 AI CEO Mustafa Suleyman 8 月 12 日宣布 MAI-Thinking-1,微软首个从零构建的推理模型。该模型为稀疏 MoE,35B 激活参数 / 1T 总参数,上下文窗口 256K,最大输出 64K token,已在 Microsoft Foundry 上线预览。
微软模型卡披露:MAI-Thinking-1 针对可验证推理、软件工程、工具使用和指令遵循做了 RL 后训练,强调价格-性能比;在 SWE-Bench Pro 上“与同类权重的 frontier 模型性能相当”。定价为 $2 / 百万输入 token、$8 / 百万输出 token。模型为纯文本,不原生支持图像/音频/视频;工具调用完全由集成应用负责。
阿里云 8 月 12 日深夜通过魔搭 ModelScope 开放 Qwen3.8-2.4T-A95B 权重。模型总参数 2.4T,每 token 激活 95B,原生支持 262,144 token 上下文,可扩展至 1,010,000 token。每个 MoE 层含 512 个专家,每 token 选择 10 个路由专家 + 1 个共享专家,并采用多步 MTP 训练。
Qwen 团队称该版本重点提升编程、办公、科研和长周期 Agent 任务的端到端完成能力;在 PaperBench、IFBench 等 benchmark 中相对 Opus 4.8、Fable 5、GPT-5.6 Sol“互有高低”。后训练环节强调三个方向:持续扩展真实环境并解耦任务/工作空间/harness、统一奖励系统整合执行校验与视觉输出评分、在线数据均衡器稳定 RL 训练。
Modular 8 月 11 日宣布 Mojo 编程语言正式达到 1.0。Mojo 被定位为一个可用于生产、支持 CPU/GPU/加速器的通用系统编程语言,与 Python 语法兼容。1.0 承诺在 1.x 周期内以 additive 变更为主,减少破坏性改动。
自开源标准库以来,社区贡献者已近 200 人,合并超过 1,100 个 PR,改动超过 20 万行代码。Modular 表示 Mojo 已是其商业产品 MAX 和 Modular Cloud 的生产基础。1.0 新特性包括 Python 风格 lambda 语法、更稳定的 LSP 服务器、内存安全引用失效诊断、更一致的 where 子句。Modular 还承诺 2026 年开源 Mojo 编译器和工具链。MAX 26.5 同步支持 GLM-5.2 和 Nemotron-H 两个新模型族。
GitHub Blog 8 月 12 日刊发对 AutoGPT 创始 AI 工程师 Nicholas Tindle 的采访,介绍 AutoGPT 如何用 AGENTS.md 和 Skill 管理大量 AI 生成的 Pull Request。AutoGPT 仓库有 18 万 star、约 150 个开放 PR,其中大量由 Copilot、OpenClaw、AutoGPT 自身等 agent 生成。
核心做法:AGENTS.md 放在被治理代码旁边,skill 文件包含触发描述,agent 扫描描述后自动加载对应指南;PR 模板必须填写,否则会被关闭;模板里的“test plan”措辞会触发 test PR skill,让 agent 自动安装 agent-browser、启动应用并执行改动;Codecov 覆盖率作为 required check,agent 看到合并不了会自动补测试。Tindle 的结论是:与其关上大门,不如把门做成“只能按你的方式通过”。
OpenRouter 8 月 12 日上线实时网页搜索基准测试页面,覆盖 BrowseComp、DeepSearchQA、WideSearch、HLE 四个任务,定期跑多个模型 × 搜索引擎 × 搜索深度的组合。测试通过公开 API 和生产端点完成,使用开源 benchmark harness。
关键发现:增加搜索深度(从 1 次到 25 次)是提升质量最廉价的单一手段,分数大致翻倍,成本仅增加 2.5–7 倍;但在失败案例上,模型会耗尽预算继续搜索,最极端记录是 WideSearch 一单用了 81 次搜索仍错误。当前 leader:BrowseComp Claude Opus 5 + Perplexity 89.0%($0.99)、DeepSearchQA Claude Opus 5 + Perplexity 76.5%($0.091)、WideSearch GPT-5.6 Sol + Perplexity 84.0%($0.063)、HLE Claude Opus 5 + Perplexity 77.4%($0.16)。
Google Research 与 Technion 合作的论文 “Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality” 提出新框架:把事实错误从“问题层面”拆解到“事实层面”,区分是知识未编码(空货架)还是编码了但无法访问(丢钥匙)。
他们构造了 WikiProfile 基准(2,150 条自然事实,每条配 10 种变体问题),在 13 个 LLM 上生成约 400 万条响应。发现 frontier 模型(GPT-5、Gemini-3)编码了 95–98% 的事实,但仍有 26–34% 的编码事实无法直接回忆;思考/推理时可恢复 40–65% 的“丢失钥匙”。长尾事实和反向问题(reversal curse)的回忆失败尤为显著。