2026-08-13 · 来源 aihot.virxact.com · 过去 48 小时(2026-08-11 00:44 UTC – 2026-08-13 00:44 UTC)
01
xAI 发布 Grok 4.6:长时运行智能体专用,Cursor 与 Grok Build 首发接入
xAIGrok 4.6新模型Coding Agent

xAI 8 月 12 日发布 Grok 4.6,定位在长时运行智能体(long-running agents)和更复杂的交互/视觉任务。模型在多项 agentic coding 与知识工作基准上达到 frontier 水平:Artificial Analysis Intelligence Index 61 分(与 GPT-5.6 Sol 持平)、GDPVal-AA v2 1753 分、CursorBench v3.2 69.9%、DeepSWE v1.1 65.9%、FrontierCode v1.1 61.3%。

定价维持 Grok 4.5 水平:$2 / 百万输入 token、$6 / 百万输出 token,快速版翻倍。首批在 Cursor 和 Grok Build 中可用,首周提供 2 倍用量额度;同时通过 API、OpenRouter、Vercel、Cloudflare 等渠道开放。xAI 披露训练时使用了 Grok 4.5 重新生成的 SFT 轨迹,并在知识工作、通用编程、内核优化、Web 开发、计算机辅助设计等领域做了大量 agentic RL。

为什么值得关注:Grok 4.6 把竞争焦点从“聊天分数”移到“长时 agent 任务”。对 coding agent 开发者,它的意义是:第一梯队模型又多了一个可用后端,而且定价与 GPT-5.6 Sol / Fable 5 相比有竞争力;Cursor 首发意味着大量开发者今天就能在 IDE 里切换模型做对比。
来源:xAI News / Artificial Analysis · 2026-08-12 查看原文 →
02
DeepSeek V4 Pro 0813 正式版上线:1.5T MoE,OpenRouter 定价 $0.435 / $0.87
DeepSeekV4 Pro新模型开放权重

DeepSeek 8 月 12 日发布 V4 Pro 0813 正式版(GA),为大规模 MoE 模型,上下文窗口 1M。OpenRouter 上的生产定价为 $0.435 / 百万输入 token、$0.87 / 百万输出 token,缓存命中 $0.003625 / 百万;P50 延迟 1.56 秒,吞吐量 60 tok/s。

OpenRouter 实测基准:Artificial Analysis Intelligence Index 45.3、Coding Index 59.4、Agentic Index 37.8;GPQA Diamond 88.8%、Humanity's Last Exam 37.5%、Terminal-Bench Hard 46.2%、SciCode 50.0%。OpenRouter 上的流量数据显示,Claude Code 是其第四大调用来源(733M token),说明该模型已被多个 coding agent 直接采用。

为什么值得关注:在 Grok 4.6 同日发布的背景下,DeepSeek V4 Pro 的定价继续压低 frontier 模型的使用成本。对自托管和 agent 团队,它提供了一个 1M 上下文、价格远低于 GPT-5.6 Sol / Fable 5 的备选后端;对 harness 工程师,可以多一个模型做路由 ablation。
来源:DeepSeek / OpenRouter · 2026-08-12 查看原文 →
03
Claude in Chrome 侧边栏升级为 Claude Cowork 会话:浏览器 agent 与桌面/移动端打通
AnthropicClaude CoworkBrowser Agent

Anthropic 8 月 12 日宣布,Claude in Chrome 扩展的侧边栏不再是独立会话,而是直接运行 Claude Cowork 会话。用户在浏览器中启动的任务可以在 Claude 桌面、Web 和移动应用之间无缝接力,技能和连接器(connectors)在浏览器内同样可用。

首批向 Max 和 Team 订阅开放,Pro 用户将在未来几周逐步推出;企业版默认关闭,管理员可限制到批准的域名。Claude in Chrome 可点击链接、输入文本、在页面间导航、填写表单,并使用用户已有的登录态访问内部仪表板或旧系统。Anthropic 在“自动批准”模式下增加了对关键动作(提交表单、发送消息、下载文件)的事前检查,与用户原始请求不匹配的动作会被拦截。

为什么值得关注:这是 browser agent 从“演示功能”走向“跨设备工作流”的一步。对开发者意味着:可以让 Claude 在浏览器里采集发票、填系统、拉数据,然后在桌面端继续写代码或生成报表;对 agent 产品团队,跨 surface 的状态同步和动作校验是新的设计必选项。
来源:Anthropic Blog · 2026-08-12 查看原文 →
04
Zed 发布 Delta:面向 AI 智能体的多人协作编码环境,私有测试已开放
ZedDeltaCoding Agent协作

Zed 8 月 12 日发布 Delta(delta.dev),一个专门用于与 AI 智能体协作编码和 review 的多人环境,同日启动私有 beta。Delta 的核心是 DeltaDB:在 git 提交之间实时复制对话与工作目录,让评论锚定在任意一行代码上,并随代码演进保持位置。

Delta 支持 cloud runner:关闭笔记本后,agent 仍可继续运行,对话和代码与线程保持同步。通过链接分享的线程可在浏览器中打开,无需安装,且是同一个 Rust 应用编译为 WebAssembly、通过 WebGL 渲染。Delta 还接入第三方 agent harness,首发支持 Claude Code,终端里的 Claude Code 会话可实时同步到 Delta 线程中。Zed 强调 Delta 中的 diff 和 transcript 保持完整,不做折叠或摘要。

为什么值得关注:Delta 把“代码审查”的单元从 commit 改成“对话+代码演进”。当 agent 在凌晨生成 400 个 tool call 的改动时,commit message 是严重失真的压缩;DeltaDB 保留每次编辑和对应对话,未来队友和 agent 都能看到“为什么代码变成这样”。这对大规模采用 agent 的团队是急需的上下文基础设施。
来源:Zed Blog · 2026-08-12 查看原文 →
05
微软首发自研推理模型 MAI-Thinking-1:35B 激活 / 1T 总参,$2 / $8 每百万 token
MicrosoftMAI-Thinking-1Reasoning新模型

微软 AI CEO Mustafa Suleyman 8 月 12 日宣布 MAI-Thinking-1,微软首个从零构建的推理模型。该模型为稀疏 MoE,35B 激活参数 / 1T 总参数,上下文窗口 256K,最大输出 64K token,已在 Microsoft Foundry 上线预览。

微软模型卡披露:MAI-Thinking-1 针对可验证推理、软件工程、工具使用和指令遵循做了 RL 后训练,强调价格-性能比;在 SWE-Bench Pro 上“与同类权重的 frontier 模型性能相当”。定价为 $2 / 百万输入 token、$8 / 百万输出 token。模型为纯文本,不原生支持图像/音频/视频;工具调用完全由集成应用负责。

为什么值得关注:MAI-Thinking-1 是微软首次不依赖 OpenAI 独立发布的 frontier 推理模型,且明确把 coding workflow 列为核心用例。对 Azure/Foundry 企业用户,这意味着可以在同一账单体系内获得自研推理模型;对模型市场,它加剧了“推理模型”赛道的竞争,可能倒逼 GPT/Claude 调整定价。
来源:Microsoft Foundry / Mustafa Suleyman · 2026-08-12 查看原文 →
06
阿里开源 Qwen3.8-2.4T-A95B:2.4T MoE / 95B 激活,原生 256K、可扩至 1M 上下文
Qwen开源模型MoECoding Agent

阿里云 8 月 12 日深夜通过魔搭 ModelScope 开放 Qwen3.8-2.4T-A95B 权重。模型总参数 2.4T,每 token 激活 95B,原生支持 262,144 token 上下文,可扩展至 1,010,000 token。每个 MoE 层含 512 个专家,每 token 选择 10 个路由专家 + 1 个共享专家,并采用多步 MTP 训练。

Qwen 团队称该版本重点提升编程、办公、科研和长周期 Agent 任务的端到端完成能力;在 PaperBench、IFBench 等 benchmark 中相对 Opus 4.8、Fable 5、GPT-5.6 Sol“互有高低”。后训练环节强调三个方向:持续扩展真实环境并解耦任务/工作空间/harness、统一奖励系统整合执行校验与视觉输出评分、在线数据均衡器稳定 RL 训练。

为什么值得关注:这是 Qwen-MAX 级别模型首次开源权重,95B 激活 + 1M 上下文让它成为当前公开权重中规模最大的 coding/agent 模型之一。对国内和海外开发者,这意味着可以用自有算力部署接近 frontier 的编程模型;对 harness 研究,它提供了可下载权重用于复现和改进 SWE-Bench 等评估。
来源:阿里云 / IT之家 · 2026-08-12 查看原文 →
07
Mojo 1.0 正式发布:Modular 承诺稳定基础,2026 年开源编译器
Mojo编程语言AI 基础设施开源

Modular 8 月 11 日宣布 Mojo 编程语言正式达到 1.0。Mojo 被定位为一个可用于生产、支持 CPU/GPU/加速器的通用系统编程语言,与 Python 语法兼容。1.0 承诺在 1.x 周期内以 additive 变更为主,减少破坏性改动。

自开源标准库以来,社区贡献者已近 200 人,合并超过 1,100 个 PR,改动超过 20 万行代码。Modular 表示 Mojo 已是其商业产品 MAX 和 Modular Cloud 的生产基础。1.0 新特性包括 Python 风格 lambda 语法、更稳定的 LSP 服务器、内存安全引用失效诊断、更一致的 where 子句。Modular 还承诺 2026 年开源 Mojo 编译器和工具链。MAX 26.5 同步支持 GLM-5.2 和 Nemotron-H 两个新模型族。

为什么值得关注:对 AI/ML 基础设施工程师,Mojo 1.0 意味着可以开始用一门语言同时写高性能 kernel 和 Python 风格的业务代码,而不用在 Python/C++/CUDA 之间反复切换。2026 年开源编译器的承诺如果兑现,会改变 AI 编译器栈的开放程度;不过生态成熟度仍需要观察。
来源:Modular Blog · 2026-08-11 查看原文 →
08
AutoGPT 维护者分享 AGENTS.md + Skill 门控:如何管理 AI 生成的 PR
AutoGPTAGENTS.mdSkillHarness Engineering

GitHub Blog 8 月 12 日刊发对 AutoGPT 创始 AI 工程师 Nicholas Tindle 的采访,介绍 AutoGPT 如何用 AGENTS.md 和 Skill 管理大量 AI 生成的 Pull Request。AutoGPT 仓库有 18 万 star、约 150 个开放 PR,其中大量由 Copilot、OpenClaw、AutoGPT 自身等 agent 生成。

核心做法:AGENTS.md 放在被治理代码旁边,skill 文件包含触发描述,agent 扫描描述后自动加载对应指南;PR 模板必须填写,否则会被关闭;模板里的“test plan”措辞会触发 test PR skill,让 agent 自动安装 agent-browser、启动应用并执行改动;Codecov 覆盖率作为 required check,agent 看到合并不了会自动补测试。Tindle 的结论是:与其关上大门,不如把门做成“只能按你的方式通过”。

为什么值得关注:这是目前公开的最具体的“agent 原生开源治理”案例。对维护者和平台工程师,它提供了一套可复制的控制层:用 AGENTS.md 解决上下文发现,用 skill 描述做动态路由,用 CI/模板/CLA 做硬门槛。如果你管理的仓库很快会涌入 AI PR,这套门控比单纯禁止更可持续。
来源:GitHub Blog · 2026-08-12 查看原文 →
09
OpenRouter 发布实时网页搜索基准:搜索预算比模型/引擎更能决定结果
OpenRouterAgentWeb SearchBenchmark

OpenRouter 8 月 12 日上线实时网页搜索基准测试页面,覆盖 BrowseComp、DeepSearchQA、WideSearch、HLE 四个任务,定期跑多个模型 × 搜索引擎 × 搜索深度的组合。测试通过公开 API 和生产端点完成,使用开源 benchmark harness。

关键发现:增加搜索深度(从 1 次到 25 次)是提升质量最廉价的单一手段,分数大致翻倍,成本仅增加 2.5–7 倍;但在失败案例上,模型会耗尽预算继续搜索,最极端记录是 WideSearch 一单用了 81 次搜索仍错误。当前 leader:BrowseComp Claude Opus 5 + Perplexity 89.0%($0.99)、DeepSearchQA Claude Opus 5 + Perplexity 76.5%($0.091)、WideSearch GPT-5.6 Sol + Perplexity 84.0%($0.063)、HLE Claude Opus 5 + Perplexity 77.4%($0.16)。

为什么值得关注:对 agent 开发者,这是第一个把“搜索配置”当成独立变量系统性测量的公开 leaderboard。它直接回答了一个工程问题:该给 agent 多少次搜索机会、选哪个引擎、配哪个模型。数据说明预算设置和失败率监控比单纯换模型更重要。
来源:OpenRouter Blog · 2026-08-12 查看原文 →
10
Google Research:LLM 事实错误主要不是“没学到”,而是“回忆不起来”
Google ResearchFactualityRAG论文

Google Research 与 Technion 合作的论文 “Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality” 提出新框架:把事实错误从“问题层面”拆解到“事实层面”,区分是知识未编码(空货架)还是编码了但无法访问(丢钥匙)。

他们构造了 WikiProfile 基准(2,150 条自然事实,每条配 10 种变体问题),在 13 个 LLM 上生成约 400 万条响应。发现 frontier 模型(GPT-5、Gemini-3)编码了 95–98% 的事实,但仍有 26–34% 的编码事实无法直接回忆;思考/推理时可恢复 40–65% 的“丢失钥匙”。长尾事实和反向问题(reversal curse)的回忆失败尤为显著。

为什么值得关注:对 RAG 和 agent 系统设计者,这篇论文改变了问题定义:模型不是“知道得太少”,而是“调用得不好”。这意味着未来提升事实准确性的重点可能从堆参数转向改进检索/提示/推理时计算;对 coding agent,也提示“让模型多想想”可能比“换更大模型”更有效地避免事实性幻觉。
来源:Google Research / arXiv:2602.14080 · 2026-08-12 查看原文 →