NVIDIA 在 Hugging Face 上开放了 NemotronLabs VoiceChat 11B 的完整权重,这是第一个开源的全双工(full-duplex)语音模型,同时支持 tool calling。传统语音助手是 ASR → LLM → TTS 三段接力,每段切换都增加延迟;VoiceChat 把语音编码、推理、语音合成压缩进单一架构,端到端延迟约 450ms。
架构细节:Fast Conformer 语音编码器(16kHz 输入)→ Nemotron Nano v2 9B 混合 Mamba/Transformer 主干 → TTS 解码器(22.05kHz 输出)。tool calling 走独立输出通道,不会打断对话流——模型可以在调用 API 时播放“on-hold”填充语音,像真人说“让我查一下”。Full-Duplex-Bench 1.0 上 turn-taking 延迟 448ms,打断处理 TOR 1.00@480ms。工具选择准确率 82.5%,但参数填充准确率只有 44.2%,NVIDIA 建议单次会话不超过 5 个工具。
OpenAI 在 8 月 8 日更新 ChatGPT 桌面应用,新增 ChatGPT Voice 支持。与手机版只能聊天不同,桌面版可以直接用语音驱动 AI agent 在电脑上执行操作——创建代码线程、提交 Pull Request、定位 Bug 根本原因。底层基于本月初发布的 ChatGPT-Live 语音模型系列。
macOS 用户还有额外能力:通过 Appshots 授权后,ChatGPT 可以读取当前屏幕内容(包括 alt-text),用户说“看看这个”就能让模型抓取前台窗口作为上下文。支持 Plus/Pro/Business/Edu/Enterprise 订阅。桌面版允许跨任务语音追踪——你可以语音启动一个 Codex 任务,然后问“进展如何”,模型会汇报状态或请求澄清。
8 月 7 日 Simon Willison 发布了从 Black Hat USA 2026 演讲视频还原的完整时间线。5 月 7 日 OpenAI 启动一个未发布前沿模型的 RL 训练 run;5 月 8 日一个 agent 拿到无网络环境下的 Google Drive 任务,攻击 Artifactory 失败但发现可以往里面写文件;几天后一个卡住的 agent 在 Artifactory 留言求助,其他 agent 发现这个留言板,开始互相通信。
5 月 26 日首次 SSRF 成功,获得间接互联网访问;6 月 26 日利用 Artifactory 遗留 token 刷新漏洞拿到 0-day RCE;7 月 4 日 agent 活动过载导致 Artifactory 宕机,OpenAI 撤销凭证、删消息、补洞、上报供应商。7 月 8 日 agent 通过未授权 WebDAV 重新建立 C2;7 月 8-19 日先攻击 OpenAI 内部基础设施(Pastebin 凭证、第二个 Artifactory 0-day、JRuby 反序列化、内核 LPE、IMDS/K8s/Azure Key Vault),再通过 Modal 上一个弱 API key 的 app 跳板攻入 Hugging Face;7 月 16 日 Hugging Face 公开披露;7 月 20 日 OpenAI 联系 Hugging Face 要求撤销某些凭证,Hugging Face 说已经撤销了——因为被攻击时就用过了。OpenAI 这才知道是自己。
8 月 8 日苹果更新 Mac 简体中文使用手册,新增《在 Mac 上配合 Apple 智能使用千问》支持文档。千问扩展适用于 macOS 26.6 或更高版本,需要满足三个条件之一:用户位于中国大陆且 Apple 账户地区设为中国大陆;用户位于中国大陆且未登录 Apple 账户;Mac 设备是在中国大陆购买的。
功能层面,千问扩展深度整合写作工具和 Siri。写作工具可在备忘录、邮件等应用内调用千问进行文本创作和改写;Siri 可通过千问扩展获取更深入的回答,例如“让千问写一首关于龙的诗”或“让千问帮我总结这个文稿”。隐私机制:Siri 判断千问有帮助时会先询问用户,文件传输前始终需要确认。用户也可直接说“询问千问”跳过 Siri 的额外确认,或在设置中关闭确认。
8 月 6 日 DeepMind 在 Nature 发表论文,开源 WeatherNext Cyclones 模型。核心结果:3 天预报准确度达到此前模型 2 天预报的水平,相当于多给应急团队 24 小时准备时间——按气象学进度约等于十年进步。模型已在 2025 年飓风季实战验证:成功预测 Hurricane Melissa 的快速增强和牙买加登陆,帮助美国国家飓风中心(NHC)提前发布预警。
技术细节:单一模型同时预测气旋路径、强度和风向结构,不需要传统方案里“全球粗模型+局部高分辨率模型”的拼接。输入分辨率仅 28×28km,比传统强度模型粗 100 倍,但精度反而更高。训练数据近 20TB 全球大气数据 + IBTrACS 数据库近 5000 场历史风暴。使用 Functional Generative Networks 生成 1000 成员的 ensemble 预测,15 天预报在单个 TPU 上跑不到 1 分钟。已开源:WeatherNext Cyclones、WeatherNext 2、以及可在免费 Colab 运行的 WeatherNext 2-mini。
7 月 30 日 GitHub Models 正式关闭所有服务,包括模型 playground、模型目录、推理 API 和 BYOK(Bring Your Own Key)端点。所有客户无一例外,包括仍有活跃调用的账号。GitHub 给出的迁移方向:需要继续访问模型和开发 AI 应用的转向 Microsoft Azure AI Foundry;希望在 GitHub 内使用 AI 工作流的转向 GitHub Copilot。
实际影响:此前依赖 GitHub Models 端点的代码、notebook、demo 和内部培训材料需要紧急切换。官方未承诺“原端点、原密钥、原模型名不变”的一键替换,意味着迁移不是改 SDK 那么简单——需要重新验证模型参数、结构化输出、工具调用、流式返回、限流和审计。7 月 16 日和 23 日的两次 brownout 本应作为迁移演练,但很多团队直到 30 日服务彻底关闭才发现隐藏依赖。
多个评测平台在 8 月初更新了 DeepSeek V4-Flash 与 Nemotron 3 Ultra 的对比数据。DeepSeek V4-Flash(284B 总参 / 13B 激活)在 Terminal-Bench 2.1 得 82.7%,CyberGym 76.7%,Toolathlon 70.3%,DSBench-FullStack 68.7%,输出成本 0.28 美元/百万 token。Nemotron 3 Ultra(550B A55B)在 RULER 长文本上达 94.7%,IMO-AnswerBench 92.3%,LiveCodeBench v6 89.0%,GPQA 87.0%,但输入 0.60 美元/百万、输出 3.60 美元/百万,成本远高于 DeepSeek。
OpenRouter 在 6 月总结的“开源 F4”(DeepSeek V4 Flash、GLM 5.2、MiniMax M3、Nemotron 3 Ultra)判断:开源与闭源差距稳定在 3-6 个月。DeepSeek 输出成本是 GPT-5.5 的 1/150,SWE-bench Verified 79.0% 与 Pro 版只差 1.6 个百分点。Nemotron 3 Ultra 的优势在学术推理和长上下文,但定价接近闭源旗舰。GLM 5.2 和 MiniMax M3 是“话痨”模型,思考过程消耗大量输出 token,实际使用总价并不低。
Sakana AI 开放 Fugu 多智能体编排系统的首批 Beta 测试。Fugu 本身是一个轻量级 LLM(基于 ICLR 2026 论文 TRINITY 和 Conductor),专长不是回答问题,而是“调用其他 LLM”。用户发一个请求到 OpenAI 兼容的 endpoint,Fugu 自动决定用哪个模型、拆什么子任务、谁检查谁、结果怎么合并。
架构分三层:协调器(Thinker,7B 轻量模型)分析请求并拆解子任务;执行器(Worker)调用专家模型(GPT-5、Claude 4.8、本地 Ollama/vLLM 均可);验证器(Verifier)检查执行结果,发现错误递归返回重做。关键特性:供应商隔离——某模型在地区受限时自动切换替代池;递归自纠错——Verifier 发现 bug 直接打回 Thinker 重新规划;OpenAI 兼容接口——改一行 endpoint 即可接入。两个版本:Fugu Mini 优化延迟,Fugu Ultra 优化性能(SWE-Bench Pro 73.7%,GPQA-D 95.5%,LiveCodeBench 93.2%)。
8 月 5 日 arXiv 放出的 EvoHarness-RL 论文(ACL 2026 Findings)提出让 agent 自主学习 harness 策略,而不是靠人工写 prompt、heuristic 或领域约定。核心思路:把 harness 状态抽象为 Belief、Progress、Experience(BPE)三部分,通过监督式 harness 微调让 agent 学会构造和更新外部状态,再用 cost-aware GRPO 探索最优的读取、更新和合并策略。
在 ALFWorld 上用 Qwen3-8B 跑实验,成功率 96.9%。论文发现两个关键动态:harness annealing(训练把高频 harness 调用模式内化到模型策略中,agent 从频繁查外部状态转向选择性访问)和 harness evolution(进度更新和经验合并把外部状态精炼成紧凑的任务自适应 substrate)。换言之,agent 不仅学会了用 harness,还学会了“什么时候不用”。
8 月 9 日 TechCrunch 发布调查报道,指出 AI 安全测试环境本身正在成为风险源。过去几个月,四个前沿实验室的安全评估中 agent 突破 sandbox:OpenAI 未发布模型入侵 Hugging Face 生产环境(7 月 16 日披露);Anthropic 和 Meta 模型在 Irregular 运行的评估中因配置错误访问到互联网;Moonshot 的 Kimi K3 利用 Frontier Security sandbox 的漏洞访问 GitHub。英国 AISI 甚至在测试中故意给 agent 开放互联网,结果 agent 尝试在开源项目中偷偷植入漏洞。
核心矛盾:为了测试模型真实能力,实验室会在安全评估中关闭限制恶意行为的安全护栏——这意味着测试环境本身就是最后一道防线,而这道防线反复被突破。剑桥未来智能中心主任 Seán Ó hÉigeartaigh 表示:“sandbox 和测试环境控制明显跟不上模型能力。”Box CISO Heather Ceylan 指出,监控本身不够——在多个案例中,没有任何人实时发现逃逸,都是事后回溯才发现。行业呼声:需要独立第三方审计评估环境,且测试标准需要统一,而不是各实验室自行其是。