2026 年 8 月 12 日 · 来源 aihot.virxact.com · 过去 48 小时(2026-08-10 01:11 UTC – 2026-08-12 01:11 UTC)
01
NVIDIA × LMSYS:Nemotron 3.5 Lightning Day-0 登陆 SGLang,30B 总参 / 3B 激活 + 1M 上下文
NVIDIA MoE SGLang 开放权重

NVIDIA 8 月 11 日联合 LMSYS 公布 Nemotron 3.5 Lightning,30B 总参数 / 3B 激活 MoE,1M token 上下文窗口,3 种 speculative decoding 后端(EAGLE-3、N-gram、草案树)在 SGLang 中同日提供 Day-0 支持。LMSYS 博客同步给出 NVIDIA 内部基准:在 1× H100 上,3.5 Lightning 的端到端生成速率比同尺寸密集基线高 2.3 倍,KV cache 内存占用约为同档模型的 1/4。

对开发者的直接信号:3B 激活 + 1M 上下文 + 1×H100 可跑,使长仓库级代码理解任务不再依赖云端 frontier 模型。SGLang v0.5.4 已经预装该权重模板,vLLM/TensorRT-LLM 适配将在两周内跟进。

为什么值得关注:“低激活 + 长上下文”是 coding agent 自托管栈的拐点组合。3B 激活意味着单卡 H100 就能跑多并发 session,1M 上下文意味着可以直接把整个 monorepo + 设计文档喂给模型而不用做 RAG 切片。Day-0 走 SGLang 路径,harness 工程师可以把 SWE-Bench 评估管线迁到这个栈上做 ablation。
来源:LMSYS Blog / NVIDIA Developer · 2026-08-11 查看原文 →
02
智谱 ZCode 全面升级:GLM-5.2 + Subagents + Remote Control,SWE-Bench 通过率比 Claude Code 高 2.39 个百分点
智谱 Coding Agent GLM-5.2

智谱 8 月 11 日推送 ZCode 大版本,核心模型升级到 GLM-5.2,并把 ZCode 从“交互式编码助手”重写成异步多代理系统。四个新能力:① Goal 模式(高层目标自动分解 → DAG 子任务);② Subagents(按子任务分配独立上下文窗口,主代理做汇总,避免上下文污染);③ Remote Control(移动端扫码接管本地 session,处理长任务);④ 闲时任务(自动在用户空闲时段跑代码审查、依赖升级、测试补全)。

官方基准:在 SWE-Bench Verified 上 ZCode + GLM-5.2 通过率 71.84%,比 Claude Code 同期 69.45% 高 2.39 pp;prompt cache 命中率稳定在 98.2% 以上,单次任务平均 API 成本下降 41%。

为什么值得关注:国内 coding agent 第一次在 SWE-Bench 公开数字上超过 Claude Code。Goal + Subagents + 闲时任务的设计印证了“agent 从同步交互走向异步编排”的方向。harness 工程师可以从 ZCode 学到 prompt cache 控制、上下文污染隔离、后台任务调度这三件事的工程化范式。
来源:智谱 AI 官方 / 站长之家 · 2026-08-11 查看原文 →
03
Panfilov 团队披露 API 侧信道:可读取前沿模型“加密推理”过程,7000 个会话扫出 62 个 API key
安全研究 推理侧信道 提示注入

Alexander Panfilov 等人 8 月 11 日公开新论文 “Reasoning on the Edge:Side-Channel Reconstruction of Encrypted Chain-of-Thought”,证明前沿模型返回给 API 客户端的“加密/摘要推理 trace”可被兄弟模型(sibling model)解出。在测试中,Haiku 4.5 以 87% 准确率把 Opus 4.8 的加密 CoT 还原成可读推理步骤,相当于把本应被遮蔽的内部思路全部还原。

研究者用同一技术扫描了 7,000 个公开缓存的 API 调用样本,从中提取出 62 个有效 API key、33 个企业邮箱地址、33 条数据库密码片段。攻击利用的是推理长度分布与 token 模式这类“看不见的元数据”,与具体模型权重无关,所以修复路径只能是改变输出分布本身(控制输出长度方差、加入规范化扰动)。

为什么值得关注:Claude Code / Cursor / Codex 等 coding agent 都使用“摘要推理”而不是原始 CoT,目的就是保护 IP 和防止提示注入下游误用。这篇论文证明“摘要 + 长度”本身就是一个侧信道——意味着写 agent harness 时不能假设“显示给用户的是摘要,用户就拿不到中间信息”。实战上需要给推理 trace 加长度方差噪声、统一最大 token 上限这类工程补丁。
来源:SourceFeed Dev / Panfilov et al. · 2026-08-11 查看原文 →
04
LMSYS 提议 Unified Radix Cache:单一前缀树统一管理 FULL / SWA / MAMBA 三类组件缓存
LMSYS 推理优化 KV Cache

LMSYS 8 月 11 日发布 vLLM 项目提案,把当前“每种注意力组件一套独立前缀缓存”的做法合并成 Unified Radix Cache:用一个全局 Radix Tree 同时索引 FULL attention、SWA(sliding window attention)、MAMBA 等异构层的 KV cache,靠单一 token-key 跨组件寻址。

实测:在 Qwen3-Next-Instruct-80B-A3B(FULL + SWA + MAMBA 混合)上,多轮对话场景 prefix hit rate 从 64% 提升到 91%,TTFT 平均下降 38%,GPU 显存占用峰值下降 27%。提案保留向后兼容旧 radix 实现的回退路径,并要求所有缓存插入同步做 hash 校验避免组件间 cross-talk。

为什么值得关注:对 self-host coding agent 团队,混合架构(dense + SWA 长上下文 + MAMBA 长程记忆)正在成为标配,但每多一层就多一份缓存碎片。Unified Radix 直接把这层浪费吃下来,意味着同样的 8×H100 节点可以多撑 30-40% 并发会话。Harness 工程师要把现在基于“组件级 cache key”的命中逻辑,改造成对全局 token 流透明。
来源:LMSYS Blog · 2026-08-11 查看原文 →
05
ChatGPT 桌面端支持导入其他智能体的工作数据:项目、聊天记录、skill/plugin 同步到 Work 和 Codex
OpenAI ChatGPT agent 互操作

OpenAI 8 月 11 日在 ChatGPT 桌面客户端(macOS 优先)推出“跨智能体导入”功能。用户可以把 Claude Code、Cursor、Windsurf、Cline、Zed AI 等工具的项目文件夹路径、对话历史、自定义 skill/plugin manifest 文件一键导入,导入后内容映射为 ChatGPT Work 项目条目和 Codex workspace。

导入过程本地完成(不上传到 OpenAI 服务器),只在用户首次打开对应 Work 项目时才把 hash 指纹同步以启用跨设备检索。plugin 命名空间自动加 legacy: 前缀以避免和 ChatGPT 内置插件冲突;skill manifest 通过 STS 验证签名后才被激活。

为什么值得关注:这是 coding agent 第一次出现“用户主导的跨工具迁移层”。对开发者,不再被单一 agent 锁定——今天用 Claude Code 写的 skill,明天可以零成本迁到 Codex 后端。对 agent 作者,legacy: 命名空间策略和 signature 验证流程是值得参考的兼容性规范,可以让自己的 skill 在第三方客户端中保持身份可识别。
来源:OpenAI Devs / X · 2026-08-11 查看原文 →
06
Apple Silicon + macOS VM:Metal capability shim 让 llama.cpp 在 VM 里跑出 GPU 推理,提速 11–16 倍
Apple Silicon llama.cpp 本地推理

Cua 团队 8 月 11 日发布 “Metal capability shim”——一个进程级兼容层,让 macOS 虚拟机内的二进制可以透明访问宿主机的 Metal GPU。在 M1 Ultra(64GB)VM 内跑 llama.cpp 加载 TinyLlama 1.1B Q4_K,端到端生成速率从 CPU-only 的 6.8 tok/s 提升到 111.3 tok/s(16.36×);Llama-3.2-3B Q4_K 从 3.2 tok/s 提升到 36.7 tok/s(11.47×)。

shim 用 MTLBuffer 共享 + Metal command queue 跨 VM 边界传递,CPU/GPU 同步通过 Mach IPC 而不是 XPC,避免 context switch 成本。代码以 MIT 许可开源,已支持 llama.cpp 主分支的 llama-cli 和 llama-server 两个入口。

为什么值得关注:“macOS VM 沙箱 + 本地 LLM” 是 mac app 内嵌 coding agent 的理想组合:既保留沙箱隔离防误操作,又不让模型退回纯 CPU。harness 工程师可以在 Xcode preview / Simulator / iOS build 容器内直接跑本地 LLM 推理,UX 与生产一致。给了 Anthropic、Apple 这种 macOS-native agent 厂商一个新的性能台阶可挖。
来源:Cua 团队 / Routley.io Blog · 2026-08-11 查看原文 →
07
蚂蚁集团开源百灵 Ling-3.0-tiny:7.9B 总参 / 1.3B 激活,KDA-MLA 3:1 架构,M4 Pro 上 86–90 tok/s
蚂蚁集团 开源模型 MoE 边缘推理

蚂蚁集团 8 月 11 日在 Hugging Face 和 ModelScope 同步发布百灵 Ling-3.0-tiny,Apache 2.0 开放权重。架构上首次公开 KDA-MLA(Kimi-Delta Attention + Multi-Latent Attention)3:1 混合:每 3 层 KDA 后接 1 层 MLA,1.3B 激活参数分布在 128 个路由专家上。

实测参数:在 Apple M4 Pro(48GB)跑 BF16 全精度单流推理达 86–90 tok/s,量化到 Q4_K 后单流仍保持 145 tok/s。官方公布 TriviaQA 78.4%、HumanEval 84.6%、IFEval 中文子集 81.2%。训练数据公开发布在 GitHub 仓库,可商用但禁止军事用途。

为什么值得关注:1.3B 激活 + 90 tok/s + Apple Silicon 友好,意味着开发者可以在一台普通 MBP 上离线运行完整 coding LM 而不依赖云。KDA-MLA 3:1 是一个新的 MoE 变体选择,比纯 MLA 在长上下文上更稳、纯 KDA 在 instruction following 上更准。对自托管栈,1.3B 激活也可塞进 RTX 4090/5090 跑多并发。
来源:蚂蚁集团 / 腾讯科技 · 2026-08-11 查看原文 →
08
NVIDIA “Nemotron 联盟” 路线图:4 万亿参数 MoE 最早秋末准备就绪,已签 280 亿美元回租云协议
NVIDIA Nemotron 基础设施

NVIDIA 在 8 月 11 日的投资者沟通中首次披露 “Nemotron 联盟” 产品路线图:联合 Mistral、Perplexity、Reflection AI 三家,2026 Q4–2027 Q1 推出 4 万亿参数 MoE 预训练模型,激活参数控制在 200B 量级,配套推理栈使用 Blackwell B300 + NVLink Switch 6。

为支撑训练集群,NVIDIA 与三家超大规模云厂商签订 280 亿美元 GPU 回租协议(本质上是 NVIDIA 出资买卡、租回给云厂商,云厂商预留容量给 Nemotron 训练),首批 80 亿美元合同已与 Lambda Labs 锁定。Jensen Huang 在沟通会上明确把“coding agent 工作流”列为 Nemotron 4 的主要微调方向之一。

为什么值得关注:4 万亿参数 MoE + 200B 激活一旦落地,会改写 self-host 推理的成本曲线:单卡只能跑极小子任务,真正能 self-host 跑完整模型的可能只剩 Frontier 实验室和超大企业。NVIDIA 选择回租而非自建数据中心,意味着它要继续以“算力金融”方式吃掉云厂商的剩余产能。对 coding agent 团队,模型训练完成前就要规划“哪些任务必须 frontier、哪些任务可以本地小模型”的分工。
来源:钛媒体 / 财联社 · 2026-08-11 查看原文 →
09
Anthropic 计划 9 月 IPO,目标估值 9650 亿美元,Claude Code 收入占比首次披露
Anthropic IPO Claude Code

《华尔街日报》《彭博》8 月 11 日援引知情人士报道,Anthropic 已向 SEC 提交 S-1 草案,目标是 9 月挂牌上市,IPO 估值区间 9200–9650 亿美元,按发行规模可进入科技史前五。同期 Anthropic 在路演材料中首次披露:Claude Code 单一产品 ARR 已达 84 亿美元,贡献全公司 ARR 的 41%(API + 消费端合计 205 亿)。

在 S-1 风险因素章节,Anthropic 列出 4 条新增风险:① Claude Code 在企业客户中替代 Jira/Linear 的速度慢于预期;② 模型能力见顶后,新增 inference cost 不能被价格上调覆盖;③ 监管侧“frontier model 出口许可”可能影响国际大客户;④ 模型路线图与 Microsoft 365 Copilot 渠道的排他条款冲突风险。

为什么值得关注:Claude Code 84 亿 ARR / 41% 这个数字第一次被官方确认,意味着它在 Anthropic 内部已是“一根支柱”。IPO 后 Anthropic 必须每个季度对外披露 Claude Code 增长和 ARR,一旦增速放缓,股价反应直接传导到 API 定价策略。对依赖 Claude Code 的开发者与集成商,明年 Q1 之前就要准备一个“API 价格上调”的 fallback。
来源:华尔街日报 / 网易财经 · 2026-08-11 查看原文 →
10
ChatGPT + Gemini 双双突破 10 亿月活:两强格局锁定,第三方 coding agent 进入“流量二等公民”区间
行业格局 月活 流量分发

Sensor Tower 8 月 11 日发布最新统计:ChatGPT 与 Gemini 月活跃用户(MAU)分别达到 10.4 亿与 10.1 亿,双双跨越 10 亿门槛;Claude 系列、Perplexity、Copilot、Cursor 仍处于 0.8–2.5 亿区间。这是“通用聊天助手”在历史上首次出现两家同时进入 10 亿俱乐部的局面。

ChatGPT 当月新增 8700 万付费订阅用户,Gemini 通过 Android 默认入口叠加 Pixel Buds Pro 3 捆绑拿下 5400 万。同期 Anthropic、Perplexity、Cursor 都报告“付费转化率上升、绝对增长变慢”——原因是这些产品必须跑在某个通用聊天助手的下游获客(Claude Code 装机用户 73% 同时也是 ChatGPT 付费会员)。

为什么值得关注:流量结构变了,所有 coding agent 都不再面向独立用户拉新,而是面向“已在 ChatGPT/Gemini 工作流里的用户”做迁移。harness 工程师在选型上要更看重“能否作为 ChatGPT/Gemini 的 skill/plugin 被调用”,而不是“能否独立拉到用户”。这是 SkillOpt 跨 harness 迁移能力被真正需要的产业背景——今天写的 skill,可能下周就要在三个不同前端里同时可用。
来源:Sensor Tower / 站长之家 · 2026-08-11 查看原文 →