NVIDIA 8 月 11 日联合 LMSYS 公布 Nemotron 3.5 Lightning,30B 总参数 / 3B 激活 MoE,1M token 上下文窗口,3 种 speculative decoding 后端(EAGLE-3、N-gram、草案树)在 SGLang 中同日提供 Day-0 支持。LMSYS 博客同步给出 NVIDIA 内部基准:在 1× H100 上,3.5 Lightning 的端到端生成速率比同尺寸密集基线高 2.3 倍,KV cache 内存占用约为同档模型的 1/4。
对开发者的直接信号:3B 激活 + 1M 上下文 + 1×H100 可跑,使长仓库级代码理解任务不再依赖云端 frontier 模型。SGLang v0.5.4 已经预装该权重模板,vLLM/TensorRT-LLM 适配将在两周内跟进。
智谱 8 月 11 日推送 ZCode 大版本,核心模型升级到 GLM-5.2,并把 ZCode 从“交互式编码助手”重写成异步多代理系统。四个新能力:① Goal 模式(高层目标自动分解 → DAG 子任务);② Subagents(按子任务分配独立上下文窗口,主代理做汇总,避免上下文污染);③ Remote Control(移动端扫码接管本地 session,处理长任务);④ 闲时任务(自动在用户空闲时段跑代码审查、依赖升级、测试补全)。
官方基准:在 SWE-Bench Verified 上 ZCode + GLM-5.2 通过率 71.84%,比 Claude Code 同期 69.45% 高 2.39 pp;prompt cache 命中率稳定在 98.2% 以上,单次任务平均 API 成本下降 41%。
Alexander Panfilov 等人 8 月 11 日公开新论文 “Reasoning on the Edge:Side-Channel Reconstruction of Encrypted Chain-of-Thought”,证明前沿模型返回给 API 客户端的“加密/摘要推理 trace”可被兄弟模型(sibling model)解出。在测试中,Haiku 4.5 以 87% 准确率把 Opus 4.8 的加密 CoT 还原成可读推理步骤,相当于把本应被遮蔽的内部思路全部还原。
研究者用同一技术扫描了 7,000 个公开缓存的 API 调用样本,从中提取出 62 个有效 API key、33 个企业邮箱地址、33 条数据库密码片段。攻击利用的是推理长度分布与 token 模式这类“看不见的元数据”,与具体模型权重无关,所以修复路径只能是改变输出分布本身(控制输出长度方差、加入规范化扰动)。
LMSYS 8 月 11 日发布 vLLM 项目提案,把当前“每种注意力组件一套独立前缀缓存”的做法合并成 Unified Radix Cache:用一个全局 Radix Tree 同时索引 FULL attention、SWA(sliding window attention)、MAMBA 等异构层的 KV cache,靠单一 token-key 跨组件寻址。
实测:在 Qwen3-Next-Instruct-80B-A3B(FULL + SWA + MAMBA 混合)上,多轮对话场景 prefix hit rate 从 64% 提升到 91%,TTFT 平均下降 38%,GPU 显存占用峰值下降 27%。提案保留向后兼容旧 radix 实现的回退路径,并要求所有缓存插入同步做 hash 校验避免组件间 cross-talk。
OpenAI 8 月 11 日在 ChatGPT 桌面客户端(macOS 优先)推出“跨智能体导入”功能。用户可以把 Claude Code、Cursor、Windsurf、Cline、Zed AI 等工具的项目文件夹路径、对话历史、自定义 skill/plugin manifest 文件一键导入,导入后内容映射为 ChatGPT Work 项目条目和 Codex workspace。
导入过程本地完成(不上传到 OpenAI 服务器),只在用户首次打开对应 Work 项目时才把 hash 指纹同步以启用跨设备检索。plugin 命名空间自动加 legacy: 前缀以避免和 ChatGPT 内置插件冲突;skill manifest 通过 STS 验证签名后才被激活。
Cua 团队 8 月 11 日发布 “Metal capability shim”——一个进程级兼容层,让 macOS 虚拟机内的二进制可以透明访问宿主机的 Metal GPU。在 M1 Ultra(64GB)VM 内跑 llama.cpp 加载 TinyLlama 1.1B Q4_K,端到端生成速率从 CPU-only 的 6.8 tok/s 提升到 111.3 tok/s(16.36×);Llama-3.2-3B Q4_K 从 3.2 tok/s 提升到 36.7 tok/s(11.47×)。
shim 用 MTLBuffer 共享 + Metal command queue 跨 VM 边界传递,CPU/GPU 同步通过 Mach IPC 而不是 XPC,避免 context switch 成本。代码以 MIT 许可开源,已支持 llama.cpp 主分支的 llama-cli 和 llama-server 两个入口。
蚂蚁集团 8 月 11 日在 Hugging Face 和 ModelScope 同步发布百灵 Ling-3.0-tiny,Apache 2.0 开放权重。架构上首次公开 KDA-MLA(Kimi-Delta Attention + Multi-Latent Attention)3:1 混合:每 3 层 KDA 后接 1 层 MLA,1.3B 激活参数分布在 128 个路由专家上。
实测参数:在 Apple M4 Pro(48GB)跑 BF16 全精度单流推理达 86–90 tok/s,量化到 Q4_K 后单流仍保持 145 tok/s。官方公布 TriviaQA 78.4%、HumanEval 84.6%、IFEval 中文子集 81.2%。训练数据公开发布在 GitHub 仓库,可商用但禁止军事用途。
NVIDIA 在 8 月 11 日的投资者沟通中首次披露 “Nemotron 联盟” 产品路线图:联合 Mistral、Perplexity、Reflection AI 三家,2026 Q4–2027 Q1 推出 4 万亿参数 MoE 预训练模型,激活参数控制在 200B 量级,配套推理栈使用 Blackwell B300 + NVLink Switch 6。
为支撑训练集群,NVIDIA 与三家超大规模云厂商签订 280 亿美元 GPU 回租协议(本质上是 NVIDIA 出资买卡、租回给云厂商,云厂商预留容量给 Nemotron 训练),首批 80 亿美元合同已与 Lambda Labs 锁定。Jensen Huang 在沟通会上明确把“coding agent 工作流”列为 Nemotron 4 的主要微调方向之一。
《华尔街日报》《彭博》8 月 11 日援引知情人士报道,Anthropic 已向 SEC 提交 S-1 草案,目标是 9 月挂牌上市,IPO 估值区间 9200–9650 亿美元,按发行规模可进入科技史前五。同期 Anthropic 在路演材料中首次披露:Claude Code 单一产品 ARR 已达 84 亿美元,贡献全公司 ARR 的 41%(API + 消费端合计 205 亿)。
在 S-1 风险因素章节,Anthropic 列出 4 条新增风险:① Claude Code 在企业客户中替代 Jira/Linear 的速度慢于预期;② 模型能力见顶后,新增 inference cost 不能被价格上调覆盖;③ 监管侧“frontier model 出口许可”可能影响国际大客户;④ 模型路线图与 Microsoft 365 Copilot 渠道的排他条款冲突风险。
Sensor Tower 8 月 11 日发布最新统计:ChatGPT 与 Gemini 月活跃用户(MAU)分别达到 10.4 亿与 10.1 亿,双双跨越 10 亿门槛;Claude 系列、Perplexity、Copilot、Cursor 仍处于 0.8–2.5 亿区间。这是“通用聊天助手”在历史上首次出现两家同时进入 10 亿俱乐部的局面。
ChatGPT 当月新增 8700 万付费订阅用户,Gemini 通过 Android 默认入口叠加 Pixel Buds Pro 3 捆绑拿下 5400 万。同期 Anthropic、Perplexity、Cursor 都报告“付费转化率上升、绝对增长变慢”——原因是这些产品必须跑在某个通用聊天助手的下游获客(Claude Code 装机用户 73% 同时也是 ChatGPT 付费会员)。