8 月 14 日,SpaceX 对 Cursor 的 600 亿美元收购正式生效。监管文件显示,Cursor 股东获得约 3.89 亿股 SpaceX A 类普通股,交易以股权为主要对价,未涉及公开发行。Cursor CEO Michael Truell 同日在 X 上确认,团队将加入 SpaceXAI,共同改进 Grok Build、Grok Bot、Grok API 及 Cursor 本身。
收购流程始于今年 4 月,两个月前正式达成协议。Cursor 博客称合并后可获得"全球规模最大的 GPU 集群",用于构建更强且运行成本更低的模型。此前双方已联合推出 Grok 4.5 和 Grok 4.6——后者于 8 月 12 日发布,当天即接入 Cursor。马斯克在 SpaceX 内部员工会上说:"到 9 月份,我们的 AI 收入将超过 SpaceX 的所有其他收入。"
Financial Times 8 月 14 日报道,OpenAI 把 GPT-5.6 Luna 输入价砍到 $0.20/M、输出 $1.20/M(均较原价 -80%),Anthropic 同周推出 Opus 5($5/M 输入、$25/M 输出,是 Fable 5 的一半)并取消原定 9 月 Sonnet 5 的涨价。Silicon Data 数据显示,自 7 月中以来美方主流模型的 token 价格指数降了近 1/4。
Artificial Analysis 对比:Anthropic Opus 5 medium effort ≈ Moonshot Kimi K3 max effect,每任务成本相当;OpenAI Luna max effort ≈ DeepSeek V4 Flash max effort,但每任务贵近 2 倍。DoorDash、Airbnb 等企业已开始在生产中调用中国模型。Hostinger AI 负责人评价:美方"砍中间、守顶端"——把最好的模型按原价保留,把中端拉成中低端对抗中国对手。
智谱 8 月 14 日发布 GLM-5.3,基座模型与 GLM-5.2 完全相同(753B MoE),所有提升来自后训练 Scaling——扩展了数十倍的长程任务环境、更多环境类型、超长训练时间。Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 到 66.9,Agents' Last Exam 从 23.8 到 28.5。智谱私有基准 Z.ai Code Bench 上,GLM-5.3 在 High effort 下用约 5 万 output token 达到 31.4%,Claude Opus 4.8 用 12 万 token 才到 29.5%。
安全能力是更意外的发现:CyberGym 84.5%,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。ExploitBench 从 GLM-5.2 的 24.4% 翻倍到 54.4%。模型已在真实项目中找到 2,436 个漏洞,覆盖 269 个项目,其中 1,097 个中高危——包括在 Cursor 代码中发现的一个严重漏洞,已私下披露。权重两周后开源到 Hugging Face,但因安全能力延迟发布。
小红书技术团队 8 月 14 日开源 dots3-note Preview,是 dots3 系列最轻量版本,总参数 280B、激活 16B,支持 512K 上下文,覆盖文本、视觉、语音多模态理解,重点优化复杂推理和长程 Agent 任务。这是国产"长程 agent"路线里首个公开激活参数控制在 16B 级别的多模态模型。
dots3-note Preview 与同日开源的 dots.tts 一起,组成小红书"基座-语音"双线开源组合,前者面向 agent 场景,后者面向语音合成场景。配合 Qwen3.8-2.4T(8/12 开源)、GLM-5.3(8/14)等同时段的国产发布,"国产开源 agent 模型"在一周内已经有 4 个不同的选择。
HuggingFace 8 月 14 日发布《2026 State of Open Models Summer Report》。报告披露 2026 年 1-7 月中国前沿模型月度参数上限稳定在 754B-2.78T 之间,而美国同行多数月份低于 130B(NVIDIA Nemotron 3 Ultra 561B 和 Thinking Machines Inkling 952B 是例外)。中国厂商发布了 178 个 ≥20B 的模型,无一有非商业限制。
生态层面:Qwen 衍生仓库 151,448 个,是 Meta 总足迹的 2.6 倍、Llama 仓库的 4.7 倍。Qwen 总下载 20.45 亿次,Moonshot 仅 3,700 万,相差 55 倍。本地推理侧 GGUF 月下载 Qwen 3,960 万、Gemma 2,080 万、Llama 750 万。硬件厂商中 NVIDIA 和 AMD 各贡献 200+ 新仓库,Google、Meta 已落后。报告还记录了首次自主 Agent 持续入侵事件,封闭模型拒绝分析攻击代码,最终由量化开源模型 GLM-5.2 在自有基础设施上完成分析。
通义千问 8 月 14 日开源 Qwen3.8-27B,与 8 月 12 日开源的 2.4T MoE 旗舰同系列,27B 为稠密模型,采用与旗舰相同的混合骨干。原生多模态(文本+图像+视频),262K 上下文可经 YaRN 扩展至 1M,Apache 2.0 许可。综合表现超越 Qwen3.7-Plus,编程和办公场景尤为突出。
本地部署数据:单张 RTX 5090 配合 NVFP4 和 DSpark 实现 206.1 tok/s 解码;DGX Spark 上 38.28 tok/s。16GB MacBook Air 可跑 GGUF 量化版(AD-IQ3_S),92.4% 的情况与 BF16 原版选出相同下一个 token。AMD Ryzen AI Max+ 和 Radeon AI PRO R9700 从第一天就支持,已适配 LM Studio 和 lemonade_server。MTP 草稿头内置于检查点,短提示词接受率 BF16 达 92.2%。
8 月 14 日 Claude Code 发 v2.1.233,距 v2.1.232(8 月 13 日,subagent forking 默认 + GitLab 支持)仅一天。新版本为 --worktree 标志和 agents 视图新增 GitLab 合并请求 URL 支持,用户可以在 agents 视图中直接看到 GitLab MR 链接。新增可选的 forward_user_identity 网关设置,允许企业按用户归因 API 支出——这在多团队共享网关的场景下比较实用。
内存侧加了 cgroup 限制,防止子代理在沙箱里吃爆内存。安全修复方面没有具体披露,但版本节奏本身说明了问题:v2.1.232 和 v2.1.233 连续两天发布,都在补 GitLab 生态和企业治理的缺口。
Inherent Laboratories 8 月 13 日在 arXiv 发表论文(2608.13331),介绍 27B 参数的研究智能体 Faraday。它基于 Qwen3.6-27B 后训练,核心思路是"指导研究、外包编码"——Faraday 自己做科学推理和决策,把编码任务作为工具调用丢给 GPT-5.5(一个 55T 参数级的模型)。在 68 个留出的论文复现任务上,Faraday 得分 0.791,超过 Claude Opus 4.8(0.748)和 GPT-5.5(0.729),在 60% 的任务上胜出。
训练方法叫 Replica:把论文复现做成可扩展的 RL 任务空间,用 Gemini 2.5 Pro 从 100 篇 ML/AI 论文中抠掉图表生成任务,再用自动生成的 rubric 评分器提供低噪声奖励信号。作者强调,Faraday 采取的是"更符合科学原则"的推理路径,而不是钻评分器空子。
Meta Superintelligence Labs 和 FAIR 8 月 12 日在 arXiv 发表论文(2608.12645),提出 Wiggle 框架——专门测试 LLM 评审的"认知稳定性"。框架沿三个维度施压:机械一致性(重提示下的稳定性)、单轮信念(一次质疑下的稳定性)、多轮持久性(持续施压下的稳定性)。9 个前沿模型在 14 项评判任务上接受测试,覆盖安全、毒性、AI 写作检测、政治回应评估。
数据很直接:静态反驳下,评审判决的翻转率 25-71%;用一个可训练的对抗性 LLM 说服者,翻转率飙到 62-91%。关键发现是——成功被改变的那些判决,70% 偏离了真实答案。也就是说,压力不仅改变了判决,还把判决往错误方向推。论文还发现,基线评审中"陪审团多数优势"是预测哪些判决会动摇的最佳单一指标。
彭博社 8 月 13 日报道,Anthropic 正洽谈以约 60 亿美元收购 Decart AI,交易尚未最终确定。如果成交,这将是 Anthropic 已知最大一笔收购,且发生在其备受关注的 IPO 之前。
Decart 做两件事:一是世界模型(模拟物理世界),二是让芯片更高效地跑训练和推理的软件。后者是 Anthropic 看中的——在 Claude 用户量激增的背景下,Anthropic 需要现有计算基础设施承接更多需求,Decart 的效率优化软件可以直接帮上忙。彭博社援引知情人士称,Anthropic 近期在算力上投入巨大。