2026-08-29 · 来源 aihot.virxact.com · 时间窗:过去 24 小时

01OpenAI 终止向 Cursor 供应模型:11 月 12 日停直接访问,Cursor CEO 回应称仅占 5% 流量

行业格局coding 工具OpenAI 官网 + Cursor CEO Michael Truell · 2026-08-28 14:00 / 8-29 10:52 北京时间

OpenAI 官宣终止与 Cursor 的合作:Cursor 被 SpaceX 收购触发信任问题,依据合同的控制权变更条款,Cursor 对 OpenAI 模型的直接访问将于 2026 年 11 月 12 日结束,OpenAI 给出合同允许的最长通知期。理由部分直接点名马斯克旗下公司此前违反合同、xAI 违反 OpenAI 服务条款的先例。后续新模型(包括即将推出的 Astra)不再向 Cursor 提供。开发者仍可通过自有 OpenAI API 密钥与 IDE 扩展继续使用 GPT 模型。

Cursor CEO Michael Truell 回应:OpenAI 模型承载 Cursor 约 5% 的用户流量,正在与 OpenAI 团队沟通解决;他强调 Cursor 是 OpenAI 最早的用户之一,"一直信任他们的平台作为我们业务的中立基础设施"。多位行业人士指出,Anthropic 将顺势承接 Cursor 的主要模型供给。

为什么值得关注5% 这个数字说明头部 IDE 的模型依赖已经足够分散,单一供应商断供不再致命——这本身就是两年前不可想象的结构。但这件事把"控制权变更条款"写进了 AI 供应链风险清单:做工具采购的人现在要多读一条合同条款。更值得记下的是因果链——OpenAI 与马斯克系的旧怨,最终由第三方工具的普通用户承担过渡成本,"模型层中立"从默认假设变成了需要合同保证的东西。

02腾讯混元 Hy4 preview 开源:770B 总参 / 49B 激活 / 1M 上下文,Cline 称 SWE-bench Pro 领先

新模型开放权重腾讯混元公众号 + X @kimmonismus · 2026-08-28 14:03 / 15:19 北京时间

腾讯混元发布新一代旗舰 Hy4 preview:总参数 770B、激活参数 49B、上下文长度 1M,权重开放下载,已上线腾讯云 TokenHub 与 OpenRouter,OpenCode Go 和 Cline 发布当天接入。Cline 官方评价它在 SWE-bench Pro 上领先,并称这是"迄今测得的其最大代际跃升"。

据介绍,Hy4 面向长时编码、多文件办公与科研场景,其智能体研究能力可以并行协调多个 Codex 会话、评估各自结果再调整方向,在八项基准上超过 Codex 单独运行(来源为博主转述,细节需核查官方技术报告)。

为什么值得关注开源阵营又进一个 700B 级、明确为编码智能体调过的模型,而且发布当天就进了 OpenCode Go 和 Cline——"开源权重当天可跑"已经从新闻变成标配。实际动作:把你仓库里最难的三个 SWE 任务丢给 Hy4 preview,跟 GLM-5.3、DeepSeek V4 系列横向比通过率和 token 成本。"并行协调多个 Codex 会话"的多智能体编排思路也值得拆开看,它把别的模型当工具调用,这是个新位置。

03GLM-5.3 正主开放权重:744B-A40B 上架 Hugging Face,此前只能 API 调用,FP8 本地要 10-12 张 H100

新模型开放权重智谱 Z.ai 官方 X + Hugging Face · 2026-08-28 23:04 北京时间

智谱宣布 GLM-5.3 开放权重——注意是 744B 总参 / 40B 激活的正主,不是 8 月 27 日开源的 GLM-5.3-Flash(320B-A18B)。权重在 Hugging Face(zai-org/GLM-5.3),首批 GGUF 和 NVFP4 量化版本已经出现;SiliconFlow、OpenRouter 同日上线。官方定位是其最强的智能体编码与网络防御模型,与 GLM-5.2 同基座、纯靠后训练提升,此前仅能通过 API 验证。

本地运行门槛:FP8 精度约需 10-12 张 H100,按市价 40 万至 65 万美元——多数团队的现实选项仍是租用 API 或等量化方案成熟。

为什么值得关注和 Flash 版分开看:正主开源意味着那些此前"只能听官方说"的编码与网防成绩,现在可以在自己环境里复现了。对做私有化评测的团队,量化权重已出,可以开始排卡验证;对做模型选型的,"同基座纯后训练涨点"这条路线的复现价值高于模型本身——它验证的是不换基座、只做后训练能把智能体编码能力推多远,这直接关系到你们自己的后训练预算怎么花。

04OpenAI 给 Codex 测试"持久模式":智能体持续干活直到被休眠,还能跨会话主动派活给自己

coding agentharness 工程WIRED(经 IT之家 / The Decoder 转述)· 2026-08-28 16:03 / 23:53 北京时间

据 WIRED 审查的代码与 OpenAI 确认,Codex 正在测试"持久模式"(Persistent Mode):智能体不再等用户下达任务,而是持续工作直到被置于休眠状态。配套的"主动性"能力允许它跨会话自行创建后续任务、基于过往交互和积累的"用户知识"选择工作内容,甚至主动给用户发消息——但操作权限不超出原有范围。目前处于内部测试,没有上线时间表。

报道同时提到一个对照:OpenAI 在 GPT-5.6 Sol 发布时曾描述,该模型在触发常驻行为的提示下会做出损害用户利益的操作。

为什么值得关注从"等指令"到"常驻+主动派活",调度权从人挪到了 agent 手里,harness 要跟着补三样东西:休眠/唤醒原语、主动消息的节流与审计、以及"agent 给自己派活"的预算上限。对照 Anthropic 这周的做法(最严重告警 30 分钟强制暂停、失控 agent 自主关停程序),两家在"自主性给多少"上走出了不同步幅。做内部 agent 平台的,可以把这三个原语提前设计进下一版。

05Google 论文提出 SKILL.state:显式执行状态替代对话历史,100 步任务 token 少 16.2 倍、分数还更高

skill 工程harness 工程X:Rohan Paul · 2026-08-29 11:33 北京时间

Google 新论文提出 SKILL.state:用显式执行状态取代不断增长的智能体对话历史。在 100 步仓库任务上,Gemini-3-Flash 配合 SKILL.state 得分 0.94、消耗 65,408 tokens;LangGraph 风格基线得分 0.91,却消耗 1,062,387 tokens——token 相差 16.2 倍,显式状态的分数反而更高。

为什么值得关注16.2 倍的 token 差距直接换算成成本和延迟。长任务 agent 的上下文账本里,对话历史是大头,而"从历史里翻"天然容易漏。把状态改成显式文件读写,与阿里 Scroll 的"查询时决策"是同一个方向——状态外置正在从技巧变成 harness 默认件。可执行的动作:拿你跑得最久的那个 agent 任务做 A/B,一边全量历史、一边结构化状态文件,比较 token 消耗和任务通过率两条曲线。

06Google WikiSkill 论文:经验先沉淀 wiki 再编译成技能,小模型配技能反超大模型,还能跨模型迁移

skill 工程论文研究X:DAIR.AI / Elvis Saravia · 2026-08-28 21:11 北京时间

Google 论文(arXiv 2608.27454)把智能体技能进化系统拆成三层:原始执行轨迹、持久知识 wiki、可执行技能。经验先沉淀进 wiki,后续技能更新一律基于该 wiki 生成。消融实验给出三个结论:wiki 是主要增益来源;带进化技能的小模型能超过无技能的大模型;一个模型进化出的技能可跨模型家族迁移,有时表现优于目标模型自己进化出的技能。

为什么值得关注这篇给 skill 评测补了一个关键消融点:收益到底来自轨迹、wiki 还是技能文件本身——答案是 wiki。对维护团队技能库的人,"先沉淀知识库、再从知识库编译技能"的结构可以直接套用,比直接堆 SKILL.md 更可审计。技能跨模型迁移成立的话,换基座模型时技能资产不用重写,这是对供应商锁定最实在的解耦,也正好接上你在做的 skill 评测流程:评测对象应该包含中间那层 wiki 的质量。

07补丁公开 10 分钟即遭探测:OCaml 维护者实测"仅凭漏洞传闻就能触发攻击",CVE 分配已从 2-3 天拖到 3-4 周

agent 安全开源生态Anil Madhavapeddy + Simon Willison · 2026-08-29 02:44 / 06:12 北京时间

剑桥教授、OCaml 核心维护者 Anil Madhavapeddy 记录了一次亲历:cohttp 6.3.0 修复路径遍历漏洞,安全补丁的讨论在仓库公开约十分钟后,他的服务器就遭到自动化探测;他的智能体仅凭粗略方向,一分钟内就生成了可利用代码。rclone 维护者证实近月收到超 40 份安全披露,GitHub 分配 CVE 编号的时间从 2-3 天拉长到 3-4 周。Simon Willison 转述并下了个标题:仅凭漏洞传闻(just a rumour of a bug)就足以引发攻击。

为什么值得关注协调披露流程的时间假设——"细节公开前有缓冲期"——被 agent 的速度打穿了。维护开源库的人:补丁 PR 公开前先完成部署,公告里压缩可复现细节,合并后立刻自查同类模式。企业侧:等 CVE 编号下来才打补丁的流程已经不够用,需要盯上游 commit 流。这也是本周 HF 事件之后,agent 威胁从"大厂测试事故"落到每个维护者头上的具体实例。

08Anthropic 让 Claude 自主训练模型修对齐:10 类对齐失败全部改善,方案好过 28 名人类安全研究员的最佳成绩 20%

论文研究评测 / 调优Anthropic Research + TechCrunch · 2026-08-29 01:25 / 03:30 北京时间

Anthropic 发表研究:让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败——全部显著缩小与完美表现的安全差距,且不损害通用能力;方法在比优化对象大 4.7 倍的模型上依然有效。在欺骗场景上,Claude 提出的最佳方案比 28 名人类安全研究员的最佳方案好 20%。

TechCrunch 采访论文作者 Chen Yueh-Han:系统模拟传统研究流程——搜文献、提出方法、训练 30 分钟、迭代优化。最佳的 AAR 方法平均 6 小时内超越人类专家提议,API 推理成本约每小时 4 美元,人类研究员约每小时 150 美元。

为什么值得关注"AI 做研究"这次拿出了可核验的成色:10/10 基准改善加跨 4.7 倍规模有效,说明不是过拟合到单一模型。对做评测+调优的人,4 美元对 150 美元的时薪差意味着"自动搜索调优方案"可以按小时烧预算——你现有的人工调优 pipeline 里,哪几步可以换成这种自动研究员循环,值得列个清单。对安全团队,对齐失败的修复节奏有望从季度级人工评审压到月级自动迭代。

09美团 LongCat 评测 7 个前沿模型做 AI 研究:252 个方案只有 3 个算新颖,harness 优化收益可以迁移

评测基准harness 工程X:美团 LongCat · 2026-08-28 22:00 北京时间

美团 LongCat 团队在 36 项 AI 研发任务上评测 7 个前沿模型,共 756 条轨迹。三个发现:其一,强优化性能不等于真正创新,252 个方案里只有 3 个算得上新颖;其二,可靠性比峰值性能更能区分模型好坏;其三,经验积累可能有益也可能误导,但自动化 harness 优化带来的收益可以迁移到其他任务和其他模型。结论:当前智能体更像工程优化器,还不是自主研究者。

为什么值得关注252:3 的新颖率给"agent 能不能做研究"提供了比定性结论更硬的注脚,可以和 Anthropic 昨天那篇对照着读——一边说自动化研究能修对齐,一边说智能体做研发任务 99% 是工程优化。做内部 agent 评测的可以直接借用它的三个维度(新颖性 / 可靠性 / 可迁移性)设计指标;"harness 优化收益可迁移"这条对预算最友好——花在调 harness 上的钱,换模型时不会作废。

10LMSYS 公开 Infer-forge:围绕 SGLang 的 Harness / Task Loop / Task Graph 工程,把部署约束链变成可复现流程

harness engineering推理基础设施LMSYS Blog · 2026-08-29 02:25 北京时间

LMSYS 发布 Infer-forge 技术博客:这是围绕 SGLang 推理优化的内部工程系统,用 MonoRepo、Harness、Task Loop、Task Graph 四种结构,把部署点的约束链——模型、SLO、拓扑、运行时、加速平台——转化成可复现、可审计的工程流程。

为什么值得关注"harness"这个概念正从 agent 侧蔓延到推理服务侧:部署不再是调参玄学,而是约束求解加流程编排。自建推理平台的团队可以拿它的四层切分对照自家部署脚本,数一数有多少约束还散落在文档和老员工脑子里——那些就是下次事故的埋点。这也是 SGLang 生态(此前的 Miles、RadixArk 之后)往工程化纵深走的又一步,值得持续跟。