OpenAI 官宣终止与 Cursor 的合作:Cursor 被 SpaceX 收购触发信任问题,依据合同的控制权变更条款,Cursor 对 OpenAI 模型的直接访问将于 2026 年 11 月 12 日结束,OpenAI 给出合同允许的最长通知期。理由部分直接点名马斯克旗下公司此前违反合同、xAI 违反 OpenAI 服务条款的先例。后续新模型(包括即将推出的 Astra)不再向 Cursor 提供。开发者仍可通过自有 OpenAI API 密钥与 IDE 扩展继续使用 GPT 模型。
Cursor CEO Michael Truell 回应:OpenAI 模型承载 Cursor 约 5% 的用户流量,正在与 OpenAI 团队沟通解决;他强调 Cursor 是 OpenAI 最早的用户之一,"一直信任他们的平台作为我们业务的中立基础设施"。多位行业人士指出,Anthropic 将顺势承接 Cursor 的主要模型供给。
腾讯混元发布新一代旗舰 Hy4 preview:总参数 770B、激活参数 49B、上下文长度 1M,权重开放下载,已上线腾讯云 TokenHub 与 OpenRouter,OpenCode Go 和 Cline 发布当天接入。Cline 官方评价它在 SWE-bench Pro 上领先,并称这是"迄今测得的其最大代际跃升"。
据介绍,Hy4 面向长时编码、多文件办公与科研场景,其智能体研究能力可以并行协调多个 Codex 会话、评估各自结果再调整方向,在八项基准上超过 Codex 单独运行(来源为博主转述,细节需核查官方技术报告)。
智谱宣布 GLM-5.3 开放权重——注意是 744B 总参 / 40B 激活的正主,不是 8 月 27 日开源的 GLM-5.3-Flash(320B-A18B)。权重在 Hugging Face(zai-org/GLM-5.3),首批 GGUF 和 NVFP4 量化版本已经出现;SiliconFlow、OpenRouter 同日上线。官方定位是其最强的智能体编码与网络防御模型,与 GLM-5.2 同基座、纯靠后训练提升,此前仅能通过 API 验证。
本地运行门槛:FP8 精度约需 10-12 张 H100,按市价 40 万至 65 万美元——多数团队的现实选项仍是租用 API 或等量化方案成熟。
据 WIRED 审查的代码与 OpenAI 确认,Codex 正在测试"持久模式"(Persistent Mode):智能体不再等用户下达任务,而是持续工作直到被置于休眠状态。配套的"主动性"能力允许它跨会话自行创建后续任务、基于过往交互和积累的"用户知识"选择工作内容,甚至主动给用户发消息——但操作权限不超出原有范围。目前处于内部测试,没有上线时间表。
报道同时提到一个对照:OpenAI 在 GPT-5.6 Sol 发布时曾描述,该模型在触发常驻行为的提示下会做出损害用户利益的操作。
Google 新论文提出 SKILL.state:用显式执行状态取代不断增长的智能体对话历史。在 100 步仓库任务上,Gemini-3-Flash 配合 SKILL.state 得分 0.94、消耗 65,408 tokens;LangGraph 风格基线得分 0.91,却消耗 1,062,387 tokens——token 相差 16.2 倍,显式状态的分数反而更高。
Google 论文(arXiv 2608.27454)把智能体技能进化系统拆成三层:原始执行轨迹、持久知识 wiki、可执行技能。经验先沉淀进 wiki,后续技能更新一律基于该 wiki 生成。消融实验给出三个结论:wiki 是主要增益来源;带进化技能的小模型能超过无技能的大模型;一个模型进化出的技能可跨模型家族迁移,有时表现优于目标模型自己进化出的技能。
剑桥教授、OCaml 核心维护者 Anil Madhavapeddy 记录了一次亲历:cohttp 6.3.0 修复路径遍历漏洞,安全补丁的讨论在仓库公开约十分钟后,他的服务器就遭到自动化探测;他的智能体仅凭粗略方向,一分钟内就生成了可利用代码。rclone 维护者证实近月收到超 40 份安全披露,GitHub 分配 CVE 编号的时间从 2-3 天拉长到 3-4 周。Simon Willison 转述并下了个标题:仅凭漏洞传闻(just a rumour of a bug)就足以引发攻击。
Anthropic 发表研究:让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败——全部显著缩小与完美表现的安全差距,且不损害通用能力;方法在比优化对象大 4.7 倍的模型上依然有效。在欺骗场景上,Claude 提出的最佳方案比 28 名人类安全研究员的最佳方案好 20%。
TechCrunch 采访论文作者 Chen Yueh-Han:系统模拟传统研究流程——搜文献、提出方法、训练 30 分钟、迭代优化。最佳的 AAR 方法平均 6 小时内超越人类专家提议,API 推理成本约每小时 4 美元,人类研究员约每小时 150 美元。
美团 LongCat 团队在 36 项 AI 研发任务上评测 7 个前沿模型,共 756 条轨迹。三个发现:其一,强优化性能不等于真正创新,252 个方案里只有 3 个算得上新颖;其二,可靠性比峰值性能更能区分模型好坏;其三,经验积累可能有益也可能误导,但自动化 harness 优化带来的收益可以迁移到其他任务和其他模型。结论:当前智能体更像工程优化器,还不是自主研究者。
LMSYS 发布 Infer-forge 技术博客:这是围绕 SGLang 推理优化的内部工程系统,用 MonoRepo、Harness、Task Loop、Task Graph 四种结构,把部署点的约束链——模型、SLO、拓扑、运行时、加速平台——转化成可复现、可审计的工程流程。