2026-09-11 · 来源 aihot.virxact.com · 时间窗:过去 24h(09-10 08:48 起;已对照 09-09 期去重,09-10 无简报;10 条全部落在 24h 窗口内)
01

Cognition 用 Devin 智能体集群分解 RSA-260,刷新尘封六年的公开纪录,算力账单 41.4 万美元

source: Cognition 博客(已核实原文) · 9 月 9 日发布,9 月 10 日 HN 刷屏

Cognition 研究团队的 Eric Lu 驱动一批 Devin 智能体,完成了 260 位十进制数 RSA-260 的因式分解。上一个公开纪录 RSA-250 停在 2020 年 2 月。从第一条提示到拿到因子约三周:233 个 Devin 会话参与分解,人类平均并发 3 个、峰值 18 个,累计发出 3,328 条消息、82,702 个词;其中 101 个子会话由 Devin 自己启动,36 个从头到尾无人干预。

关键资产是 Devin 写出的 GPU 格子筛 glas——CADO-NFS 的 CPU 筛器 las 的直接替换品,官方称把因式分解成本压到此前的十分之一。整个项目约 4,900 GPU-days(13.5 GPU 年),按市价约 41.4 万美元,只占 Cognition 集群个位数百分比的占用;筛分阶段吃掉 3,813 GPU-days、632,249 个工作单元。线性代数面对的是 6.56 亿 × 6.56 亿、984 亿非零元的矩阵。

为什么值得关注这是迄今"人机分工"边界最清晰的超长程 agent 项目:人的角色被压缩到定优先级、定基准、判断什么时候跑偏。36 个零干预会话和 101 个自启动子会话,给多 agent 编排留了一份可对照的基线数据。另一头,glas 把分解成本砍到 1/10,安全团队评估 RSA 类密钥余量时,成本假设得按新曲线重算。
02

DeepSeek 发布 V4.1-Flash:Codeforces 3471 分,官方直接宣布自家 Pro 旗舰退役

source: DeepSeek 官方日志(已核实原文)/ The Decoder / Artificial Analysis · 9 月 10 日

DeepSeek 发布 V4.1-Flash,新结构系列里最小的一款,原生多模态。552B MoE,输入侧激活 8B、输出侧 16B(Causal Encoder-Decoder 的不对称设计),1M 上下文,MIT 许可。官方成绩单:GPQA Diamond 90.9、HLE 36.8(带工具 63.9)、Codeforces Rating 3471、Terminal-Bench 2.1 拿 90.6、DeepSWE v1.1 74.2、CyberGym 88.1。Artificial Analysis 给它 Intelligence Index 40 分,V4.1 Flash 就此超过 V4 Pro 0813 成为 DeepSeek 新旗舰。

API 侧动作更大。模型名改为 deepseek-flash,V4 Flash 与 V4 Flash Vision Exp 当日下线;官方还宣布 V4 Pro 有序退役——北京时间 9 月 14 日 12:00 起,deepseek-v4-pro 的请求全部路由到 V4.1 Flash,按 Flash 单价计费。MarkTechPost 披露的结构口径:全局 KV 缓存降到每 token 约 890 字节,约为 V4-Flash 的 1/4、V1 的 1/437。硅基流动 Day 0 上线,API 价格同步下调。

为什么值得关注一款 Flash 定位的模型把自家 Pro 旗舰直接挤退役——这个信号比跑分值钱:长上下文 agent 场景的成本曲线又被拉下一截。KV cache 压到 1/437 意味着同样显存能挂更长会话或更多并发 agent。把 Codex、Claude Code 接到 DeepSeek 的团队注意 9 月 14 日的路由切换,价格突然变便宜,账单告警阈值记得跟着改。
03

Cursor 发布 Projects:一个协调者指挥数千个子智能体,主力用户 PR 合并量 6 倍

source: Cursor 官方博客(已核实原文) · 9 月 10 日

Cursor 推出 Projects(beta)。一个 Project 就是一条持久线程,由协调者智能体接管一大块工作——功能开发、几百个 PR 的迁移、永不收尾的维护。协调者自己不写代码,只调度子智能体,官方口径是可指挥数千个子 agent 并行;任务默认跑在云端机器上,合上笔记本照干,需要本地测试时再拉起本地 agent。

三个机制撑起长程记忆:跨机器同步的共享上下文文件(某个 agent 摸清怎么测一个服务,后续所有 agent 直接复用);订阅机制(盯 Slack 频道、按计划跑、跟着 PR 修 CI);随项目增长的代码库认知。Cursor 自家数据:新用户合并 PR 多 30%,以 Projects 为主力的用户合并量是 6 倍;内部一个设计系统 Project 目标每天触达 20 到 100 个 PR。Lauren Tan 说自己用它交付了几千个 PR。

为什么值得关注这是在把"管 agent"这件事从开发者身上拿走——你只对协调者说话,协调者对几百个子 agent 说话。对照 09-08 期 Lauren Tan 的千 PR/月方法论,工具化路线已经出现:验证优先工程加协调者编排,可能就是接下来团队协作的默认形态。6 倍合并量有没有幸存者偏差,值得自己上手验证一轮再下结论。
04

OpenAI 把 Codex harness 开放成 API:Agents API 公测,上下文压缩和会话恢复都不用你写了

source: OpenAI 开发者文档(已核实原文)/ IT之家 · 9 月 10 日

OpenAI 推出 Agents API 公测,把运行 Codex 的托管 harness 开放给所有开发者。分工写得很明确:OpenAI 管会话、编排、上下文压缩和恢复——自动总结前序工作来管理上下文窗口、断点续跑、把工作拆给子 agent;你的应用只提供工具和执行环境。沙盒两种:OpenAI 托管(代码执行、文件编辑、连 MCP、产物落盘),或 self_hosted 自带 workspace 目录。IT之家报道还列出 Blaxel、Cloudflare、E2B、Vercel 等合作方环境(官方概览页未展开名单,需核查)。

多智能体一行配置打开:multi_agent.enabled=true,默认最多 4 个并发子 agent。计费拆成三块——模型按 API 牌价、内置工具按标准价、托管沙盒按容器费率。两个限制要留意:数据驻留目前仅美国,不支持零数据保留(ZDR),选自托管沙盒也不豁免。

为什么值得关注Codex harness 里最难写好的部分——上下文压缩、子 agent 委派、会话恢复——从产品能力变成了一次 API 调用。自研 agent 平台的团队得重新算账:哪些环节还值得自己做,哪些直接租。第三方沙盒名单若属实,agent 运行时的"多云"格局就开了个头。ZDR 缺席会先卡住金融、医疗类客户,选型时把这条写进评估表。
05

Shopify 移动端全面弃用 React Native,迁回 Swift 和 Kotlin——理由是 LLM 改写了成本假设

source: Shopify Engineering / Simon Willison · 9 月 10 日

Shopify 宣布全部移动应用从 React Native 迁回 Swift 和 Kotlin 原生开发。判断的出发点:当年选跨平台框架,省的是"两套代码重复开发"的钱;LLM 智能体把这个成本大幅打下来之后,跨平台方案的核心假设不成立了。Willison 转述并讨论了这则工程决策。

为什么值得关注第一个公开宣布"因为 agent 变便宜,所以放弃 RN"的大型移动团队。它把一个抽象判断落成了可引用的决策案例:评估跨平台框架时,成本公式里要加一项"LLM 生成两套原生代码的边际成本"。这条若成立,Expo、Flutter 的销售话术,客户端团队的人员结构,甚至"要不要留那么多抽象层"都会被重新审一遍。
06

SkillAdam:把 Adam 优化器搬进技能文档自进化,七个基准 SOTA,迭代次数显著更少

source: DAIR.AI (Elvis Saravia) · 9 月 10 日

新方法 SkillAdam 针对技能自进化循环的两个失效模式:更新方向不稳、每次修订幅度固定。做法是把 Adam 优化器的两个动量估计迁移到离散、不可微的技能文档上——用"优化记忆"记录已识别问题与历史尝试结果来稳定方向,用波动驱动的编辑预算控制每次改动的大小。官方口径:覆盖短程与长程任务的七个基准上达到 SOTA,迭代次数和成本显著低于此前方法。

为什么值得关注"技能文档当可优化参数"这条路又往前走了一步。对在搭 skill 评测加调优流程的团队,SkillAdam 和 SkillOpt 是同一方向的两个参照实现:前者管优化动力学(方向、步长),后者管验证门和跨 harness 迁移。两条路线共同验证过一个教训:自进化循环里若不给"每次改多少"设预算,agent 很容易把 skill 越改越差。
07

PARSER 论文:长上下文智能体把"读"和"想"拆开,子智能体冻结只训主智能体

source: DAIR.AI (Elvis Saravia) 推荐 · 9 月 10 日

论文 PARSER 给长上下文任务换了个结构:一批轻量子智能体各自绑定一个 chunk 并行读全文,主智能体通过迭代 scatter-gather 轮次广播查询、聚合证据、再生成更深的追问。训练上只有主智能体过 RL,子智能体保持冻结。

为什么值得关注长上下文不再靠"把窗口做大",而是靠并行读取加主从分工——子 agent 冻结,意味着读文件这部分不用付训练钱。做文档问答、代码库理解、审计类 agent 的团队可以直接照抄这条架构分界:贵的模型只做聚合和追问,便宜的做扫描。和 09-09 期 Spotify 的 hook 分流是同一个思想的两种实现。
08

Anthropic 指控阿里、月之暗面、DeepSeek 蒸馏 Claude:近 2 亿次交互、五个持续活动

source: TechCrunch / X Nathan Lambert · 9 月 10 日

Anthropic 发布威胁情报报告,指控多家中国 AI 公司对 Claude 持续发起蒸馏攻击:累计识别近 2 亿次相关交互,涉及五个持续活动,点名的包括阿里、月之暗面与 DeepSeek。被点名一方大概率会以"公开 API 的合规使用"回应。Nathan Lambert 同日发帖给出另一个技术视角:所谓蒸馏可能只是 SFT 数据管道的副产物,与刻意攻击难以区分。

为什么值得关注无论站哪边,2 亿次交互、五个活动这组数字,把"用竞品 API 输出训练模型"的监测概率和后果都摆到了台面上——所有做模型的人多了一条具体的合规边界样本。做数据管道的团队更该看 Lambert 那条:训练数据里混着用户拿 API 输出写的帖子,你可能也在"蒸馏"别人而不自知。
09

Redis 下场做语义缓存:LangCache 公测,LLM API 成本最多砍 90%,命中最多快 15 倍

source: MarkTechPost · 9 月 10 日

Redis 发布全托管语义缓存服务 LangCache,Redis Cloud 公测开跑,REST API 加 Python、JavaScript SDK 接入。官方口径:语义缓存最多可砍 90% 的 LLM API 成本,缓存命中最多提速 15 倍。原理是按语义相似度而非精确匹配,复用此前的模型响应。

为什么值得关注agent 应用的支出大头常是重复的相似请求,客服、代码检索、RAG 场景尤其明显。语义缓存是继提示缓存、KV cache 之后的第三条省钱路径,三者分别作用在应用层、推理层、硬件层。Redis 下场做托管服务,说明这层需求已经大到值得单独收费;自建缓存最头疼的匹配阈值和失效管理,现在有现成方案可比对。
10

Replit 推出 Routines:定时任务先跑确定性代码,需要推理才唤起 agent

source: X @Replit · 9 月 10 日

Replit 推出 Routines,给定时自动化换了个组织方式:选每小时、每天或每周的计划后,每次运行从确定性代码开始,只有需要推理时才唤起 agent。官方给出的动机很直接——agent 能自动化大多数重复任务,但 24/7 常驻运行烧掉的 token 数不清。

为什么值得关注"确定性代码打底、agent 按需介入"是定时任务场景最实在的省钱结构——多数定时任务九成的运行周期根本不需要模型。这个分层和 09-09 期 Spotify 的 hook 拦截、Mercury 2.5 主打的高频副调用降本方向一致:把模型从"每次都跑"改成"必要时才跑"。做 cron 类 agent 产品的可以直接抄。