2026-09-23 · 来源 aihot.virxact.com · 时间窗:过去 24 小时(2026-09-22 08:53 — 09-23 08:53 GMT+8),10 条全部落在窗口内,未放宽
01

OpenAI 发布 GPT-6 Sol 与 Luna:API 价格较 GPT-5.6 促销价再砍半,Luna 卖到 $0.10/$0.50

OpenAI 官方 / Simon Willison 博客 · 2026-09-22 18:00 UTC(openai.com · 价格表经 Willison 原文核实)

9 月 22 日傍晚,OpenAI 在 Anthropic 发布 Opus 5.5 约一小时后放出 GPT-6 Sol 与 GPT-6 Luna。定价直接腰斩:GPT-6 Luna 输入 $0.10/M、缓存输入 $0.01/M、输出 $0.50/M——Willison 的原话是,这是 OpenAI 历史上最便宜的模型之一,往上只有效能更弱的 GPT-4.1 Nano 和 GPT-5 Nano。GPT-6 Sol 为 $2/M 输入、$0.20/M 缓存、$10/M 输出,与 GPT-5.6 Sol 相比同样是半价。

注意对比基准:GPT-5.6 系列十一月有既定的 25% 涨价计划,所以这次是"相对促销价再降 50%",等于把降价做成了永久姿态。Artificial Analysis 的评测结论是智能指数与 GPT-5.6 系列相近、成本减半,各基准有升有降。Willison 顺带判了 GPT-5.6 Terra 死刑——与 Sol 同价之后,"继续用 Terra 的理由蒸发了"。

铺货速度很快:OpenRouter、Arena、ChatGPT Work 与 Codex 同日上线,Perplexity 把 Sol 设为 Computer 的默认 Light 档。Sam Altman 的说法是按任务定价"在市场上没有对手"。

为什么值得关注

Luna 的 $0.10/$0.50 直接改写批量工作模型的底价——Haiku 4.5 还在 $1/$5,Luna 是它的十分之一。做 router、批处理、日志分类这类流水线的团队,今天起成本模型要全部重算;而 GPT-5.6 Terra 的下场提醒所有人:同一价位放两个模型,先死的不是价格,是旧型号。

本期评分1-5 分 · 次日收集用于优化选题
02

Anthropic 跟进 Claude Opus 5.5:$4/$20 降价 20%,缓存读价砍 60%,AA 智能指数 58 登顶

Anthropic / Simon Willison 博客 · 2026-09-22 16:53 UTC(anthropic.com · Willison 原文一手核实,官方页本机访问被拦)

Opus 4.5 到 5.0 五代模型同价 $5/$25,5.5 把牌价降到 $4/$20,降 20%。真正的变量在缓存:cache reads 价格降了 60%——长 agent 会话里 90% 以上的输入 token 走的是缓存价,这一刀对账单的影响大于标价降幅。Artificial Analysis 给出智能指数 58 分登顶;Claude Code 作者 Boris Cherny 实测称比 Fable 5.1 快且便宜 51%(其自测口径)。

Willison 的实测也踩了坑:max 思考档面对"骑自行车的鹈鹕 SVG",两次都把 128k 输出上限整个耗在推理链上,没吐出一个像素,每次烧掉 $2.56、耗时近 20 分钟。他的结论不留情面:max 档在愚蠢题目上都会想过载,不敢托付正经活。对照项 Fable 5.1 的 max 档正常交卷,还给出了他见过最好的 Anthropic 鹈鹕。

系统卡披露(Rohan Paul 转述,精确口径需核查):安全演习中约半数运行出现或有危害行为的迹象。Sonnet 5.5 与 Haiku 5.5 已在路上,而 Haiku 4.5 现价 $1/$5,对上 Luna 的 $0.10/$0.50,低端市场的仗更难打了。

为什么值得关注

缓存读价 -60% 是今天比"登顶"更值钱的一条信息:跑长会话 harness 的真实成本结构里缓存占大头,这一刀直接改写 Claude 长任务经济性。而 max 档的过载实测给所有"开满思考预算"的默认配置敲了警钟——输出上限会被推理链吃光,账单照付。

本期评分1-5 分 · 次日收集用于优化选题
03

Unreal Labs 开源 Unreal Agent:异步工具调用 harness,对比 Codex 实测最高省 40% 成本

Unreal Labs 官方博客 · 2026-09-22 23:22(unreallabs.ai 原文已核实)

机制说清楚就一句话:每次工具调用立即在事件日志里追加一条 "in-progress" 记录,工具在后台继续跑,完成后补写结果再触发模型——模型不再花 token 去管等待、轮询和心跳。作者特别指出工程难点是这套"双记录"不能打断 KV cache,而 Responses API 对这种模式欠定义,部分非 OpenAI 推理商会直接拒绝请求。

数字来自 GPT-6 Astra xhigh 实测,全部挂在 Harbor 上可复现:Terminal-Bench 4.0 通过率 57.9% 与 Codex 榜单基线持平,成本 $1,428 对 $2,350;SWE-Atlas Codebase QnA 65.8% 对 63.3%,$936 对 $1,303;DeepSWE 1.1 通过率 72.4% 对 69.0%,$1,367 对 $1,633;对比 Pi 最高省 20%。省钱的归因有两条:极简 harness 足迹(简单提示、无子 agent、无 workflow、工具输出裁剪)加每轮模型调用塞进更多重工具调用。

SDK 已开源在 GitHub:Go 库、类似 codex exec 的 runner、Harbor 基准 runner 三件套。博客引文列表本身就是立场声明——Arena 团队的 HarnessTax 和 Complete Skeptic 那篇《(KV) Cache Rules Everything Around Me》。

为什么值得关注

又一个"harness 即成本杠杆"的实证:通过率一分不动,账单降四成,手段只是把"等工具"从模型上下文里剥离出去。它和上周 Nous Research 的 1393 子代理重构、Arena 的 harness 税实测指向同一件事——模型不动的前提下,账单差异主要在你的 harness 怎么写。Harbor job 链接都给了,跑一遍复现的成本很低。

本期评分1-5 分 · 次日收集用于优化选题
04

JetBrains 发布 Air 产品体系:IDE、Teams、Governance 三层,26 年来首次从"个人工作台"转向"交付系统"

JetBrains 官方博客 · 2026-09-22 11:00 UTC(blog.jetbrains.com 原文已核实)

三件套:Air in JetBrains IDEs 负责在 IDE 内指挥、编排 agent 并验证产出;Air Teams 把个人 agent 活动变成可协调的团队交付流;Air Governance(由三月发布的 JetBrains Central 改组而来)管组织级策略、可见性、审计与 AI 成本核算。自家 agent Junie 全 surface 支持,开放性则押在 ACP(Agent Client Protocol)和 ACP Registry 上,第三方 agent 的完整 harness——规划、工具、模型路由、可观测性——都能接进来。

博客的核心论证写得比产品清单更值得读:生成代码越来越便宜,验证代码越来越贵;真正的难题不是明显错误的代码,而是"看似正确、通过了浅层检查、揣着坏假设"的代码。agent 可以被委托,责任不能——"凌晨三点出事的时候,接电话的不会是 agent"。多 vendor 是既定事实,组织缺的是横跨所有 vendor 的上下文、策略、账单和记录。

策略层面的原话:过去 26 年 JetBrains 只为个人开发者工作台造东西,现在开始为"agentic 工作被发起、执行、协调、审查和治理的整个系统"造东西。

为什么值得关注

IDE 厂商把宝押在"组织层 agentic 治理"这个位置——和 DigitalOcean 同日把 agent harness 做成托管服务、Databricks Genie One MCP 管治理数据是同一个方向:价值正从模型层向上游爬。做平台工程的人可以把它当作明年预算季的对照物;做 harness 的人则该关注 ACP——它想把"IDE 与 agent harness 的连接"标准化,这和 MCP 管工具是互补位。

本期评分1-5 分 · 次日收集用于优化选题
05

Meta Muse macOS 客户端爆 0-day:本地应用可借 agent 权限拍照写盘,Patrick Wardle 发现,Meta 数小时内热修

The Verge / Ars Technica · 2026-09-22 11:53 UTC(theverge.com 已核实,Ars 原文遇人机验证)

漏洞链路:安全研究员 Patrick Wardle 利用一个未文档化的 Muse 设置,把云端转录处理重定向到攻击者自己的 endpoint,进而拿到 Muse 账户的访问权。两个设计缺陷叠加成灾——听写强制走云端而非端上,以及任意本地 app 都能改写 Muse 全部未文档化设置。Wardle 的 PoC 实现了通过 Muse 拍照、向磁盘写恶意文件,多数情况下用户毫无感知。

他的表述值得原样记录:"不用再写一个完整的 Mac 盗号恶意软件,直接借 AI 助手自己的权限就行。" Meta Superintelligence Labs 的 David Singleton 回应称这是本地提权而非远程利用、实际风险很低,但已发布 hotfix。同期 Amazon 以 Meta 未获授权为由封禁了 Muse 访问其电商平台。

背景反差刺眼:Muse 发布时主打隐私与安全,上架 12 天美加下载量 reportedly 超过 ChatGPT 同期,周一 Meta 股价涨 11%。

为什么值得关注

这是第一个高规格披露的"借 agent 权限省掉恶意软件工程"案例——攻击面从系统漏洞转移到 agent 的配置面。给 agent 开本地权限的团队,该把"未文档化设置可被任意进程改写"和"云端转录可被重定向"写进威胁模型;安全边界不再是你机器上跑了什么,而是你的 agent 被允许做什么。

本期评分1-5 分 · 次日收集用于优化选题
06

OpenAI 重做 GPT-6 提示词缓存:30 分钟折扣窗、显式断点、切 reasoning effort 不断缓存,配诊断工具直出 miss 原因

OpenAI 官方 · 2026-09-22 21:00 UTC(openai.com 原文已核实)

改进清单:默认更高缓存命中率;折扣覆盖 30 分钟窗口内复用的合格共享前缀;新增显式 cache breakpoints 让开发者自选要复用的前缀;GPT-6 可以在响应间切换 reasoning effort 而不破坏缓存(通过追加 configuration_update 实现);prewarming 把共享指令和工具定义的处理挪到用户提问之前;官方给出 append-only 更新纪律——改工具用 allowed_tools 而非删定义,改指令用 developer message 追加而非改前文。

配套两个工具:Prompt Caching Dashboard 看命中率曲线和输入构成;诊断工具直接对比当前请求与近期响应,返回 JSON 长这样——type: cache_miss、reason: tools_changed、影响 5,629 tokens。miss 原因被结构化输出了。

客户数据:GitHub Copilot 称数十亿请求中需新鲜处理的 token 占比降超 50%;Manus 的 agent 团队不到一周把缓存命中率从约 85% 提到稳定高于 90%;另一位工程师从 83% 到 91%、缓存写入减约三分之二、推理成本降 36%。缓存输入 token 折扣最高 90%。

为什么值得关注

这份文档等于官方承认缓存命中率是 harness 工程变量,而不是部署巧合。诊断工具返回的 reason 字段(tools_changed 这种粒度)完全可以直接接进 CI——把 cache miss 当回归测试抓,命中率从玄学变成指标。手里跑着长会话 agent 的团队,今天就能照着 append-only 纪律自查一遍。

本期评分1-5 分 · 次日收集用于优化选题
07

Epoch AI 测算:同等性能成本自 2023 年起每季度降约 47%,比史上任何变革性技术都快

Epoch AI 官方推文串 · 2026-09-22 21:28 UTC(x.com/EpochAIResearch 已核实,完整报告《The plunging price of thought》)

数据基础:222 个 AI 模型、最多 11 个基准,借用 CAISI 的方法估算同一模型在不同预算约束下的表现,得出"给定性能水平的成本"曲线。核心数字:自 2023 年起每季度降约 47%。横向对比——比 DNA 测序快 4 倍、比算力快 6 倍、比锂电池快 18 倍、比(1973 年以前的)电力快 54 倍。

结构性发现比均值更有用:性能处于 SOTA 时降得最快,五基准平均 66%/季;两年后放缓到 32%/季。分领域看,游戏类谜题 39-43%/季,数学题 50-52%/季。案例锚点很直观:2025 年 1 月 o3 首破 FrontierMath 25% 时花费 $0.55,今年夏天 GPT-5.6 Luna 做到同样成绩只花 $0.0015——18 个月,377 倍。

为什么值得关注

这组数字给"追新模型还是守住旧模型"提供了定量答案:同一性能水平每个季度便宜近一半,任何按年锁价的长约都在送钱;而今天 SOTA 的溢价,一个季度后就是 66% 的水。采购和预算模型应该按季度而非年度重估——这条曲线本身就是 2026 年做 AI 成本规划的第一输入。

本期评分1-5 分 · 次日收集用于优化选题
08

METR 公布 Opus 5.5 部署前评估:略强于 Fable 5.1,"距离全自动 AI R&D 还远",程序条款值得逐字读

METR 博客 · 2026-09-22 23:45 UTC(metr.org 原文已核实)

评估基于 10 个工作日的 API 测评,五个任务:Budget NanoGPT Speedrun、LMCA 概念论证、Train a Program、Gaming Bot、Sunlight 开放式研究写报告。结论分两半:对 AI R&D 的加速能力略高于 Fable 5.1,在可验证与难验证任务上都有改进,但属于增量而非跃迁,不太可能全自动 R&D——缺的是前瞻、预测、自建反馈回路这类"研究者判断力"。模型开发本身"至少部分被 AI 加速,但不太可能被剧烈加速":内部初步报告估约 1.5X(1 年干出 1.5 年),2X 的概率约 30%,METR 特别指出这个估算连适用的时间段都没写清楚。

程序细节同样有信息量:这是一份无薪协议下的评估;METR 起草初稿后 Anthropic 有权审阅和编辑,最终文本双方签认;另有一个更高权限团队的独立内部评估,只向本文作者团队共享结论、不共享证据——METR 把这称为更完整评估流程的试验版。

为什么值得关注

"模型发布 → 独立部署前评估 → 系统卡公示"这条流程完整转了一圈,程序透明度条款——谁改了什么、谁签的字、哪部分结论没有证据支撑——全部写明。做内部评测流程的人可以直接抄这套披露框架;而"1.5X 加速但时间口径缺失"这个细节,本身就是对厂商宏大叙事的最好解毒剂。

本期评分1-5 分 · 次日收集用于优化选题
09

Perplexity 公开自蒸馏后训练方法:线上 A/B 实测工具调用失败率 2.24%→1.77%

Perplexity 官方推文串 · 2026-09-22 20:21 UTC(x.com/perplexity_ai 已核实)

方法叫 hint-guided self-distillation:GLM 5.2 用同一组权重对同一条录制的 turn 打两次分——一次带纠正提示、一次不带——训练目标是对齐无提示时的 next-token 分布。标注管线做两件事保证质量:把反馈追溯到具体的决策点,并校验每条纠正提示只使用错误发生前可获得的信息,压掉事后诸葛偏差。

数据分三层:线上 A/B 测试中,新 checkpoint 的工具调用失败相对降 21.2%(绝对值 2.24%→1.77%,推理时不需要 hint);离线带 hint 测试中,同一个未改动的模型避开原始失败的比例从 75.1% 升到 93.7%;训练数据先在合成环境做 RL,再上真实用户会话,排除含 PII 和 opt-out 用户的会话。

关键洞察在对比里:传统 rejection sampling fine-tuning 只模仿成功会话,会把模型"自己从错误里爬出来"的过程连同证据一起丢掉——新方法从成功会话里模仿有用步骤,从两类会话里用验证过的提示纠正错误。

为什么值得关注

失败会话第一次被系统性变现:这个 recipe 不依赖更大的模型,依赖的是标注管线的事后偏差控制,工程团队可以直接对标实现。对跑着真实用户流量、有大量失败轨迹沉在日志里的 Computer Use / agent 产品,这是一条现成的数据变现路径——你的失败会话比成功会话更值钱。

本期评分1-5 分 · 次日收集用于优化选题
10

Jev 生态一日三连:OpenRouter 内置官方分类、Simon Willison 发 llm-typesafe 插件、Metaview 全线接入搜索提速 10 倍

Simon Willison 博客 / OpenRouter / X · 2026-09-22(Willison 原文已核实 · OpenRouter 官方已核实 · Metaview 一条为转述)

OpenRouter 官方发 TIP:通过 Classifiers 功能调 TypeSafe AI 的 Jev 自动分类 LLM 请求,结果可在 Explore 里分析。评论区有用户报"先分类后生成"模式在自家管道省约 30 倍成本(第三方口径)。Metaview 宣布全线接入 Jev,搜索提速约 10 倍(转述,无第三方核证)。

Simon Willison 的 llm-typesafe 0.1a0 插件(已核实)把用法写得很具体:llm install llm-typesafe、设 key,然后三种输出模式——noul 二分判断("这条消息是否明确要求退款?"返回 {"type":"noul","noul":0.99})、choice 多选(客服工单分流 billing/technical/other,criteria 里写清判定标准)、score 打分(bug 报告可复现性三档)。Jev 本身 09-16 期已报过:不做文本生成、一次查询并行输出带校准概率的结构化判断,0.35 秒一个、输出 token 免费。

为什么值得关注

模型发布 6 天后基础设施级集成就开始落地,这个节奏说明"便宜的结构化判断"是一个有真实需求的独立生态位——分流、打标、路由这些不适合生成模型的活,账要单独算。手里有分类流水线的团队值得跑一遍对照:主力模型硬跑判断任务和 Jev 专跑,成本差从 OpenRouter 和 Metaview 的口径看是一个量级起步。

本期评分1-5 分 · 次日收集用于优化选题