2026-08-24 · 来源 aihot.virxact.com · 过去 48 小时
01
NanoGPT 速通榜:Fable 5 以 81.7% 通过率、2726 秒登顶,Opus 5 / Kimi K3 仅 53.6% / 52.2%
NanoGPT SpeedrunFable 5编码基准Prime Intellect

Prime Intellect 的 NanoGPT Speedrun 榜单(8 月 23 日公布)把 20 款模型放进同一个限时编码任务里比速度。Fable 5 跑出 81.7% 通过率,用时 2726 秒,压过人类基线(2600 秒)。排第二、第三的 Opus 5 和 Kimi K3 通过率分别只有 53.6% 和 52.2%,和榜首差了超过 28 个百分点。

榜单同时开放了 41 条完整智能体轨迹供复盘——你能在上面直接看每个模型是怎么把任务拆完的。

为什么值得关注:这是把"编码能力"压成单一数字的公开擂台。Fable 5 单价是 Opus 5 的两倍(据 8 月 23 日另一组数据,它只占 Anthropic 付费 token 的 6%),却在速通上把 Opus 5 甩开近 30 个点——说明在限时编码场景里,贵模型确实换来了实打实的通过率。对做模型选型的人,这 41 条轨迹比任何厂商宣传都更可核查。
来源:Hacker News / Prime Intellect · 2026-08-23 查看原文 →
02
开源课《Building a Coding Agent From Scratch》拆解三种 agent loop 运行模式与供应商账本
Coding AgentHarness开源课程Paul Iusztin

Paul Iusztin 的开源课用 Python 智能体 Decode 演示了跑一个 coding agent loop 的三种方式:交互式在线(直连低延迟 API)、远程离线(按 GPU 小时计费)、异步在线(批处理计费)。课程把"同一个 loop 怎么跑"和"每种跑法要付多少钱给哪家云"绑在一起讲,而不是停在讲 prompt。

为什么值得关注:大多数讲 coding agent 的内容停在"怎么写 system prompt",这门课补的是工程落地最缺的一块:运行模式决定账单形态。对想自己搭 harness 的人,三种模式对应三套成本结构——交互式要付 API 延迟溢价,远程离线按 GPU 小时,异步靠批处理摊薄。选错模式,同样的 agent 成本能差一个数量级。
来源:MarkTechPost · 2026-08-22 查看原文 →
03
Rust Glancer 把 Rust LSP 内存压到 rust-analyzer 的 1%,作者用 LLM 辅助但逐 PR 审代码
RustLSP开发工具LLM 辅助

Rust Glancer 是一个主打低内存占用的 Rust LSP 替代实现,目标内存用量是 rust-analyzer 的百分之一,作者已把它当日常主力用了约 1.5 个月。项目重度使用 LLM 辅助开发,但明确不是 vibe coding——每个 PR 都人工审查。

暂不支持构建脚本这类不可信代码执行,后续计划加代码操作和 proc macro 支持。

为什么值得关注:rust-analyzer 吃内存是 Rust 开发者的老痛点,大仓库里轻易占掉几个 GB。Glancer 把"内存"当成可量化的工程指标去打,而不是堆功能。更值得记的是它的开发方式:用 LLM 但不 vibe,逐 PR review——这正好给"AI 辅助写工具链"提供了一个不会被自己糊弄的做法样本。对做 IDE 插件/语言服务器的人,1% 这个数字本身就是一道门槛。
来源:Hacker News · 2026-08-22 查看原文 →
04
实用向 AI 做 PPT 的 Skill 榜单重排:ppt-master 48.7k⭐ 居首,直接吐原生 .pptx
Skillppt-master技能评测GitHub

阿易 AI Notes(8 月 23 日)按"真实可编辑性、审美上限、GitHub 热度"三个硬指标重排了 10 个做 PPT 的 AI Skill。榜首 ppt-master(48.7k stars)直接输出带完整图层和文字框的原生 .pptx 文件,适合正式交付;frontend-slides(28k⭐)和 guizang-ppt-skill(24.7k⭐)分列二、三名。

为什么值得关注:这是 skill 评测里少见的"以产物质量倒推 skill 好坏"的榜单,而不是比谁 star 多。对一直看"好用的 skill / skill 评测"方向的人,它给出了一个可复制的评判维度:能不能交付可编辑的原生文件,比"生成一张好看的图"更接近真实工作流。48.7k 这个量级也说明"做 PPT"已经是 skill 生态里被反复打磨的高频场景。
来源:X / 阿易 AI Notes · 2026-08-23 查看原文 →
05
蚂蚁百灵给 SGLang 上 Weight Cache Daemon:权重加载 0.63 秒,比磁盘快约 780 倍
蚂蚁百灵SGLang推理优化权重缓存

蚂蚁百灵(8 月 22 日)发布面向 SGLang 的 Weight Cache Daemon。在 Ling-2.6-1T FP8 上,它把权重加载时间压到约 0.63 秒,比从磁盘加载快约 780 倍;引擎总启动时间从 8.8 分钟缩到约 0.53 分钟。核心思路是把权重缓存在内存/高速介质里,避免每次冷启动都重新读盘。

为什么值得关注:对跑大模型服务的人来说,"启动慢"是弹性伸缩的最大敌人——想按请求扩缩容,结果光加载权重就花十分钟。0.63 秒这个数字意味着可以把大模型当成可调度的普通服务来对待,冷启动不再是门槛。这也呼应了模型厂当夜给开源 harness 接驳的节奏(DeepSeek Harness 0.1.1 Day-0 适配 V4-Flash-Vision 就是同月的例子):推理侧的工程优化正在追着模型发布跑。
来源:X / 蚂蚁百灵 · 2026-08-22 查看原文 →
06
MCP 路线图更新:Tasks 扩展进规范、HTTP 原生传输、DPoP 做智能体身份
MCPSEP-2663智能体协议企业安全

MCP 核心维护者(8 月 22 日)发布新版路线图,列了五个优先方向。推进 Tasks 扩展(SEP-2663)进入规范,让智能体任务有了标准原语;统一 HTTP 原生传输以覆盖本地服务器;通过 DPoP 和 Workload Identity Federation 做智能体身份识别与授权。

还提到标准化工具调用结果契约、渐进式工具发现,以及改善 SDK 开发者体验。

为什么值得关注:这条线把 MCP 从"工具调用协议"往"智能体运行时协议"推。Tasks 原语 + 渐进式工具发现,解决的是多智能体协作里"谁在跑什么、跑到哪了"的可见性问题;DPoP/Workload Identity 则是在补企业最关心的——agent 拿到的令牌能不能被约束、能不能被审计。对做 harness 的人,路线图里这几项直接决定了未来一年你的 agent 能不能安全地接进公司内网。
来源:MCP Blog / Hacker News · 2026-08-22 查看原文 →
07
DeepSeek 自 8/23 起周末全天统一按低谷价:一周前刚上的峰谷机制部分回调
DeepSeekAPI 计费成本V4-Pro

IT之家(8 月 22 日)报道,DeepSeek 宣布从北京时间 2026-08-23 00:00 起,周六周日全天不再区分峰谷,统一按低谷时段价格计费。距 8 月 17 日上线的峰谷定价(高峰/空闲分档)不到一周。

以旗舰 DeepSeek-V4-Pro 为例,高峰输出 27 元/百万 token,空闲 13.5 元/百万 token——周末现在一律按 13.5 元档走。

为什么值得关注:这是上线峰谷价后不到一周的部分回调,信号很直接:把开发者的周末批处理流量用低价锁住。对跑 DeepSeek 做编码/agent 的人,周末跑长任务的成本现在可预期了——不用再算"我这个周六下午算高峰还是空闲"。但也得留意:峰谷机制本身没废除,只在工作日保留,账单逻辑比纯统一价还是多一层。
来源:IT之家 · 2026-08-22 查看原文 →
08
ClawGym II 把 Claude Code / OpenClaw 当黑盒用 RL 训练:Claude Code 上 Bench 提升 14.81 分
ClawGym II强化学习HarnessClaude Code

Rohan Paul(8 月 22 日)转发的 ClawGym II 框架,把 OpenClaw 或 Claude Code 当作黑盒塞进强化学习训练循环,不需要打开它们的内部机制。用 Qwen3-30A3B 做底座,在 ClawGym-Bench Pass@1 上经 OpenClaw 提升 9.98 分、经 Claude Code 提升 14.81 分;混合训练也有效,并已扩展到 JobBench 和 OfficeQA。

为什么值得关注:这是 harness engineering 里"不改模型、只训外层 loop"思路的又一份证据——和 8 月 22 日晨报里 Nvidia AVO(改 harness 让 Opus 5 在 ARC-AGI-3 从 30% 到 100%)同方向。区别是 ClawGym II 把"现有 coding agent 当黑盒"当成前提,意味着你不用动 Claude Code 源码就能用 RL 把它的基准分再往上推 14 分。对做评测的人,黑盒 RL 也带来一个新问题:提升能不能泛化到训练集之外的任务。
来源:X / Rohan Paul · 2026-08-22 查看原文 →
09
FreeToken 边缘原生 MoE 推理引擎:8GB 笔记本 GPU 跑 35B,单卡跑 753B GLM-5.2
FreeTokenMoE 推理边缘部署GLM-5.2

UC Berkeley 与 UT Austin 团队(8 月 23 日)提出 FreeToken,把个人电脑当成统一弹性推理平台。它能在 8GB 笔记本 GPU 上以交互速度跑 35B 模型,在单张工作站显卡上跑 753B 的 GLM-5.2。定位是"边缘原生"的 MoE 服务引擎,目标是让大模型推理不再绑定数据中心。

为什么值得关注:753B 模型塞进一张工作站显卡,对应的是"本地跑前沿模型"这条线的又一步。对做 coding agent 的人,本地大模型的吸引力在于不用把代码库传到云端——FreeToken 把可交互的门槛从"得有机房"降到"有张好显卡"。但也要看清楚:它跑的是 GLM-5.2 这类开源权重,闭源前沿模型(Fable 5、Opus 5)依旧拿不到本地权重,本地化只覆盖开源侧。
来源:MarkTechPost · 2026-08-23 查看原文 →
10
Harvey 推出基于 Kimi K3 的后训练模型 Tenet,专攻长时程法律工作
HarveyKimi K3后训练法律 Agent

Harvey(8 月 23 日)发布首个后训练模型 Tenet 的研究预览版,基座是 Kimi K3,针对长时程法律任务训练。相比基座,Tenet 在 LAB 上完成的保留任务量接近两倍,在 LAB: Contracts 上多 20%,全通过率分别提升 9 和 2 个百分点。目前不公开权重或 API,只通过 Harvey 平台给企业用。

为什么值得关注:这是"拿开源强模型做垂直后训练"路线的又一个落地样本——基座用 Kimi K3,训练数据和方法换成法律领域。对做模型/应用的人,Tenet 说明垂直 agent 的护城河不一定在自训底座,而在后训练数据和评测集(它的 LAB 系列就是法律场景的专属 benchmark)。但没开源权重也没 API,外部只能从 Harvey 平台间接用,可核查性有限——这条标个"需核查"更稳妥。
来源:MarkTechPost · 2026-08-23 查看原文 →