Prime Intellect 的 NanoGPT Speedrun 榜单(8 月 23 日公布)把 20 款模型放进同一个限时编码任务里比速度。Fable 5 跑出 81.7% 通过率,用时 2726 秒,压过人类基线(2600 秒)。排第二、第三的 Opus 5 和 Kimi K3 通过率分别只有 53.6% 和 52.2%,和榜首差了超过 28 个百分点。
榜单同时开放了 41 条完整智能体轨迹供复盘——你能在上面直接看每个模型是怎么把任务拆完的。
Paul Iusztin 的开源课用 Python 智能体 Decode 演示了跑一个 coding agent loop 的三种方式:交互式在线(直连低延迟 API)、远程离线(按 GPU 小时计费)、异步在线(批处理计费)。课程把"同一个 loop 怎么跑"和"每种跑法要付多少钱给哪家云"绑在一起讲,而不是停在讲 prompt。
Rust Glancer 是一个主打低内存占用的 Rust LSP 替代实现,目标内存用量是 rust-analyzer 的百分之一,作者已把它当日常主力用了约 1.5 个月。项目重度使用 LLM 辅助开发,但明确不是 vibe coding——每个 PR 都人工审查。
暂不支持构建脚本这类不可信代码执行,后续计划加代码操作和 proc macro 支持。
阿易 AI Notes(8 月 23 日)按"真实可编辑性、审美上限、GitHub 热度"三个硬指标重排了 10 个做 PPT 的 AI Skill。榜首 ppt-master(48.7k stars)直接输出带完整图层和文字框的原生 .pptx 文件,适合正式交付;frontend-slides(28k⭐)和 guizang-ppt-skill(24.7k⭐)分列二、三名。
蚂蚁百灵(8 月 22 日)发布面向 SGLang 的 Weight Cache Daemon。在 Ling-2.6-1T FP8 上,它把权重加载时间压到约 0.63 秒,比从磁盘加载快约 780 倍;引擎总启动时间从 8.8 分钟缩到约 0.53 分钟。核心思路是把权重缓存在内存/高速介质里,避免每次冷启动都重新读盘。
MCP 核心维护者(8 月 22 日)发布新版路线图,列了五个优先方向。推进 Tasks 扩展(SEP-2663)进入规范,让智能体任务有了标准原语;统一 HTTP 原生传输以覆盖本地服务器;通过 DPoP 和 Workload Identity Federation 做智能体身份识别与授权。
还提到标准化工具调用结果契约、渐进式工具发现,以及改善 SDK 开发者体验。
IT之家(8 月 22 日)报道,DeepSeek 宣布从北京时间 2026-08-23 00:00 起,周六周日全天不再区分峰谷,统一按低谷时段价格计费。距 8 月 17 日上线的峰谷定价(高峰/空闲分档)不到一周。
以旗舰 DeepSeek-V4-Pro 为例,高峰输出 27 元/百万 token,空闲 13.5 元/百万 token——周末现在一律按 13.5 元档走。
Rohan Paul(8 月 22 日)转发的 ClawGym II 框架,把 OpenClaw 或 Claude Code 当作黑盒塞进强化学习训练循环,不需要打开它们的内部机制。用 Qwen3-30A3B 做底座,在 ClawGym-Bench Pass@1 上经 OpenClaw 提升 9.98 分、经 Claude Code 提升 14.81 分;混合训练也有效,并已扩展到 JobBench 和 OfficeQA。
UC Berkeley 与 UT Austin 团队(8 月 23 日)提出 FreeToken,把个人电脑当成统一弹性推理平台。它能在 8GB 笔记本 GPU 上以交互速度跑 35B 模型,在单张工作站显卡上跑 753B 的 GLM-5.2。定位是"边缘原生"的 MoE 服务引擎,目标是让大模型推理不再绑定数据中心。
Harvey(8 月 23 日)发布首个后训练模型 Tenet 的研究预览版,基座是 Kimi K3,针对长时程法律任务训练。相比基座,Tenet 在 LAB 上完成的保留任务量接近两倍,在 LAB: Contracts 上多 20%,全通过率分别提升 9 和 2 个百分点。目前不公开权重或 API,只通过 Harvey 平台给企业用。