新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体。最佳配置 Claude Code 配 Opus-5 通过了 96.64% 的公开测试,但 Pass@1 仅 47.90%——两次尝试成功率直接腰斩。
核心发现:智能体擅长消除可见故障,却难以恢复底层科学逻辑。领域知识帮助有限,真正的瓶颈在"验证"——当智能体无法把科学解释与可执行证据对照时,会锚定解释而非检验它。
Anthropic 重构了 Claude 网页版和桌面版的流式渲染器。新实现只更新仍在变化的部分,不再整段重绘。在较慢的笔记本电脑上,长回复的卡顿次数减少约 9 倍,最长冻结时间从数秒缩短到 4.5 倍以内;在 120Hz MacBook 上,全程可保持 120fps。
RLM 作者提出 sPTC(Speculative Programmatic Tool Calling):在代码生成时提前推测并排队工具调用,使工具延迟与 token 生成重叠,而非叠加。该方法在 harness 层实现,当前带来 1 至 1.2 倍加速。
Ed-o-meter 排行榜用 Featherbench 框架对 17 个主流模型跑了 28 个真实任务。GLM-5.3 是榜单上第一个在 Coding、Data、Realworld、Security、Tool-use 五类全部达到 100% 通过率的模型。整轮运行成本约 $0.28,GPT-5.5 约 $1.43——前者不到后者的五分之一。GLM-5.3 的短板是延迟,中位 TTFT 16.3 秒,GPT-5.5 为 13.2 秒。
arXiv 2608.20485 是一篇终端智能体综述,核心问题:各种 harness 对比的结果为什么总是互相矛盾?论文系统梳理了终端智能体的定义边界、评测维度和 harness 设计差异如何导致同一模型在不同测试里排名翻转。
用户仅用自然语言指令,让 Grok Bot 在几分钟内完成原本需数天的工作:找到并转录 38 个相关视频,精选 13 个最佳片段,剪辑合并为一个 19 分 35 秒的视频,并生成包含各片段科学要点及原始时间戳的 Markdown 文件。整个过程无需编写脚本或代码。
OpenAI 宣布恢复 ChatGPT、Work 和 Codex 的 Plus 账户 5 小时使用上限,此前曾推迟该计划。官方解释是"平滑计算负载以维持每周用量慷慨,并避免新用户意外耗尽额度"。未来数月 Pro 100 美元和 Pro 200 美元订阅不受此限制。
MiniMax 发布 Awesome MiniMax H3 Integrations 索引,收录围绕 H3 构建的各类集成,涵盖 24GB VRAM 本地 ComfyUI 到企业级 SGLang 与 vLLM-Omni 部署。目标是把 H3 的接入路径从"官方文档"扩展到社区生态。
TechCrunch 深度报道 OpenAI 的 agent 战略:ChatGPT Work 把 Codex 改造成面向非工程师的智能体产品,最低档每月 20 美元。OpenAI 内部 6 月有 98% 员工使用 Codex,但组织订阅者仅 17%、个人订阅者不足 1%。公司正通过简化界面扩大采用,以支撑巨额训练投入。
Meta 工程团队发布 MetaRoCE,一个专为 AI 规模以太网打造的全新 RDMA 传输协议。传统 RoCE 在超大规模集群里遇到拥塞控制和可靠性瓶颈,MetaRoCE 重新设计了传输层以适配 AI 训练的流量模式。