开源项目 Memmy 的口号是"Switch agents, not context"。它把 Codex、Claude Code、DeepSeek Harness 这三套主流编码智能体接入同一份本地 SQLite,对话里尚未落盘的决策也能在工具之间传递——切工具时不用重新交代背景。
实现细节是把多 agent 各自的工作记忆统一映射到同一张表里,不走云端、不上传会话,因此也规避了"公司代码进第三方记忆库"的合规问题。对常在两个 CLI 之间切换的用户,它直接省掉了一段一段复述工程上下文的成本。
这两天关于 Grok Bot 的传播密度集中爆发。投资人 GavinSBaker 公开评价"@bot 是 AI 领域的又一个 Claude Code 时刻",自述个人 AI 使用量因此增长了大约 100 倍,原本还要专门搭建的播客摘要器,在 Grok Bot 里十五秒就搞定。DAIR.AI 的 Elvis Saravia 同步推荐给"想试 Codex 和 Claude Code 之外其他产品的用户"。
产品侧同步更新:移动端推送通知按 Bot 分组、每个 Bot 配独立图标;官方放出一份五步 Master Guide,把"一个 Bot 等于一个岗位"的理念落到 Gmail / Notion / 日历的具体串联上。xAI 仓库也在出工具——berd 已开源,能自带 harness 和模型,把工作上下文集中管理。马斯克在 X 上转发了多组用户案例(清理 9 万封 Gmail、用 Grok Bot 做情报助理)做评注。
8 月 13 日 Grok 4.6 发布后,过去一周它在四套不同侧重的智能体基准上几乎全部登顶或并列第一。Artificial Analysis Agentic Index 59 分与 Claude Opus 5 Max 并列第一,单任务成本约 0.84 美元;在 Cursor 编辑器内实测 VulcanBench 最新基准拿到 88.4%,比通过 API 调用高出 14.5 个百分点、速度约快 2.4 倍;DiligenceBench 金融评测约 52-53% 与 Claude Opus 5 持平,调用工具 41 次却更省钱;MedAgentBench 临床 EHR 任务以约 95.9% pass@1 反超 GPT-5.6 Sol。
这四套基准分别测的是工具使用与自主性(Agentic Index)、真实编码集成(Cursor × VulcanBench)、金融研报与尽调(DiligenceBench)和临床工作流(MedAgentBench),覆盖了 agent 真正被使用的几类主要场景。
Stanford 一支团队用 DeepSeek V4 Flash 做了 self-consistency 类的实验:让模型对同一题采样 5 个解、再由同一模型自评打分,从中挑最高分的一个。这套 self-verification 流程把 Terminal-Bench 2.1 上的准确率从 79% 推到了 88%,跑赢 Claude Fable 5,而且全程成本只有 Fable 5 的约 1/11。
研究的核心看点不在分数本身,而在于它成立的条件:模型本身的判别能力够强,再加上一个简单的"自评打分+投票"流程,推理时计算量多花一点,效果就能上一个台阶,并匹敌或超过明显更贵的对手。研究框架已经开源,可复现。
arXiv 2608.17528 发布 Agent Lightning v1.0——一个约 3,500 行代码的受控智能体强化学习框架。它不重写 agent,而是把任意已有 harness(Claude Code、Codex、自研 agent 都能接)作为一个可"被训练"的对象,用统一的 transition 模型抽取决策点和状态。
论文同时给出完整可复现的编码 agent RL 流程:只用约 6K 训练样本和适度算力,把 Qwen3.5-9B 在 SWE-bench Verified 上的得分从 41.8% 拉到 56.4%(绝对 +14.6 个百分点)。完整工作流与训练脚本全部开源。
RadixArk 发布开源强化学习框架 Miles v0.1——它解决 RL 训练调试难、硬件利用效率低这两个长期痛点,背后是 SGLang 团队的工程栈。过去 9 个月,项目吸纳了 72 位贡献者、累计 1,326 次提交,并通过 85 项 GPU 端到端 CI 测试。
框架已在 Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2、MiniMax H3 等开源前沿模型上跑通训练,被多家公司用于生产环境。MiniMax(MiniMax)和 Perplexity CEO Aravind Srinivas 都在 X 上做了转发推荐。
Questflow 推出面向市场交易的 Financial Harness——把"研究 + 决策 + 执行"拆成清晰的 4 层:推理模型、投资方法技能集(Skills)、实时数据/新闻插件(Plugins)、交易所/钱包执行层。用户可以按任务在 GPT、Claude、Gemini、Grok、Kimi、DeepSeek、Qwen 等 11 款模型之间切换做推理。
下单流程用自然语言驱动并强制预览:用户口述意图后,系统先生成可审核的订单,确认后才推到 Hyperliquid、Polymarket 等执行端。对应 Kim 的另一句评价里提到:"非通用智能体"在 Hyperliquid 和 Polymarket 上能跑赢通用 AI 智能体。
PSPDFKit 作者 Peter Steinberger(@steipete)最近抛出一个判断:"code mode 现已进入现代 harness"。意思是:CLI 工具、MCP 服务器、其他工具组件不再是预先打包好的二进制而是 agent 在一次会话里现场写出来的 JavaScript 代码,按需生成、按需调用。
这套范式的几大后果随之而来:工具清单不再需要人力预先维护;harness 在不同模型之间可以零拷贝;冷启动时不必等 npm 安装一长串依赖。这是一个从"静态工具集"过渡到"动态生成工具"的明显切分。
企业微信 5.0.10 正式面向所有规模企业(不限人数和资质)开放 CLI 与 MCP 能力,文档、表格、邮件、会议等十大核心办公模块全都能被外部 Agent 直接调用。官方推荐接入的清单里点名了 WorkBuddy、DeepSeek Harness、Minimax Code 等主流 AI Agent,自建 Agent 也可以接。
合规上叠了多层护栏:MCP 接入链路加权限与审批机制,AI 执行关键动作必须人工审批;授权支持有效期;全程可追溯。小北 @frxiaobei 在 X 上补充点出了企微真正不可替代的部分——连接微信、客户群、朋友圈等私域场景,这部分目前仍受制于数据授权和合规,目前看仍未开放给 Agent。
Anthropic 状态页 incident ID q7txxvbsftgq:公司正在调查影响 Claude Opus 5、Claude Mythos 5、Claude Fable 5、Claude Sonnet 5、Claude Haiku 4.5 多款模型的性能下降问题。这不是单纯的"服务宕机",而是覆盖最新几代旗舰和轻量模型同时出现的质量退化。
值得注意的细节:报告分布在 buzz 翻译的 Hacker News 上,并未被 Anthropic 在公开博客说明;同时段 Anthropic 又把 Claude Code 的 50% 周限额上调延长至 8 月 31 日,承认"未来几周容量可能紧张"。