2026-08-19 · 来源 aihot.virxact.com · 过去 48 小时
01
Memmy:把 Codex、Claude Code、DeepSeek Harness 接到同一份 SQLite 本地记忆
Memmy跨 Agent 记忆SQLite基础设施

开源项目 Memmy 的口号是"Switch agents, not context"。它把 Codex、Claude Code、DeepSeek Harness 这三套主流编码智能体接入同一份本地 SQLite,对话里尚未落盘的决策也能在工具之间传递——切工具时不用重新交代背景。

实现细节是把多 agent 各自的工作记忆统一映射到同一张表里,不走云端、不上传会话,因此也规避了"公司代码进第三方记忆库"的合规问题。对常在两个 CLI 之间切换的用户,它直接省掉了一段一段复述工程上下文的成本。

为什么值得关注:过去两年的编码 agent 竞争集中在"哪个模型 + harness 跑得更好",下一波竞争很可能发生在"上下文和记忆怎么带走、怎么共享"。Memmy 是这个方向上少见的、动手派的方案——把"切工具 ≠ 切状态"做成了一个本地可装的工程件。对厂商来说,这是一个必须开始警惕的趋势:底层模型差异化变窄之后,留住用户的关键是他们的项目和上下文资产。对多工具重度用户,它已经能马上用了。
来源:X / 阿易 AI Notes · 2026-08-18 查看原文 →
02
Grok Bot 被称"AI 领域又一个 Claude Code 时刻",个人使用量被指翻了约 100 倍
SpaceXAIGrok BotGrok消费体验

这两天关于 Grok Bot 的传播密度集中爆发。投资人 GavinSBaker 公开评价"@bot 是 AI 领域的又一个 Claude Code 时刻",自述个人 AI 使用量因此增长了大约 100 倍,原本还要专门搭建的播客摘要器,在 Grok Bot 里十五秒就搞定。DAIR.AI 的 Elvis Saravia 同步推荐给"想试 Codex 和 Claude Code 之外其他产品的用户"。

产品侧同步更新:移动端推送通知按 Bot 分组、每个 Bot 配独立图标;官方放出一份五步 Master Guide,把"一个 Bot 等于一个岗位"的理念落到 Gmail / Notion / 日历的具体串联上。xAI 仓库也在出工具——berd 已开源,能自带 harness 和模型,把工作上下文集中管理。马斯克在 X 上转发了多组用户案例(清理 9 万封 Gmail、用 Grok Bot 做情报助理)做评注。

为什么值得关注:这是 coding agent 战场之外的一个信号:当消费级 Bot 也开始按"一个 Bot 一个岗位"的形态做产品,它实际上在做和 harness 同构的事——把工具、记忆、技能装进一个可调度的单位。"Claude Code 时刻"被原样套到 Grok Bot 上,说明这种产品形态在一线和投资圈两端都被视作明确的下一步。对想看清工具方向的人,这一波值得亲自下一份 Grok Bot 把玩一遍,而不是停留在新闻层面。
来源:X / GavinSBaker、elonmusk、omarsar0、AYi_AInotes · 2026-08-18 查看原文 →
03
Grok 4.6 一周横扫四项智能体基准:Agentic Index 59 并列第一,Cursor 内 VulcanBench 88.4% 创纪录
SpaceXAIGrok 4.6VulcanBenchAgentic IndexMedAgentBench

8 月 13 日 Grok 4.6 发布后,过去一周它在四套不同侧重的智能体基准上几乎全部登顶或并列第一。Artificial Analysis Agentic Index 59 分与 Claude Opus 5 Max 并列第一,单任务成本约 0.84 美元;在 Cursor 编辑器内实测 VulcanBench 最新基准拿到 88.4%,比通过 API 调用高出 14.5 个百分点、速度约快 2.4 倍;DiligenceBench 金融评测约 52-53% 与 Claude Opus 5 持平,调用工具 41 次却更省钱;MedAgentBench 临床 EHR 任务以约 95.9% pass@1 反超 GPT-5.6 Sol。

这四套基准分别测的是工具使用与自主性(Agentic Index)、真实编码集成(Cursor × VulcanBench)、金融研报与尽调(DiligenceBench)和临床工作流(MedAgentBench),覆盖了 agent 真正被使用的几类主要场景。

为什么值得关注:单模型在多基准全维度领先不是常有的事——Agentic Index、Cursor 内实测、金融、临床四套同时打响,再加上 02 条里的 Grok Bot 体验爆发,意味着 SpaceXAI 不再只把 Grok 当作"另一个聊天模型",而是把"模型 + Bot 形态"作为一个捆绑打法推。对做 agent 选型的人来说,Grok 4.6 + Grok Bot 至少要列入下一轮试用名单;对其他人,这是个明确信号——这一波基准和体验值已具备企业级考量意义。
来源:X / cb_doge、ArtificialAnlys、karinanguyen、elonmusk · 2026-08-17 至 08-18 查看原文 →
04
DeepSeek V4 Flash 自验证逆袭 Fable 5:Terminal-Bench 从 79% 提到 88%,成本只有 1/11
DeepSeekV4 Flashtest-time scalingStanford

Stanford 一支团队用 DeepSeek V4 Flash 做了 self-consistency 类的实验:让模型对同一题采样 5 个解、再由同一模型自评打分,从中挑最高分的一个。这套 self-verification 流程把 Terminal-Bench 2.1 上的准确率从 79% 推到了 88%,跑赢 Claude Fable 5,而且全程成本只有 Fable 5 的约 1/11。

研究的核心看点不在分数本身,而在于它成立的条件:模型本身的判别能力够强,再加上一个简单的"自评打分+投票"流程,推理时计算量多花一点,效果就能上一个台阶,并匹敌或超过明显更贵的对手。研究框架已经开源,可复现。

为什么值得关注:test-time scaling 在过去一年是"理论上有效、实测改善幅度飘忽"的状态——很多场景下用推理时间换的分数不够付费意愿,但这条用 1/11 的成本换 9 个百分点的准确率,是少见的硬实证。对做 agent harness 的人来说,它给的启发很直接:模型选型和 prompt 之外,harness 里加一个"自评投票"回路可能比换更贵的模型更划算;对 API 价格敏感的小团队,这是把弱模型"组合"出强能力的具体打法。
来源:X / 阿易 AI Notes · 2026-08-18 查看原文 →
05
Agent Lightning v1.0:用约 3500 行代码把任意 agent harness 变成可强化学习对象,Qwen3.5-9B SWE-bench +14.6pp
强化学习Agent LightningSWE-benchQwen3.5

arXiv 2608.17528 发布 Agent Lightning v1.0——一个约 3,500 行代码的受控智能体强化学习框架。它不重写 agent,而是把任意已有 harness(Claude Code、Codex、自研 agent 都能接)作为一个可"被训练"的对象,用统一的 transition 模型抽取决策点和状态。

论文同时给出完整可复现的编码 agent RL 流程:只用约 6K 训练样本和适度算力,把 Qwen3.5-9B 在 SWE-bench Verified 上的得分从 41.8% 拉到 56.4%(绝对 +14.6 个百分点)。完整工作流与训练脚本全部开源。

为什么值得关注:这是"agent + RL"主流方向的一个拐点:之前要么在 agent harness 上做蒸馏,要么在大模型上做 SFT/RLHF,两者之间一直缺一个真正把任意 agent 当学习对象的中间层。Agent Lightning 选了一个轻量但完整的位置切入,并且把基线放在了开源可跑的小模型上(Qwen3.5-9B)。对做 agent 评测或自己 agent 团队的人来说,这是一份能直接借鉴的训练管线——不用换 harness 也能调出可观提升。
来源:arXiv 2608.17528 · 2026-08-17 查看原文 →
06
RadixArk / SGLang 开源 RL 框架 Miles v0.1:9 个月、72 位贡献者、1326 次 commit,已在 K3/DeepSeek V4/Qwen3.8/GLM-5.2 验证
SGLangRadixArkMiles强化学习开源框架

RadixArk 发布开源强化学习框架 Miles v0.1——它解决 RL 训练调试难、硬件利用效率低这两个长期痛点,背后是 SGLang 团队的工程栈。过去 9 个月,项目吸纳了 72 位贡献者、累计 1,326 次提交,并通过 85 项 GPU 端到端 CI 测试。

框架已在 Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2、MiniMax H3 等开源前沿模型上跑通训练,被多家公司用于生产环境。MiniMax(MiniMax)和 Perplexity CEO Aravind Srinivas 都在 X 上做了转发推荐。

为什么值得关注:在"卖框架 / 开源框架"分化的 RL 工具市场上,Miles 拿出的不是 demo 而是一份工业可用的代码库——前 6 个开源前沿模型都跑通,是少见的覆盖度。它对标的意义在:SGLang 已经从推理框架扩到训练框架,让一家开源工具厂商把"训 + 推"两端都做成基础设施。对在内部做 RL 训练的人,省下一份自己造轮子的时间。
来源:X / SemiAnalysis、MiniMax_AI、AravSrinivas · 2026-08-18 查看原文 →
07
Questflow 金融智能体栈上线:4 层架构 + 11 款模型可选用,自然语言下单并连接交易所
Questflow金融智能体Financial HarnessHyperliquid

Questflow 推出面向市场交易的 Financial Harness——把"研究 + 决策 + 执行"拆成清晰的 4 层:推理模型、投资方法技能集(Skills)、实时数据/新闻插件(Plugins)、交易所/钱包执行层。用户可以按任务在 GPT、Claude、Gemini、Grok、Kimi、DeepSeek、Qwen 等 11 款模型之间切换做推理。

下单流程用自然语言驱动并强制预览:用户口述意图后,系统先生成可审核的订单,确认后才推到 Hyperliquid、Polymarket 等执行端。对应 Kim 的另一句评价里提到:"非通用智能体"在 Hyperliquid 和 Polymarket 上能跑赢通用 AI 智能体。

为什么值得关注:"Harness 形态"在金融场景里比编码场景严格得多——一次误操作就是真金白银。Questflow 把可审核订单(preview-then-execute)做成了强约束,是少数敢把"生成式决策"对接到真交易所的形态。它的 4 层模型 + 11 款推理模型可选,实质是把"调模型"也做成了策略选择。对想做垂直领域 agent 的人,这是一条结构化非常清晰的参考设计。
来源:X / rohanpaul_ai、kimmonismus · 2026-08-18 查看原文 →
08
Steipete 观察:code mode 进入现代 harness,cli、mcp、工具全部由 agent 现场写 JS
code modeHarness范式Peter Steinberger

PSPDFKit 作者 Peter Steinberger(@steipete)最近抛出一个判断:"code mode 现已进入现代 harness"。意思是:CLI 工具、MCP 服务器、其他工具组件不再是预先打包好的二进制而是 agent 在一次会话里现场写出来的 JavaScript 代码,按需生成、按需调用。

这套范式的几大后果随之而来:工具清单不再需要人力预先维护;harness 在不同模型之间可以零拷贝;冷启动时不必等 npm 安装一长串依赖。这是一个从"静态工具集"过渡到"动态生成工具"的明显切分。

为什么值得关注:这是一个范式级别的观察,由长期做底层工具的工程师提出。"工具 = 代码"如果成立,claude code 的 skills、codex 的 tools、cursor 的 MCP 集合都会开始变化——它们越来越像 agent 的脚手架,而不是一份硬编码清单。对做 harness 的人,这是一个值得提前布局的方向;对模型厂商,是给"更弱的模型如何变强"提供了一条路——好工具生成能力可以补足模型本身能力的不足。
来源:X / steipete(Peter Steinberger) · 2026-08-18 查看原文 →
09
企业微信 5.0.10 全面开放 CLI 与 MCP,10 大办公模块可直接接入 WorkBuddy、DeepSeek Harness 等主流 Agent
企业微信CLIMCP国内 toB Agent

企业微信 5.0.10 正式面向所有规模企业(不限人数和资质)开放 CLI 与 MCP 能力,文档、表格、邮件、会议等十大核心办公模块全都能被外部 Agent 直接调用。官方推荐接入的清单里点名了 WorkBuddy、DeepSeek Harness、Minimax Code 等主流 AI Agent,自建 Agent 也可以接。

合规上叠了多层护栏:MCP 接入链路加权限与审批机制,AI 执行关键动作必须人工审批;授权支持有效期;全程可追溯。小北 @frxiaobei 在 X 上补充点出了企微真正不可替代的部分——连接微信、客户群、朋友圈等私域场景,这部分目前仍受制于数据授权和合规,目前看仍未开放给 Agent。

为什么值得关注:飞书和钉钉的"开放办公能力"都不新鲜,企微这次的看点在于它把 CLI + MCP 这种智能体时代的接入方式做成了默认选项——而不是像过去那样只开放 API。对做 toB Agent 的人,这意味着一个真实验证过的、能接入十亿级别微信用户的渠道——前提是你打算深耕国内办公自动化。同步的护栏设置(关键动作必须人工审批)也是值得借鉴的形态。
来源:IT之家 / X(frxiaobei) · 2026-08-18 查看原文 →
10
Anthropic 状态页报 Claude Opus 5 / Mythos 5 / Fable 5 / Sonnet 5 / Haiku 4.5 多款模型出现性能下降
AnthropicClaude性能事件可用性

Anthropic 状态页 incident ID q7txxvbsftgq:公司正在调查影响 Claude Opus 5、Claude Mythos 5、Claude Fable 5、Claude Sonnet 5、Claude Haiku 4.5 多款模型的性能下降问题。这不是单纯的"服务宕机",而是覆盖最新几代旗舰和轻量模型同时出现的质量退化。

值得注意的细节:报告分布在 buzz 翻译的 Hacker News 上,并未被 Anthropic 在公开博客说明;同时段 Anthropic 又把 Claude Code 的 50% 周限额上调延长至 8 月 31 日,承认"未来几周容量可能紧张"。

为什么值得关注:这是 8/17 已记录的"Claude 大规模服务故障"后续——从"完全断连"过渡到"还在响应、但结果变差",对企业级部署是一个更难判别的形态:当你的 harness 还在调通 API、但输出质量开始不稳定,肉眼和单测都不容易立刻发现。它给所有把 Claude 当主力的团队提了一件事:现在是把 fallback 模型、并发限额监控和这次事件的具体应对策略提上日程的时候。
来源:Hacker News 热门(buzzing.cc 中文翻译)· 状态页 incident q7txxvbsftgq · 2026-08-18 查看原文 →