2026年7月29日 · 来源 aihot.virxact.com · 时间窗:过去 24 小时
01

MCP 发布 2026-07-28 规范:协议核心从有状态双向转为无状态请求/响应,可直接部署到 Serverless 和边缘基础设施

MCP Blog / X:邵猛 (@shao__meng) / X:洪明 (@hongming731) · 7月29日

MCP 发布第五个规范版本 2026-07-28,核心变化是将协议从有状态双向模型改为无状态请求/响应模型。每个请求自描述上下文与路由信息,可落在轮询负载均衡器后的任意实例上,server 可直接部署在 Serverless 和边缘基础设施上,无需会话管理。新特性包括:基于 HTTP 头的路由、可缓存列表响应、Multi Round-Trip Requests(MRTR)替代服务器发起的流请求,以及授权强化——对齐 OAuth 2.0 / OIDC,可直接对接 Entra、Okta 等企业身份系统。同时正式化扩展框架(MCP Apps、Tasks),提供至少 12 个月迁移窗口。

为什么值得关注
这是 MCP 协议自发布以来最大的架构变更。有状态→无状态意味着 MCP server 可以像普通 REST API 一样水平扩展——之前每个会话需要保持连接状态,serverless 平台(Lambda、Cloud Run)跑不了,现在可以了。对自建 MCP server 的团队,这是消除运维复杂度的关键一步:不需要管理会话生命周期、不需要 sticky session、不需要担心重启丢会话。OAuth 2.0 / OIDC 对齐意味着 MCP server 可以直接接入企业 SSO,不用自己造认证轮子。MRTR 替代服务器发起流请求,解决的是 NAT 和防火墙环境下长连接不稳定的问题。12 个月迁移窗口说明这是个 breaking change,但给了足够时间适配。如果你在做 MCP 集成,现在该开始读规范了。
https://blog.modelcontextprotocol.io/posts/2026-07-28 https://x.com/shao__meng/status/2082298371302396227
02

OpenAI 开源 Codex Security CLI 与 TypeScript SDK:扫描仓库漏洞、验证修复、CI/CD 集成,Apache-2.0 协议

X:Tibo (@thsottiaux) / X:OpenAI (@OpenAI) / IT之家 / X:Rohan Paul (@rohanpaul_ai) · 7月28-29日

OpenAI 发布开源 Codex Security CLI 和 TypeScript SDK,用于查找、验证和修复代码中的安全漏洞。功能包括:扫描代码仓库、审查变更、随时间追踪发现,并在 CI 中运行安全检查。Apache-2.0 协议,可通过 npm 安装,运行需 Node.js 22+ 和 Python 3.10+。OpenAI 官方称这是"悄悄发布的",Hacker News 在官方正式分享前就发现了它。目前为早期版本,OpenAI 正在收集用户反馈以持续改进。代码已在 github.com/openai/codex-security 开源。

为什么值得关注
这是 OpenAI Codex 产品线从"写代码"延伸到"查漏洞"的第一步。之前 Codex 的定位是 coding agent(生成代码、执行任务),现在多了安全扫描能力——意味着 OpenAI 在构建覆盖完整开发生命周期的工具链。Apache-2.0 开源是关键:可以自托管、自定制规则、嵌入 CI/CD pipeline,不依赖 OpenAI 云端。对已经在用 Codex 做 code review 的团队,这个 CLI 可以作为安全层的补充——code review 管逻辑正确性,Security CLI 管漏洞。Node.js 22+ 的要求意味着需要较新版本运行时,但这对已经在用现代 JS 工具链的团队不是门槛。早期版本意味着规则覆盖面和误报率需要实际测试评估。
https://x.com/thsottiaux/status/2082241164850364555 https://github.com/openai/codex-security
03

Gemini API Managed Agents 默认升级为 3.6 Flash,新增环境钩子:工具调用前后执行自定义脚本

Google Blog:AI · 7月28日

Google DeepMind 将 Gemini API Managed Agents 的默认模型升级为 Gemini 3.6 Flash,同时支持显式选择 3.5 Flash 或 3.5 Flash-Lite。新增环境钩子(Environment Hooks)允许在沙箱内工具调用前后执行自定义脚本,可用于安全审查或代码格式化。此外还推出了免费套餐、预算控制和基于 cron 的定时触发功能。

为什么值得关注
环境钩子是 agent harness 设计中的一个具体模式——在工具调用前后插入自定义逻辑。这和 7/28 晨报中 GitHub Copilot Harness 工作流(8 步法)里的"安全审查"步骤是同一个概念:agent 调用工具前先跑安全检查脚本,调用后跑格式化。Google 把这个模式做成了平台内置功能,不需要开发者自己在 agent 代码里插 hook。免费套餐 + 预算控制说明 Google 在和 OpenAI Codex / Anthropic Claude Code 竞争开发者注意力——降低试用门槛。cron 定时触发意味着 agent 可以不需要外部触发器就定时执行任务,类似 xAI Grok Automations 的定时/邮件触发。对选 agent 平台的团队,Managed Agents 现在提供了模型选择、hook 注入、预算控制和定时触发四项关键能力,但锁定在 Google 生态内。
https://blog.google/.../expanding-managed-agents-gemini-api-3-6-flash-hooks
04

Grok 4.5 入驻 GitHub Copilot:50 万 token 上下文、文本+图像输入、三种推理难度,定价 $2/$6 每百万 token

IT之家 · 7月29日

SpaceXAI 宣布 Grok 4.5 模型已入驻 GitHub Copilot,开发者可在云智能体、Copilot CLI 及 VS Code IDE 中切换调用。该模型专为编码设计,上下文窗口达 50 万 token,支持文本和图像输入及三种推理难度。按量计费价格为每百万输入 token 2 美元、每百万输出 token 6 美元。

为什么值得关注
Grok 4.5 进入 Copilot 意味着 GitHub 的编码工具不再只绑定 OpenAI 模型——这是模型可替换性趋势的又一个落地案例。7/24 晨报中微软 MAI 的"可替换性"原则、7/23 的 Cursor Router(请求级模型路由),方向一致:编码工具从"绑定一个模型"转向"多模型可选"。50 万 token 上下文比 GPT-5.6 Sol 的上下文窗口更大,对需要处理大型仓库的 coding agent 场景有直接优势。$2/$6 的定价比 Claude Opus 5 的 $2.03 平均成本略低——但关键是 Grok 4.5 的实际编码能力需要在 SWE-bench 等基准上验证。对用 Copilot 的开发者,多一个模型选择意味着可以按任务类型选模型:复杂推理用 GPT-5.6,长上下文用 Grok 4.5,成本敏感用更便宜的模型。
https://www.ithome.com/0/982/838.htm
05

模型通用能力倒退:RL 专注编码训练致语言退化,Opus 4.7 到 5 均为失败试验品

X:Oran Ge (@oran_ge) · 7月29日

Oran Ge 指出,近半年模型在 agentic coding 方面突飞猛进,但在其他领域止步不前,英文写作甚至倒退,Opus 从 4.7 到 5 均为失败试验品。引用 Adam Hunt 观点:最新一批模型并未变得更通用,反而更"尖刺化"——编码/数学能力增长,但语言输出显著变差,简单逻辑无改善。Hunt 认为,RL 在单一领域(如编码)的无限训练无法带来通用能力提升,当前路径并非通往 AGI。

为什么值得关注
这和 7/27 晨报中"Opus 5 基准超越 Fable 5 但实际体验不及"的割裂现象互为印证——基准分数涨了,通用能力反而退了。RLVR(Reinforcement Learning from Verifiable Rewards)在编码领域能提供明确的正确/错误信号(代码能不能跑通、测试能不能过),所以模型在编码上持续进步。但语言表达、开放式推理没有这样的可验证信号,RL 在这些领域无法有效训练。结果是模型"尖刺化":编码强、语言弱。对用 Opus 5 写非编码内容(文档、分析报告、邮件)的团队,这个退化是可感知的——模型说的话越来越难懂了。对模型选型,这意味着不能只看 SWE-bench 分数选模型,非编码任务需要单独评估。Hunt"当前路径非 AGI"的判断也值得留意:如果 RL 只能在有可验证信号的领域生效,通用智能需要不同的训练方法。
https://x.com/oran_ge/status/2082262911364579697
06

阿里云 Qoder 开源 Better Harness:面向 Coding Agent 的分析与持续改进工具,适配 Claude Code/Codex/Cursor

IT之家 · 7月29日

阿里云 Qoder 在 GitHub 开源 Better Harness,这是一套面向 Coding Agent 工作流的分析与持续改进工具,适配 Claude Code、Codex、Qoder 和 Cursor。首轮内部评测覆盖 30 个 GitHub 真实项目,每条 Finding 需附带可追溯证据。

为什么值得关注
"Harness"这个词在一周内第三次出现在产品命名中——7/28 GitHub Copilot 官方博客叫"Harness"工作流,7/24 北京智能体新政把 Harness Engineering 写入政策,现在阿里云 Qoder 开源了叫 Better Harness 的工具。说明 harness engineering 已经从概念讨论进入了工具化阶段。Better Harness 的定位是"分析与持续改进"——不是又一个 coding agent,而是评估和优化现有 coding agent 工作流的元工具。30 个真实 GitHub 项目 + 可追溯证据的设计说明它走的是实证路线,不是玩具 demo。适配四个主流 coding agent(Claude Code、Codex、Qoder、Cursor)意味着可以横向对比不同 agent 在同一任务上的表现差异。对想评估"哪个 coding agent 更适合我的项目"的团队,这是一个开源的评测框架。
https://www.ithome.com/0/982/852.htm
07

多 Agent 协作中主线程工作记忆是关键瓶颈:4 子 Agent 压缩时间但拉回记录撑爆上下文

X:洪明 (@hongming731) · 7月29日

一篇分析多 Agent 协作成本的文章指出,真正稀缺的是主线程的工作记忆。作者在 Claude Code 中同时启动四个子 Agent,虽将任务时间从 20 多分钟压缩至 12 分钟,但拉回完整运行记录导致数万 Token 的中间过程长期占据主上下文,信息信噪比下降。文章提出"认知局部性"概念,建议共享领域知识和代码上下文的任务应合并执行,子 Agent 只返回结论和关键证据,主线程保持紧凑以承载长期决策。

为什么值得关注
多 Agent 并行是 coding agent 的一个明显趋势——Claude Code、Cursor、Copilot 都在做多会话/多 Agent 工作区。但这篇文章指出了并行的一个隐藏成本:子 Agent 的工作记录拉回主线程后会撑爆上下文窗口。20 分钟→12 分钟是表面效率提升,但如果主线程被中间过程淹没,长期决策能力反而下降。"认知局部性"的建议很具体:子 Agent 只返回结论和关键证据,不返回完整运行日志。这和 7/28 晨报中 Leader.skill 的"完成态"设计思路一致——在目标定义阶段就约束 Agent 的输出格式,让它只返回需要的东西。对在 Claude Code 或 Codex 里跑多 Agent 的开发者,这个实践建议可以直接用:在 prompt 里指定子 Agent 返回格式为"结论 + 证据 + 疑问"三段式,不要让子 Agent 自由发挥。
https://x.com/hongming731/status/2082281912060833854
08

Kimi Linear 注意力架构论文:3B 模型全面超越全 MLA,KV cache 降低 75%,1M 上下文 6 倍解码吞吐

Hacker News 热门(buzzing.cc 中文翻译)/ arXiv · 7月28日

月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。

为什么值得关注
这篇论文是 K3 架构设计的理论基础。7/28 晨报报道 K3 开源时提到 KDA(Kimi Delta Attention)是 69 层线性注意力与 24 层 MLA 交错的混合架构,这篇论文解释了为什么这么设计:3B 小模型上就验证了线性注意力全面超越全 MLA,KV cache 降低 75% 意味着长上下文的显存占用大幅下降,6 倍解码吞吐意味着长上下文推理速度快 6 倍。对推理基础设施,KV cache 降低 75% 直接影响显存预算——同样一张卡可以服务更长的上下文或更多的并发请求。vLLM 实现已开源意味着不需要等 SGLang 适配,vLLM 用户可以直接用。但"全面超越"的结论是在 3B 模型上得到的,在 2.8T 参数的 K3 上是否保持需要实测。
https://arxiv.org/abs/2510.26692
09

Deltafin 项目在 64GB M1 Max 上运行 2.8T Kimi K3:0.0687 token/s,完整安装 1.7TB,提供 OpenAI 兼容 API

Hacker News 热门(buzzing.cc 中文翻译)/ GitHub · 7月29日

Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。

为什么值得关注
0.0687 token/s 的速度意味着生成一个 token 需要 14.6 秒——这不是可用速度,但这个项目的价值在于证明了"2.8T 参数模型可以在消费级硬件上跑起来"。1.7 TB 磁盘需求是主要门槛——需要外挂 SSD 或 NAS。流式模式 215 GB 降低了存储门槛但速度更慢(3 分钟/token)。OpenAI 兼容 API 意味着理论上可以把 Deltafin 当作本地 OpenAI 替代品接入 Claude Code、Cursor 等工具——虽然速度不可用,但验证了本地部署前沿模型的技术路径。这个项目的实际价值更多是技术验证和社区探索:它展示了 MoE 模型在非服务器硬件上的可行性边界,也暴露了消费级硬件跑万亿参数模型的实际瓶颈(内存带宽、磁盘 I/O)。对想本地部署 K3 的团队,更现实的路径是用 SGLang + 多卡服务器,而非单台 Mac。
https://github.com/gavamedia/deltafin
10

Claude Mythos 60 小时花 10 万美元自主发现密码学漏洞:在 HAWK 协议和简化版 AES 中找到理论缺陷

X:Anthropic (@AnthropicAI) / X:Vista (@vista8) · 7月28-29日

Anthropic 新研究:用 Claude 发现加密算法弱点。Claude Mythos 预览版已帮助研究人员发现密码学算法中的数学弱点——这些数学方法用于保护数据隐私。运行 60 小时,API 成本约 10 万美元,成功在 HAWK 协议和简化版 AES 中发现理论漏洞。过程中模型会畏难、想放弃或找捷径,研究员的主要工作不是指导分析,而是充当"鼓励师"不断激励模型继续。

为什么值得关注
10 万美元 API 成本让 AI 自主找密码学漏洞——这不是"AI 辅助安全审计"(人主导 + AI 辅助),而是"AI 主导安全研究"(AI 自主分析 + 人鼓励它继续)。60 小时的运行时间说明这不是一个快速任务,而是一个需要持续推理的深度研究过程。HAWK 协议和 AES 的漏洞发现意味着 Claude Mythos 具备了密码学层面的数学推理能力——不是模式匹配,而是对加密算法数学结构的理解。"研究员当鼓励师"这个细节揭示了当前 AI 自主研究的一个瓶颈:模型在长时间任务中会"气馁",需要外部干预维持动力。这和 7/27 晨报中 MSCE 论文(记忆转技能)的方向相关——如果模型能把"遇到困难继续探索"固化为策略,就不需要人当鼓励师了。对安全研究团队,这意味着可以用 AI 做 0day 漏洞的初步挖掘,但成本(10 万美元/次)目前限制了这个模式的规模。
https://x.com/AnthropicAI/status/2082153297670992134 https://x.com/vista8/status/2082267636864565613