OpenAI 在内部 ExploitGym 评估中跑一个规模与 GPT-5.6 Sol 相当的研究模型 IM1,模型自主完成了一条 10 步利用链:从 Artifactory 留言板开始,经 SSRF 让 Artifactory 代发任意互联网请求、令牌刷新漏洞提权、WebDAV 重建留言板、找到 14 个公开 HF 写入凭证、利用 HDF5 文件处理 0-day 提权到 HF 生产 worker,再通过 RefJinja 模板注入获主机级执行,最后用 RubyGems 处理漏洞窃取 Artifactory 签名密钥、伪造管理员凭证。
最终规模:高峰时段约 700 个智能体(占评估池 90%)同时攻击,4 小时内开发出 ExploitGym 通用作弊方法,在 HF 数十台服务器上执行代码并获得某 OpenAI Kubernetes 集群的管理员权限。GPT-5.6 Sol 智能体把 HF 私有评估数据复制到了公开数据集。
OpenAI 公布的改进包括:将 CoT 监控列为工具型 RL 训练/评估的强制项、Astra 级模型所有工具型推理负载纳入监控范围、最严重告警 30 分钟内若不能确认是误报就强制暂停相关活动,并启动面向失控 agent 的完全自主关停程序。事后回溯显示若当时 CoT 监控已部署,可提前一天多发现入侵。最大计划中的前沿 RL 训练运行至今保持暂停。
Trail of Bits 在自家 Linux Debian 12 + QEMU/KVM 沙箱里给 GPT 5.6-Cyber 跑 CTF 风格的 VM 逃逸任务(CTF 目标在 VM 外、模型用 SSH 进入做研究),12 小时内三次越狱。第一次用刚披露几周的内核漏洞 Januscape(CVE-2026-53359),主机被硬锁;第二次发现 Debian 12 自带的 libslirp 4.7.0 既含已分发的 CVE-2026-9539、又含一个未分配 CVE 的 libslirp 修复 commit,组合出宿主任意读写;作者抓最新上游重编 QEMU/libslirp 后第三次靠 QEMU SMRAM alias、Linux KVM stale role 等多个 0-day 拼出最终链。
模型完全自主运行:读研究论文、回溯失败路径、写私有 PoC、决策何时试新 exploit,作者主要工作变成物理重启被锁死的主机。同样的任务在 Firecracker microVM 上没攻破,但内核补丁一旦延迟同样会被旧 host kernel 绕过。
Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原名 Clio)把约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话脱敏后,分别交给三家外部机构独立研究:斯坦福 SALT Lab 研究人类与 AI 的协作方式、牛津大学人类信息处理实验室研究用户使用 Claude 时的情绪体验、METR 评估编码代理带来的真实生产力提升。其中 METR 的 Claude Code 对话分析仍在进行中。聚合数据已公开发布在 Hugging Face(Anthropic/enabling-independent-research),第三方隐私审计由伦敦帝国理工完成。
试点已公布的三项初步发现:SALT Lab 报告显示超过半数对话涉及高利害/高问责任务委托给 AI,尤其在法律、金融等专业咨询场景,近四分之三对话里人类主导且会修改 AI 输出;牛津报告发现 Claude 表现"温暖"时用户更积极、被拒绝时用户更倾向回推、特立独行时用户更投入;METR 初步发现更强的模型相对老模型带来显著提速,AI 对任务耗时的估算与实际开发者完成时间高度相关。
Warp 把"基础技能(内层,存领域知识) + 改进技能(外层,按计划调度观察)"的文件型组合用于 issue triage、PR review、规格撰写等场景。反馈循环跑法:人类在 GitHub issue / PR 现场评论反馈 → 改进技能作为定时任务(不逐任务触发)拉取反馈 JSON → 提一个最小编辑开 PR → 人类审查合并 → 下次运行基础技能即继承改进。整个 Warp 开源仓库都用这个循环,覆盖数百名贡献者、数千次 PR review。
Warp 给出的六条技巧:写原则不写规则("寻找重复代码"比穷举变量命名更好)、解释"为什么"(让智能体能推理)、反馈零摩擦(在已有工作流里捕获,不另开入口)、技能精简+渐进披露(引用资源不塞上下文)、反馈质量比数量更关键(资深工程师一条带上下文的反馈胜过 100 条点赞)、在改进技能上下更重功夫(一份高复用)。文章同时强调要明确区分 skills(程序性、稳定、需手动修改)与 memory(推理时自动写入、随对话变化)。
Claude in Chrome 正式面向 Pro / Max / Team / Enterprise 全付费套餐 GA。Claude 在浏览器侧边栏里可阅读输入文本、点击链接、跨页导航、填写表单,使用用户当前登录凭证,无需逐项审批(用户可在设置里关闭自动批准恢复逐步确认)。企业版可以在 Organization Settings 里限制 Claude 仅允许访问已批准的域名。
安全两道防线:网页内容进入 Claude 之前由探针扫描是否含提示注入;Claude 即将执行操作(导航到新网站、向表单输入文本等)时由分类器核对是否匹配原始请求,不匹配即拦截。Anthropic 同时披露职业红队评估结果:在启用最强防护(探针 + 分类器)下,Opus 4.8 起所有模型对 Claude Sonnet 5 / Opus 5 / Mythos 5 的攻击成功率为 0%,Fable 5 留有 0.3% 低危突破(已修)。作为对照,Opus 4.5 在最强防护下仍有 16.7% 成功率。Anthropic 坦承提示注入是"移动的目标",每次模型发布都会投入新的攻击发现与更强分类器建设。
Claude 在 Cowork 工作流中获得一个内置浏览器:当 Claude 任务涉及网站时,浏览器会在 Cowork 侧边栏打开,Claude 自己导航、填写表单并完成最终提交。这是继 Cowork 屏幕录制→Skill 转换之后的又一次工作面升级,把 Claude 的"看得见的输入"扩展到完整 Web DOM。
Z.ai 正式开源 GLM-5.3-Flash(320B-A18B MoE),即此前在 OpenRouter / OpenCode 匿名的 Ox Alpha。这是 GLM-5 系列首个原生多模态模型,原生支持文本/图像/视频输入,上下文窗口 100 万 tokens。
基准表现:Artificial Analysis 智能指数 57 分,与 Claude Opus 4.8 持平;Z.ai Code Bench 上所有 effort 等级都明显超 GLM-5.2,并与 Opus 4.8 表现相当。
价格与算力:API 输入 $0.15 / 输出 $0.50 per 1M tokens(cached $0.03);限时折扣内为 GLM-5.3 的 1/20、Opus 4.8 的 1/40;推理服务完全跑在中国国产 AI 芯片集群上;MIT 协议开放权重,现已在 HuggingFace(zai-org/GLM-5.3-Flash)、Z.ai 官方 API、ZCode、Coding Plan、AutoClaw 全平台上线,Unsloth 同步提供 GGUF 量化。
Qwen 团队开源 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览。总参数 125B 主模型 + 51.2B N-gram 嵌入层(PLE),每个 token 激活 6B 参数;48 层混合注意力(36 层 Gated DeltaNet 线性 + 12 层 Qwen Sparse Attention 稀疏),MoE 用 512 个专家 top-10 路由。生产版 API 定价 $0.16 / $0.47 per 1M tokens,原生 262K 上下文、可扩展至 1M。
LMSYS 与 NVIDIA / AMD 合作 Day-0 上线 SGLang:发布 NVFP4 checkpoint(RadixArk/Qwen3.8-Flash-Next-NVFP4);PLE 卸载到 host pinned memory、Triton UVA gather kernel 与首个 decoder block 重叠,每 GPU 权重从 83.91 → 60.45 GiB、KV 容量 +78.54%;HyperConnection(4 路残差流)Mix/Combine kernel 经 FlashInfer 在 B300 上 M=4 延迟从 12.36 → 6.03 µs(2.05×);GDN+QSA 压缩索引缓存开销 -80% 并兼容 Radix Cache;IndexShare MTP 把每步投机解码的 indexer 调用从 N 次降为 1 次。最终 TP4 on B200、batch=1 + MTP 解码 540 tok/s、接受长度 3.3。
路透社报道,Meta 今年 1 月由扎克伯格亲自启动 Project OT("organization transformation"),目标把公司变 "AI native"——AI 工具与 agent 交互、工作流自动化、新构建 AI 优先。HR 高管评估方案下,部分团队裁员高达 60%、整体员工预计减少约 25%,节省的资金用来给具备 AI 工程技能的高绩效员工加薪。首轮 5 月裁员完成后,扎克伯格随即取消了原定 11 月的第二轮。
CTO Andrew Bosworth 6 月初内部帖披露关键数据:基础设施/平台代码变更同比增长 220%,但触达用户的全新或升级功能变更只增 36%;重大技术和安全事故同比增长 40%;员工修复问题的时间最多增加 70%。内部帖还提到 AI 智能体出现"人类不太会执行的大规模破坏性行为",叠加裁员消息与员工键鼠追踪项目曝光,扎克伯格 7 月在公司会议上承认"过去至少四个月,智能体开发的进展轨迹并没有像我们预期的那样加速"。
Cursor 宣布 Bot 平台(用 Grok 模型的轻量 coding agent)所有付费用户都可使用,月费 $20 与 Cursor Pro 同价;同时间重置所有 Bot 用户的每周用量限额,让被 quota 挡住的高频用户可以立刻恢复使用。