2026-08-28 · 来源 aihot.virxact.com · 时间窗:过去 48 小时

01诱饵 zip 打穿 Claude Code 自动模式:安全研究员称成功率 80%,Simon Willison 转述细节

agent 安全coding agentSimon Willison 博客(研究:Johann Rehberger)· 2026-08-28 06:50 北京时间

安全研究员 Johann Rehberger 公开一种针对 Claude Code 自动模式的攻击:把恶意代码藏进 zip 压缩包,诱骗处于自动批准状态的 Claude Code 下载并解压,本地代码随即被执行。据其测试,成功率 80%。Simon Willison 在博客转述并讨论了这条攻击链。

背景是 Claude Code 已在 8 月中旬把自动模式设为默认。自动批准省掉的是确认对话框,一起省掉的还有"下载—解压—执行"这条路径上的人工检查点。

为什么值得关注这是把 harness 信任边界当攻击面的典型案例。开着 auto mode 的人现在至少要做两件事:把网络下载和解压操作从自动批准范围里摘出来单独确认;对解压产物考虑隔离目录或沙箱执行。提示词层面写"请勿下载可疑文件"挡不住这种链路。

02Anthropic 发布模型硬件标准 MHS 研究预览:统一驱动操控显微镜与机械臂,实验室集成从数周缩到数小时

agent 平台标准化Anthropic Newsroom + Ars Technica · 2026-08-28 02:04 / 06:15 北京时间

Anthropic 与 HHMI Janelia 合作推出模型硬件标准(Model Hardware Standard)研究预览第一阶段。MHS 用标准化驱动加自然语言标签做设备发现与安全控制,让 agent 并行操作显微镜、液体处理器、机械臂这类实验室设备,官方称实验集成时间从数周缩短到数小时甚至数分钟。

控制机制留了三条通道:MCP、命令行、代码文件。AWS、Hugging Face、Raspberry Pi 已在其列,标准最终会开源。

为什么值得关注MCP 解决的是"agent 连软件",MHS 想解决"agent 连设备"——如果成立,实验室自动化、产线巡检这类场景的接入成本会从项目级降到配置级。做硬件方向 agent 的团队值得现在就去读它的驱动与安全控制分层;纯软件团队也可以观察"语义标签+能力声明"这套设备描述会不会反过来影响工具生态的设计。

03Claude Code v2.1.248 上线 --restricted 受限模式:砍掉内置工具、无视本地设置文件

coding toolharness 工程Claude Code GitHub Releases · 2026-08-28 06:12 北京时间

v2.1.248 新增 --restricted 受限模式:移除运行命令/代码、WebFetch 等内置工具,并忽略用户、项目和本地三层设置文件。同版带跨会话消息能力。此前一晚的 v2.1.247 加了 SendFeedback 工具,在会话出错时草拟反馈报告供人审查。

受限模式的指向很明确:在不可信环境里跑 agent,光靠提示词和权限确认不够——设置文件本身就可以是攻击载荷。

为什么值得关注和今天第一条(自动模式攻击)连起来看,Anthropic 在把安全从"提醒用户"挪进"产品默认结构"。clone 别人仓库跑 agent 的场景,以后标准动作应该是 --restricted 起步再按需放行。自建 agent 流水线的团队可以对照检查自己的工具暴露面:哪些工具默认开、哪些设置文件会被自动加载,都是可被利用的入口。

04扫描 6214 个企业域名:120 个 llms.txt 把 coding agent 指向未注册代码包,clerk.com 已被真实攻击利用

供应链安全coding agentArs Technica · 2026-08-27 22:00 北京时间

研究人员扫描了 6,214 个企业域名,发现 120 个 llms.txt 文件指向未注册的代码包或域名——agent 读文档装包时会照单全收。概念验证里,Claude、OpenAI Codex 和 Nous Research Hermes 三款编码智能体一小时内就从财富 500 强公司网络回传了信号,共收到数十次响应。

这不是纯理论:至少一起真实攻击已经利用该机制,通过 clerk.com 上的恶意 npx 命令分发活跃恶意软件。

为什么值得关注llms.txt 把"文档"变成了 agent 的依赖解析来源,也就把这条链交给了任何能改文档的人。企业该做两件事:审计自家 llms.txt 和公开文档里出现的包名是否全部已注册;给 agent 的装包动作加版本锁定和 registry 校验。在幻觉包名抢注(slopsquatting)之后,"文档指向未注册包"是同一族的新变种。

05EvoMal 攻击实测:共享技能库被投毒后六款模型自毒率最高 41.8%,恶意技能自己复制 4.9-9 倍

skill 安全skill 评测X:Elvis Saravia(DAIR.AI)· 2026-08-27 23:42 北京时间

新研究演示了共享技能库的投毒路径:把恶意技能(EvoMal)植入库中,agent 把它当模板复制并运行,完成自我中毒。在 153 个 SWE-bench Verified 任务上,六款模型的自毒率落在 20.3%-41.8%;污染库里检测到的恶意技能数量是初始植入量的 4.9-9.0 倍——agent 在互相复制时把恶意技能扩散了。

清理也不彻底:删光所有植入技能无法根除污染。研究给出的反提示词方案能把自毒率压到 6.7%,任务完成度没有显著损失。

为什么值得关注skill 市场、团队共享库第一次有了量化的投毒数据,而且数字不低——最差情况下四成运行会被传染。维护 skill 库的人该把"入库扫描 + 来源白名单"当标配,并且默认一次污染是库级事故而不是单文件事故。和 8/26 的 ACES(技能文档评分与运行时收益几乎零相关)放在一起看,skill 评测的维度清单里现在必须加上安全这一列。

06SWE Refactor Bench:520 次全仓重构运行只有 28 次存活,13/20 任务无人通过

评测基准coding agentX:Kim(@kimmonismus)· 2026-08-26 16:36 北京时间

Einsia 发布 SWE Refactor Bench,专测编码智能体做全仓库系统迁移的能力:C→Rust、Maven→Gradle 这类。20 个任务覆盖 SQLite、zlib 等真实项目,每项要过三阶段评估。520 次运行里只有 28 次全部通过,存活率 5.4%;13 个任务没有任何系统做成。

这和 SWE-bench 式"定点修 bug"是两种难度:全仓迁移要求跨文件一致性、构建系统适配和测试存活性同时成立。

为什么值得关注5.4% 是给"让 agent 做大迁移"预期的校准数字——现阶段 agent 适合当迁移流水线的部件(codemod 生成、逐模块验证),不适合整仓自动交付。做评测的人可以参考它的三阶段设计:过程分关卡,而不是只看最终 diff。

07JIT-Agent:一个"输出物是智能体框架"的模型,按任务现场合成 harness 还能自我进化

harness engineering论文研究X:Elvis Saravia(DAIR.AI)· 2026-08-28 03:24 北京时间

JIT-Agent 把智能体框架形式化成固定四模块协议——记忆、规划、行动、工具编排,模型的任务是为任意现成 agent LLM 即时合成一套框架。合成不是终点:执行中它能修复框架缺陷,并通过蒸馏历史配置的性能信号持续自我进化。

为什么值得关注harness 工程的两条自动化路线正好凑成一组——前两天报过的 AutoSaddler 对现成框架离线打补丁,JIT-Agent 干脆按任务现造。如果框架能按任务合成,"选 LangGraph 还是 Claude Agent SDK"会慢慢变成"选哪个框架生成器、给什么性能信号"。做 harness 的人,它的四模块切分是一份现成的形式化参考。

08阿里 Scroll:上下文管理改成"查询时决策",工具输出绑进持久化 Python 内核,BEAM 73.1 分

harness engineering上下文管理X:Rohan Paul · 2026-08-27 06:08 北京时间

阿里 Scroll 把上下文管理的决策点从写入时挪到查询时:会话存成追加式事件日志,工具输出不再塞进提示词,而是绑定到持久化 Python 内核的变量上,要用的时候再查。以 Qwen3.8-Max 为骨干,在 BEAM 历史任务上拿到 73.1 分,高于现有记忆系统公开配置的 68.0。

为什么值得关注"别把上下文全塞进窗口"这条线上,Scroll 走得比记忆库更远——它把状态放进了可执行内核,上下文即代码。对跑跨天任务、大仓库维护的 agent,查询时重建比全量携带省 token,事件日志还顺带解决了审计。值得拿自家最长的那个 agent 任务对比测一轮。

09阿里 Qoder 重新定位:从 AI 编程工具升级为智能体工作台,权限分级 + 工具白名单 + 跨会话记忆

coding 工具国内动态IT之家 · 2026-08-27 13:57 北京时间

阿里发布全新 Qoder,产品定位从 AI 编程工具改成面向所有人的智能体工作台,核心工作对象从代码工程换成智能体任务。官方介绍它采用 Harness 技术,支持长链路自治、分级权限与工具白名单、跨会话长期记忆。

为什么值得关注IDE 厂商正在集体换叙事——代码是 agent 的产物,人管的是 agent。Qoder 把权限分级和工具白名单做成产品级功能,等于把 harness 控制直接卖给你,做内部 agent 平台的团队可以直接对标它的权限模型补自家设计。国内这条线(对照此前的 AgentSky、Cursor Agent Swarm)已经从单点功能进入平台化阶段。

10据报道英伟达拟以约 129 亿美元收购 Hugging Face:开源模型分发层要换主人

行业格局开源生态Ars Technica · 2026-08-28 03:55 北京时间

Ars Technica 报道,英伟达正推进以约 129 亿美元收购模型托管平台 Hugging Face,交易尚未最终敲定,但双方都在积极推动。Hugging Face 至今未盈利,却是开放权重模型存储与下载的核心基础设施。若成交,英伟达在开源模型生态的话语权将再上一级,其云 AI 业务也可能借势重启。

为什么值得关注模型分发层归入一家芯片公司之后,可及性、license 中立性、数据集与榜单治理都会被重新定价——今天 HF 上"中立货架"的角色是生态默认假设,不是永恒事实。依赖 HF 做分发、评测或训练数据的团队,现在就该评估备份镜像和替代渠道。交易未落地,后续走向需核查。