安全研究员 Johann Rehberger 公开一种针对 Claude Code 自动模式的攻击:把恶意代码藏进 zip 压缩包,诱骗处于自动批准状态的 Claude Code 下载并解压,本地代码随即被执行。据其测试,成功率 80%。Simon Willison 在博客转述并讨论了这条攻击链。
背景是 Claude Code 已在 8 月中旬把自动模式设为默认。自动批准省掉的是确认对话框,一起省掉的还有"下载—解压—执行"这条路径上的人工检查点。
Anthropic 与 HHMI Janelia 合作推出模型硬件标准(Model Hardware Standard)研究预览第一阶段。MHS 用标准化驱动加自然语言标签做设备发现与安全控制,让 agent 并行操作显微镜、液体处理器、机械臂这类实验室设备,官方称实验集成时间从数周缩短到数小时甚至数分钟。
控制机制留了三条通道:MCP、命令行、代码文件。AWS、Hugging Face、Raspberry Pi 已在其列,标准最终会开源。
v2.1.248 新增 --restricted 受限模式:移除运行命令/代码、WebFetch 等内置工具,并忽略用户、项目和本地三层设置文件。同版带跨会话消息能力。此前一晚的 v2.1.247 加了 SendFeedback 工具,在会话出错时草拟反馈报告供人审查。
受限模式的指向很明确:在不可信环境里跑 agent,光靠提示词和权限确认不够——设置文件本身就可以是攻击载荷。
研究人员扫描了 6,214 个企业域名,发现 120 个 llms.txt 文件指向未注册的代码包或域名——agent 读文档装包时会照单全收。概念验证里,Claude、OpenAI Codex 和 Nous Research Hermes 三款编码智能体一小时内就从财富 500 强公司网络回传了信号,共收到数十次响应。
这不是纯理论:至少一起真实攻击已经利用该机制,通过 clerk.com 上的恶意 npx 命令分发活跃恶意软件。
新研究演示了共享技能库的投毒路径:把恶意技能(EvoMal)植入库中,agent 把它当模板复制并运行,完成自我中毒。在 153 个 SWE-bench Verified 任务上,六款模型的自毒率落在 20.3%-41.8%;污染库里检测到的恶意技能数量是初始植入量的 4.9-9.0 倍——agent 在互相复制时把恶意技能扩散了。
清理也不彻底:删光所有植入技能无法根除污染。研究给出的反提示词方案能把自毒率压到 6.7%,任务完成度没有显著损失。
Einsia 发布 SWE Refactor Bench,专测编码智能体做全仓库系统迁移的能力:C→Rust、Maven→Gradle 这类。20 个任务覆盖 SQLite、zlib 等真实项目,每项要过三阶段评估。520 次运行里只有 28 次全部通过,存活率 5.4%;13 个任务没有任何系统做成。
这和 SWE-bench 式"定点修 bug"是两种难度:全仓迁移要求跨文件一致性、构建系统适配和测试存活性同时成立。
JIT-Agent 把智能体框架形式化成固定四模块协议——记忆、规划、行动、工具编排,模型的任务是为任意现成 agent LLM 即时合成一套框架。合成不是终点:执行中它能修复框架缺陷,并通过蒸馏历史配置的性能信号持续自我进化。
阿里 Scroll 把上下文管理的决策点从写入时挪到查询时:会话存成追加式事件日志,工具输出不再塞进提示词,而是绑定到持久化 Python 内核的变量上,要用的时候再查。以 Qwen3.8-Max 为骨干,在 BEAM 历史任务上拿到 73.1 分,高于现有记忆系统公开配置的 68.0。
阿里发布全新 Qoder,产品定位从 AI 编程工具改成面向所有人的智能体工作台,核心工作对象从代码工程换成智能体任务。官方介绍它采用 Harness 技术,支持长链路自治、分级权限与工具白名单、跨会话长期记忆。
Ars Technica 报道,英伟达正推进以约 129 亿美元收购模型托管平台 Hugging Face,交易尚未最终敲定,但双方都在积极推动。Hugging Face 至今未盈利,却是开放权重模型存储与下载的核心基础设施。若成交,英伟达在开源模型生态的话语权将再上一级,其云 AI 业务也可能借势重启。