Meta Superintelligence Labs 8 月 10 日发布 Muse Glimmer,30B 参数,Apache 2.0 许可,权重已上传到 Hugging Face。定位是“始终在线的本地 agent 工作流”:量化后语言模型不到 20 GB,可运行在单张消费级 GPU 的 Mac 或 PC 上。
模型支持多模态输入、工具调用、长程推理和失败恢复。官方评测提到在 DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench 等端到端任务上取得较高成功率。SGLang 提供 Day-0 支持,LM Studio 已提供 18.16 GB 版本。Simon Willison 用 llm-coding-agent 在 Datasette 仓库上测试,模型能自主探索代码库并调用工具回答“how does auth work?”。
OpenAI 8 月 10 日扩展 Daybreak 网络防御服务,新增 Blue 和 Red 两个访问层级,并推出专用模型 GPT-5.6-Cyber。Blue 面向防御任务,提供 GPT-5.6 Sol 并移除系统级安全护栏,支持漏洞发现、恶意软件分析、事件响应;Red 面向授权漏洞研究、渗透测试,提供 GPT-5.6-Cyber。
内部评测“Advanced Cybersecurity Completion Rate”显示:GPT-5.6-Cyber 完成 95.0% 的敏感安全查询,标准 GPT-5.6 Sol 仅 1.5%,Daybreak Blue 仅 2.0%,前代 GPT-5.5-Cyber 为 57.3%。该模型已在 Chrome V8 中发现两个未知漏洞(CVE-2026-15903),并在一个流行移动操作系统中发现至少 5 个漏洞。9 月 1 日起,Daybreak 个人账户强制使用硬件安全密钥。
8 月 9 日,Claude Code 负责人 Boris Cherny 在 X 及 Y Combinator 访谈中表示,Anthropic 已将提示注入攻击“在实际使用中基本解决”。防御分三层:模型对齐训练抵抗外部恶意指令;基于可解释性(Crysola)的探测识别注入尝试中特定神经元;Auto Mode 分类器审查每个动作是否匹配用户意图。
第三方 Trajectory Labs 对 Claude Fable 5、Opus 5、Sonnet 5 各进行 720 次间接提示注入攻击,成功率为 0;同期 GPT-5.6 Sol 在 Codex Auto-review 下仍有 5.83% 成功率,Full Access 下为 19.03%。Cherny 同时透露,针对 Opus 5,Claude Code 删除了 80% 的系统提示。
a16z 8 月 10 日发布对 computer-use agent 的实测研究,基于 OSWorld-Verified 基准。Claude Fable 5 任务完成率 85%,超过人类测试者的约 72%;一年前最佳模型仅 42%。
研究列出适合自动化的任务:CRM 更新、QA 检查、政府/保险门户登录、零售订单处理、ServiceNow IT 工单等;不适合的任务包括从合同提取付款条件、保险理赔提交等难以即时验证成功的操作。成本方面,纯 screenshot 模式的前沿 agent 约 $6–8/小时,与美国后台办公工人 $30–45/小时相比有 70–80% 毛利优势,与印度 BPO ~$10/小时大致持平。生产案例:某消费品数据平台每月运行 1500–2000 万次门户交互,agent 作为自愈备份,将 scraper 维护团队减半。
阿里 Qwen 团队 8 月 9–10 日发布 Qwen-MM-Plugins,Apache 2.0 开源,定位为面向多模态 agent 的 harness 扩展库。它把图像、视频、文档、3D 处理能力打包成 skill + 可选 MCP server,支持接入 Claude Code、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI 等主流 agent 环境。
核心包提供 OCR、视觉 grounding、分割、语音识别、视觉对话、网页搜索;另有长视频记忆、视频编辑、Blender 控制、FreeCAD 工作流、教育视频生成等模块。Blender 模块支持建模、材质、灯光、渲染;FreeCAD 模块支持参数化建模、STEP/STL 导入导出、有限元分析。部分高级功能需 DashScope API key;视频/音频依赖 ffmpeg,文档可视化可能调用 LibreOffice、LaTeX、Chromium。
OpenChamber 是一个开源的 agentic 开发环境,基于 OpenCode SDK,支持 macOS/Windows/Linux 桌面、浏览器 PWA、手机(beta)和 VS Code 扩展。核心功能包括:Session Goals(设定目标后 agent 持续工作,即使应用关闭);Multi-run and Fusion(同一任务并行跑最多 5 个模型,保留最佳结果或融合最强部分);Changes Walkthrough(把大 diff 分组为有序步骤并解释);Preview(指向运行中应用的元素,自动把背后上下文发给 agent);从 GitHub issue 到 PR,失败检查自动返回;Scheduled work(按 cron 调度 prompt)。
数据留在本地,远程访问可设 UI 密码,通过 Private Relay 配对,不开放端口。项目强调“我们关注的是 harness,而非模型或提示词”。
webAI 8 月 10 日发布 TwiL-LM 系列形式逻辑模型,包括 1.7B 和 3B 两个版本,权重放在 Hugging Face,支持 Transformers 和 llama.cpp。3B 版本 TwiL-LM3 在 webAI 自研的形式推理基准中 4/5 项超过 OpenAI gpt-oss-120B:rule induction 96.4 vs 65.2,semantic parsing 87.6 vs 43.3,exact-format answering 52.0 vs 7.0;gpt-oss-120B 仅在 entailment labeling 领先(77.5 vs 68.7)。吞吐量 32.9 answers/s,是 gpt-oss-120B 12.6 的约 2.6 倍。
1.7B 版本基于 SmolLM2-1.7B 加约 72.35M 参数的 LoRA 适配器,Q4 量化后仅 1.06 GB,可在手机和 Raspberry Pi 运行。模型卡明确警告:TwiL 不是验证器,正式表达式仍可能语法有效但逻辑错误,关键决策需配合符号求解器或人工审查。
OpenRouter 8 月 10 日推出新版 Auto router,用匿名化的真实付费支出数据做模型路由。流程:轻量分类器把 prompt 分到约 30 个细粒度任务类型(代码调试、多步 agent 规划、知识问答、数学、研究报告等);然后查询过去 7 天 OpenRouter 社区在该任务上的实际 spend share,按用户设定的 cost_tier(low/medium/high/xhigh/max)选择对应成本带的模型。
为避免频繁切换导致 cache 重建浪费,还实现了“粘性”策略:多轮对话保持在同一模型,直到该模型不再是该任务的领先选择。官方给出的 MMLU Pro、τ³-bench Banking、WideSearch、DSQA、SWE-Atlas QnA 等任务的旧/新默认与最大成本对比显示,新 router 在部分任务上显著降低成本。
GitHub 8 月 10 日发布 Copilot SDK for Java 公开预览版(版本号 1.0.6-preview.1/1.0.7-preview.1),Maven 坐标 com.github:copilot-sdk-java。要求 Java 17+,推荐 JDK 25 以自动启用虚拟线程。SDK 通过 JSON-RPC 与 GitHub Copilot CLI 通信,支持创建 Copilot session、注册工具、发送 prompt、接收结构化响应和流式事件。
提供 @CopilotTool 和 @CopilotToolParam 注解定义工具,BYOK 支持使用自有 OpenAI/Anthropic/Azure 等 API key。微软在 Build26 的演示用 Jakarta EE 11 + Open Liberty 26.0.0.5 + PrimeFaces 搭建了一个房产线索管理 agent pipeline,展示并发虚拟线程 agent。
Antigma Labs 的 Ante 是一个用 Rust 写的编码代理,alpha 阶段,预构建二进制约 15MB,零运行时依赖,支持 macOS/Linux(Windows 建议 WSL)。内置 llama.cpp,可通过 --offline-model 指定 GGUF 文件完全离线运行。
支持交互式 TUI、headless 一次性任务、server 模式(JSONL)、gateway 模式(Slack/Discord 机器人)、子代理编排、自定义 skills、MCP、跨会话持久内存。官方在 Terminal-Bench 2.1 上跑 89 个任务各 5 次,使用 DeepSeek V4 Flash 0731 得到 82.7%(368/445),与 DeepSeek 官方报告一致,推理成本约 $68。相比 Claude Code 跑 20 个并行 Docker 任务,Ante 峰值内存约 1/7、平均 CPU 约 1/9、磁盘 I/O 约 1/5。