Andrew Ng 发布 OpenWorker——MIT 许可的开源桌面 AI 智能体,核心理念是"交付成品而非对话"。用户描述一个结果(如"发一封包含实际数据的 Slack 回复"或"更新日历"),OpenWorker 自行拆解步骤、跨本地文件和已连接应用执行,在执行有副作用的操作前会请求授权。
架构四层:Tauri 2 + React 18 桌面壳、Python FastAPI 本地 agent 服务器(默认 127.0.0.1:8765)、能力与连接器层(文件/git/ripgrep/shell/MCP)、模型路由器(基于 aisuite)。代码量约 119 个 Python 文件(~32,400 行)+ 149 个 TS/TSX 文件。支持 30 个精选模型(GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash、DeepSeek V4、Kimi K2.6 等)+ Ollama 本地模型。
权限引擎是工程核心:每次工具调用分为 read / write_local / exec / external 四个风险等级,对应 discuss / plan / interactive / auto / custom 五种权限模式。Shell 命令永远需要确认。内置 prompt injection 防御——所有来自工具、日志、文件的内容被视为不可信数据而非指令。
为什么值得关注
OpenWorker 做了一件大多数桌面 agent 项目跳过的事:把权限管理当类型系统来设计。四风险等级 + 五权限模式不是 UI 层面的弹窗确认,而是写在 agent 架构里的约束层——shell 命令永远要人确认,external 操作永远走 Inbox 审批。对做 agent 架构的团队,这套权限模型可以直接参考。30 个精选模型 + aisuite 路由器意味着不绑死任何供应商,Ollama 支持意味着完全离线可用。MIT 许可 + 全部本地运行的隐私模型(密钥不进入模型上下文)对合规要求高的团队是硬需求。对比 Claude Cowork 的录屏转 Skill(门槛低但能力受限于录屏质量),OpenWorker 的代码级架构更适合有工程能力的团队做二次开发。