2026年7月17日 · 来源 aihot.virxact.com · 时间窗:过去 48 小时(2026-07-15 08:45 至 2026-07-17 08:45,UTC+8)
01

Grok 推出 Automations 功能:定时或邮件触发,自动执行任务并汇报结果

xAI:News · 3 小时前
xAI 为 Grok 加入 Automations。用户描述一次任务后,Grok 可按计划(一次 / 每日 / 工作日 / 每周 / 每月 / 每年)或邮件触发(按发件人、收件人、主题过滤)自动运行。每次执行是一次完整对话,结果保存到运行历史,支持邮件或应用内通知。定时自动化对所有用户开放;邮件触发需 SuperGrok 订阅。
为什么值得关注
把 LLM 从"对话"推进到"可编排的自动化工人"。对需要定时报告、邮件处理、重复流程的开发者,它提供了一种无需搭建自有 cron/服务器的低摩擦方案。
https://x.ai/news/grok-automations
02

OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性

OpenAI:官网动态 · 7月15日
OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
为什么值得关注
红队测试从人工外包走向自动化模型,安全/对齐评估的成本结构和速度会因此改变。对构建 LLM 应用的团队,这提示未来可能需要把"自动对抗测试"纳入 CI/CD,而不是只在发布前做一次人工审计。
https://openai.com/index/unlocking-self-improvement-gpt-red
03

企业AI智能体评估存在"现实对齐"缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障

VentureBeat:AI · 8 小时前
VentureBeat 对 157 家企业进行调研。50% 的组织在过去一年曾部署通过内部评估、却导致客户故障的 AI 智能体或大语言模型功能。仅 5% 的企业完全信任自动化评估;29% 认为评估与现实结果对齐不佳是最大局限。尽管如此,66% 的企业已允许或正计划在 12 个月内让低风险智能体实现全自动、无人工干预部署。
为什么值得关注
数据直接指出"测试覆盖 ≠ 真实世界表现"。对准备上线 AI 智能体的团队,评估体系必须从"内部测试通过"转向"持续对齐真实用户反馈",否则自动化部署反而放大故障半径。
https://venturebeat.com/ai/the-agent-evaluation-gap-enterprise-ai-organizations-have-a-reality-alignment-problem-not-a-coverage-problem-and-most-are-shipping-to-production-anyway
04

54%企业已遭遇AI智能体安全事件,多数仍共享凭证

VentureBeat:AI · 6 小时前
VentureBeat 调查 107 家企业。54% 已遭遇 AI 智能体安全事件(18% 确认事故,36% 险些酿祸)。仅 32% 为每个智能体分配独立身份凭证;30% 将高风险智能体隔离在沙箱中。安全工具主要依赖模型提供商原生方案,专用智能体安全产品渗透率极低。
为什么值得关注
智能体数量增长快于安全基础设施。对开发者和安全团队,身份最小权限、沙箱隔离、专用安全监控不再是可选项,而是部署前的必要项。
https://venturebeat.com/ai/the-agent-security-gap-54-of-enterprises-have-already-had-an-ai-agent-incident-and-most-still-let-agents-share-credentials
05

在 Claude Cowork 中使用 Claude Fable 5

Claude:Blog · 10 小时前
Anthropic 发布通用模型 Claude Fable 5,定位"最强通用模型",专为长时间、多步骤、复杂异步工作设计。它可在 Claude Cowork 中自主执行深度研究、尽职调查等任务。该模型需要手动选择,默认模型仍为 Claude Sonnet 5。
为什么值得关注
模型能力从"即时回答"延伸到"长期后台任务"。对需要数小时甚至数天才能完成的调研、分析、代码重构工作流,Fable 5 提供了一种模型即异步工作者的形态。默认不启用也表明 Anthropic 对自主运行的风险持谨慎态度。
https://claude.com/blog/working-with-claude-fable-5-in-claude-cowork
06

Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

Moonshot AI:Kimi Blog · 6 小时前
Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,显示模型更多是猜测而非真正感知。
为什么值得关注
多模态模型在视觉"理解"上的能力被高估了。对做视觉应用、Agent 视觉感知、UI 自动化或多模态 RAG 的团队,这个基准提供了具体的能力断裂点清单,可帮助避免在产品中误用模型。
https://www.kimi.com/blog/perception-bench
07

面壁智能开源企业AI数字员工平台StaffDeck

X:面壁智能 OpenBMB (@OpenBMB) · 12 小时前
面壁智能联合多团队开源 StaffDeck,一个用于构建与管理企业数字员工的平台。该平台旨在将专业知识、标准作业程序(SOP)和决策规则转化为持续工作、改进并保留组织知识的数字员工,而非传统聊天机器人。项目代码已发布在 GitHub。
为什么值得关注
企业级数字员工从"对话式客服"转向"可执行、可记忆、可协作的自动化角色"。对有内部流程需要自动化的团队,StaffDeck 提供了一个可二次开发的开源底座,重点在于把 SOP 结构化而不是简单 prompt 工程。
https://x.com/OpenBMB/status/2077741814799548451
08

Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查

MarkTechPost · 17 小时前
Patter SDK 发布教程,演示如何构建餐厅预订场景的语音智能体工作流。流程支持动态调用变量、注册可调用工具、应用输出护栏(PII 脱敏、脏话过滤、话题范围限制),可在无需实时电话凭证的情况下运行脚本化通话模拟。教程还涵盖延迟与成本指标追踪、回归式评估检查,以及将智能体逻辑、工具调用、安全检查和通话模拟整合为单一结构化管线。
为什么值得关注
语音 agent 的工程化难点不在模型对话能力,而在护栏、延迟和评估。Patter SDK 把这些环节做成可测试的管线组件,对做 voice agent 或实时交互 agent 的团队,"脚本化通话模拟"让你在没有真实电话的情况下也能跑回归测试。
https://www.marktechpost.com/2026/07/16/patter-sdk-guide-to-building-a-restaurant-booking-phone-agent-with-dynamic-variables-guardrails-latency-dashboards-and-eval-checks
09

HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

公众号:小红书技术(dots.llm) · 15 小时前
小红书联合北大、上交提出 HYPIC,首个在混合注意力大模型上实现位置无关缓存的系统。首 token 延迟平均降低 3.25 倍,在 4 个生产级模型上同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。
为什么值得关注
KV cache 复用是降低推理成本的关键手段,但混合注意力架构(如 Sliding Window + Full Attention)此前无法做位置无关缓存。HYPIC 打破了这个限制——对用 Qwen3、MiniCPM 等混合注意力模型做推理服务的团队,同样的硬件能扛更多并发,或同样的延迟下成本更低。
https://mp.weixin.qq.com/s/RWveWvw9yBH6YQINBQ-XjA
10

Gemini Enterprise Agent Platform 新增 Parallel Web Search 网络接地提供商

Google Developers Blog · 15 小时前
Google Cloud 与 Parallel Web Systems 合作,将 Parallel 的搜索基础设施作为新的网络接地提供商原生集成到 Gemini Enterprise Agent Platform 中。开发者能将 AI 智能体锚定在可验证的实时网络结果上,提升企业工作流的事实准确性。用户还可编程提取、永久缓存并与其他大语言模型一起处理网络数据。
为什么值得关注
Agent 的"接地"问题——生成内容如何锚定到可验证的事实来源——是企业落地的核心卡点。Google 把第三方搜索基础设施做成可插拔的接地提供商而非绑定 Google Search,给了企业更多选择权。"可编程提取 + 永久缓存 + 跨 LLM 处理"意味着网络数据可被预处理和复用,不必每次查询都重新抓取。
https://developers.googleblog.com/expanding-choice-in-gemini-enterprise-agent-platform-introducing-grounding-with-parallel-web-search