微软发布 Opal:你只说一个目标,Copilot 在云电脑里连干几小时,表格 PPT 一次交付完

微软 Project Opal 长任务 AI 智能体在 Windows 365 云电脑中连续执行办公任务、外侧有监督模型校验的概念插画
内容摘要

微软给 Microsoft 365 Copilot 加了 Project Opal:你交代一个目标,它就在专属云电脑里连续工作数小时,自己找素材、做表格、出 PPT 再发到 Teams。本文讲清它的三层安全架构、真实省时数据、上手步骤和明显短板,帮你判断这个"长任务 Agent"该不该进你的工作流。

过去你让 Copilot 干活,是一次一次地问;现在微软想让它接一个目标,然后自己干到交付完。

9 月 7 日,微软 CEO 萨提亚·纳德拉在 X 上发布了 Project Opal——一个挂在 Microsoft 365 Copilot 下面的新能力。它的定位很直白:在可控、可追踪的环境里,规划和执行那些复杂、长周期的工作任务。官方给的描述是,用户交代完任务之后,它可以连续工作数小时甚至数天,自己把”找素材、做表格、生成 PPT、发给同事”这一整套流程跑完。

这不是又一个”帮我写个摘要”的功能。它换的是 Copilot 的产品形态。

它干活的流程,和你想的不太一样

先说最容易被忽略的一点:Opal 不是一个在你电脑上跑的助手。

使用路径是这样的——你在桌面版或网页版的 Microsoft 365 Copilot 里进入 Frontier 模块,把任务要求写清楚,点 Start。系统会先生成一份执行计划,然后启动一台专用的 Windows 365 云电脑,由推理模型调度 Edge 浏览器去完成具体操作。

也就是说,真正在干活的是一台云端虚拟机,而不是你正在用的这台笔记本。这个设计看起来绕,但它是整套安全逻辑的地基,后面会讲。

技术层面的关键点是:Opal 用高级推理模型把自然语言请求翻译成一份动态计划,并且会随着任务进展去调整工具调用的顺序。它强调的不是”一次答得漂亮”,而是”过程中能改道”。

一个官方案例:一个月的相机影像,变成一套交付物

纳德拉展示的那个例子挺能说明问题。

任务背景是分析一个月的户外相机影像。Opal 拿到这个目标后做的事是:

  • 浏览全部素材,找出所有动物出现的画面
  • 从里面挑出表现较好的片段,剪成一支精选视频
  • 为每条动物记录补上相机来源、拍摄日期、物种标签
  • 把全部记录汇入一张电子表格,方便检索和统计
  • 资料整理完之后,生成一份 PowerPoint 概述处理结果
  • 最后把视频、表格和演示文稿一起分享到 Teams,供团队查看和审核

注意这里面有几个不同性质的动作:看素材是理解,剪视频是创作,填表是结构化,出 PPT 是汇总,发 Teams 是对外协作。Opal 要做的不是其中一步,是把五种动作串成一条链,而且中途不需要你回来点确认。

这也是”长任务 Agent”和普通对话式 AI 最本质的区别——后者的产出是内容,前者的产出是一件已经落地的事

三层安全架构:微软走的是”能管住”这条路

这才是 Opal 真正的重点,也是它和其他 Agent 产品分道扬镳的地方。

微软给它套了三层:

第一层,隔离执行环境。 每个任务跑在专属的 Windows 365 Cloud PC 实例里,和你本人的电脑、和公司内网是隔开的。出了问题,脏的是那台虚拟机。

第二层,独立部署的监督模型。 干活的是一个模型,盯着的是另一个模型。监督模型实时校验每一步操作,这相当于给 Agent 配了个”带班师傅”。

第三层,管理员默认关闭 + 域名白名单。 功能上线时是默认禁用的,必须由 IT 管理员主动开启;能访问哪些网站,由白名单限定死。

这套组合的取向非常清楚。同赛道上,Anthropic 在 ant apply 里把 Agent、技能、环境都变成仓库文件,走的是”配置即代码”;GitHub Copilot 在 9 月初让 代码审查可以放行 PR,思路是”给 Agent 提权,但每一步留痕”。而 Opal 的姿态更保守:先把笼子造好,再放它出去干活。

微软内部测试给出的数据是,工程师处理常规审计任务时,每周最多能省下 20 小时。已经在早期预览里的场景包括季度合规审计、群组成员申请、工时表与休假申请,以及新员工入职——你会发现这些活有个共同点:规则明确、步骤很多、但每一步都不难。 这正好是 Agent 的舒适区,也正好是人类最烦的活。

想上手,要知道这几点

现阶段 Opal 的门槛不低,几个事实先摆清楚:

  • 只对加入微软 Frontier 计划的授权客户开放
  • 默认禁用,需要 IT 管理员手动开启
  • 还处在早期开发阶段,微软自己提示后续版本可能有较大范围的功能迭代

如果你在符合条件的企业里,上手路径大概是:确认管理员已开启 Opal → 在 Microsoft 365 Copilot 的 Frontier 模块里描述任务 → 检查它生成的执行计划 → 设定好域名白名单和操作边界 → 点 Start,然后定期回来看进度。

这里有个实操建议:第一批别拿核心业务试。 先挑一个可回滚、可复核的低风险活——比如整理一份周期性报告,或者把一批文档按规则归档。等你看过它几次的完整操作日志、确认它不会乱点乱发,再往上报权限。

和同类比,差在哪

把它放回 9 月的 Agent 产品谱系里,位置会比较清楚:

  • Meta Muse 比:Muse 面向个人,能替你订机票、发邮件、刷卡下单,但每一步都要你先点头;Opal 面向企业,是”你点一次头,它连干几小时”。授权粒度完全不同。
  • Cursor 自托管机器 比:那个解决的是”代码不出内网”,服务的是研发场景;Opal 服务的是办公室里的知识工作。
  • 和微软自己的 Project Zenith 比:Zenith 是在改操作系统,让开发者开箱即写代码;Opal 是在改办公套件,让 Office 能自己交付成品。两条线一硬一软,说的是同一件事——微软在把 Agent 塞进它已有的每一层。

真正的短板也很明显:它只在微软的生态里跑。 云电脑是 Windows 365,浏览器是 Edge,交付物落在 Office 和 Teams 上。这对纯微软栈的企业是优点,对混合栈的团队就是新的孤岛。而且”数小时到数天”这个时间尺度,意味着你没法盯着它,只能信任它的计划和日志——信任这件事,短期内还是得靠小任务一点点攒。

老达点评

第一,”给目标、交成品”正在成为办公 Agent 的标准动作,这比跑分重要。 过去两年我们习惯用”这个模型答得好不好”来评价 AI,但 Opal 这类产品的评价标准换了:任务有没有真的完成、中途要不要人插手、出了问题能不能回溯。这个转变对做 AI 应用的人来说是信号——你卖的不该是模型能力,是一条能跑通的流程。

第二,微软把”能管住”当成了卖点,这个选择很聪明。 企业客户怕的从来不是 AI 不够聪明,是 AI 太主动。隔离环境、监督模型、默认关闭、域名白名单,这四样加起来其实是在回答采购部门最关心的那个问题:”它闯祸了怎么办?”把答案写进产品架构里,比写进 PPT 里有用得多。

第三,也是最实际的一条:先别急着给 Agent 松绑。 站内前阵子写过 GitSpawn 恶意仓库攻破 7 款 AI 编程工具,也写过 Meta 内部 Agent 的越权隐患,这些事故的共同点是——没人当场发现。 Opal 的三层架构是个好示范,但它在早期开发阶段,规则一定还会改。真要用,就把权限白名单和人工复核这两件事自己做扎实,别把”可审计”当”已安全”。

想系统看这条线的更多内容,可以走 AI 智能体与自动化专题AI 工具评测专题;如果你更关心”办公场景里 AI 到底能替掉多少活”,老达AI实践专题 里的实操记录可以一起看。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *