当AI开始用「假员工」训练自己:微软合成计算机研究的深层含义

当AI开始用「假员工」训练自己:微软合成计算机研究的深层含义

训练一个能真正干活的AI助手,有多难?

答案不只是模型本身的问题,而是一个数据问题。真实的、长周期的、带有专业判断的工作轨迹——比如一个财务顾问如何在一个月内完成投资组合更新——几乎不可能被大量收集。这些数据要么在企业内部受保护,要么采集成本极高,要么根本不存在,因为这类AI工具本身还没被广泛使用。

这是一个自相矛盾的困境:要训练有用的AI,需要真实数据;但真实数据无法获取,因为工具还不够有用。

微软研究院今年四月发表的一篇论文,尝试给这个问题一个出人意料的答案——合成一切


不是合成数据,是合成整个工作世界

这篇论文的标题是《Synthetic Computers at Scale for Long-Horizon Productivity Simulation》,作者是 Tao Ge、Baolin Peng、Hao Cheng 和 Jianfeng Gao。核心思路并不复杂:与其费力收集真实的工作轨迹,不如用AI生成一整套虚拟的工作环境,然后在上面训练AI。

具体做法分两步。

第一步,为一个虚拟用户生成一台完整的「假电脑」。这不是随便创建几个文件夹,而是根据用户画像构建一整套真实感:职业身份、工作习惯、文件命名风格、常用的软件环境、真实的项目历史。论文里举了一个具体的例子:一位名叫 Margaret Forsythe 的资深财务顾问,在丹佛一家财富管理公司工作,手上有五个并行项目,每个项目背后都有一条依赖链——比如一份资产配置表依赖于之前下载的 Vanguard 白皮书,一份客户再平衡方案又依赖于那份配置表。

这台合成计算机里塞满了这种有机关联的文件:Word 文档、Excel 表格、PDF 报告、PPT 演示稿。文件的格式、内容和专业程度,都经过刻意设计——论文作者使用了多个文档生成工具(Anthropic 的文档技能,以及 minimax-docx、minimax-xlsx 等)来确保这些文件读起来像真实的工作产物,而不是随便生成的占位符。

更关键的是,这台假电脑里不只有文件,还有「人」。作者设计了一组模拟协作者——上司、同事、客户、合规官——每个人都有自己的沟通风格和私有的参考文件。有些文件里还埋了陷阱:某个客户账户报表里藏着 1.7% 的配置差异,某个费用比率用的是基点而不是百分比。这些细节是故意埋进去的,用来测试 AI 是否真的能发现问题,而不是走个流程交差了事。

第二步,用两个 AI agent 在这台假电脑上完成一个月的模拟工作。一个 agent(用 Claude Opus 4.6)负责设定任务目标——为这个用户创建大约五个真实的工作交付物,每个都附带时间线和里程碑。另一个 agent(用 Claude Sonnet 4.6,通过 Claude Code SDK 运行)扮演那个用户,一路操作文件系统、协调假同事、产出假文档,直到任务完成。

模拟的结果相当惊人:每台合成计算机平均生成约 197 个文件,模拟一次需要 8 小时以上的 AI 运行时间和 2000 多次交互轮次。这相当于一个真实员工整整一个月的工作量——完全由 AI 自己生成,自己完成。


为什么这个思路值得关注

表面上看,这是一个工程突破:微软解决了 AI agent 训练数据不足的问题。但往深一层看,这件事的意义不止于数据。

它重新定义了「训练数据」的边界。

过去谈 AI 训练数据,默认是人类的作品:人类写的文章、人类拍的照片、人类做的代码提交。这是 AI 领域几十年的基本假设——数据来自人类经验的沉淀,模型从中学习。而合成计算机的方法,把这个链条打断了一环:数据来自 AI 生成的工作环境,模型从中学习的是「执行工作」的能力,而非「理解人类表达」。这不是用 AI 生成文本训练语言模型那种做法——这里的合成不是内容的复制,而是整个任务情境的重构。

它暴露了一个更根本的循环:AI 在学习成为 AI 的替代者。

模拟财务顾问的工作,用的是 AI;完成这些模拟任务,最终目的是训练出能替代财务顾问部分工作的 AI。整个过程里,人类的参与被压缩到了最初的 persona 描述——一个「财务顾问,专注财富管理」——之后所有东西都由 AI 自我生成。人类提供的是框架,AI 填充的是内容,再由 AI 消化内容。

这和 AlphaZero 的自我博弈有本质区别。AlphaZero 玩的是封闭规则系统:棋类游戏的胜负条件是明确的,不需要模拟真实世界的复杂性。而真实的工作世界充满歧义——文件格式不统一、协作者措辞暧昧、需求本身可能存在内部矛盾——合成这些歧义,本身就是一个极具挑战的任务。论文的作者们也承认,他们离模拟真实的知识工作还差得远。

但这个方向本身,是有方向感的。

论文指出了一个 scaling 路径:只要有足够的算力,理论上可以从 1000 台合成计算机扩展到百万级、亿级——因为 persona 的来源是人类社会本身,而人类的职业、工种、工作场景几乎是无限的。这意味着,合成计算机不只是解决当下数据短缺的临时方案,而是指向一种可持续扩展的路径:AI 发展的速度,将越来越取决于合成数据的质量和规模,而非人类数据的存量。


数字员工的前置条件

这篇论文的实验结果本身也很有意思。

论文对比了 baseline(纯模拟,无额外技能增强)和 skill-augmented variants(加入了文档生成、网页搜索等外部技能)的表现。结果很明确:skill augmentation 带来了显著提升,而且这个提升在 out-of-domain 的任务上依然有效——也就是说,agent 学到的是可迁移的工作能力,不只是在特定模拟环境里刷分。

但值得注意的是,即便在最有利的设定下,模拟质量仍然是瓶颈。作者在论文里承认,合成文件和真实文件之间存在可感知的差距——语言模型的输出在风格和细节密度上,还不能完全复刻真实的商业文档。更重要的是,模拟中涉及的人际互动高度简化:假同事的回复、假客户的反馈,都是预设的 prompt,无法反映真实职场中那些模糊的、非线性的沟通。

换句话说,当前的合成计算机训练,更像是让 AI 在一个「简化版职场」里练习。简化带来了可扩展性,但也带来了失真。真实工作中的不确定性——老板临时改需求、客户说了一半又改主意、法规悄悄调整——这些目前还很难被合成进来。


一个奇怪的终点

整件事最值得停下来想一想的地方,不是技术,而是这个逻辑的终点。

如果 AI 可以合成整个工作环境来训练 AI,那最终训练出来的 AI 做的事,和最初用来合成数据的那套 AI 做的事,是同一类工作。这个闭环一旦形成,人类在某个领域的经验数据,就变成了最初启动的那一小块种子,之后的扩展完全由 AI 自我支撑。

这意味着什么?意味着在某些重复性强、结构化程度高的工作领域,AI 可能不再需要大量的人类示范数据——它只需要少数几个「种子任务」来定义问题域,然后就能自我生成训练材料,自行提升。这是一个和过去完全不同的 scaling 逻辑。

上一个类似的逻辑发生在语言模型本身:互联网上的人类文本是种子,模型学会了生成文本,然后用模型生成的文本继续训练——这就是著名的「caling law」隐含的假设。但那一次,生成的是语言表达;这一次,生成的是工作情境本身,包括其中的目标、障碍、协作和判断。语言模型学会了「说」,合成计算机让模型学会「做」。

从「说」到「做」,中间隔着的是一道根本性的鸿沟。「说」不改变外部世界,「做」要改变。合成计算机的方向,本质上是在用语言模型的生成能力,去模拟一个语言模型最终需要改变的世界。

这是递归,也是起点。


值得持续关注的方向:

合成计算机的下一道关卡,是模拟质量。能不能让合成文件和真实文件之间没有可感知的差距?能不能让模拟协作者的回应足够自然,以至于 agent 不只是在执行预设脚本,而是真正在做判断?如果这道关卡被突破,AI 从业者培训和 AI 自我提升之间的边界会变得极其模糊。届时,我们需要新的框架来理解「训练」这个词本身的意义。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。
周刊

「哲学七分钟」实用主义:真理不是被发现的,而是被做成的

2026-8-31 8:32:36

周刊

有些文化,把一个人待着当成一件大事

2026-8-29 8:34:12

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧