游戏训练能否迁移到真实工作?
游戏为什么会成为 AI 训练材料?
Good Start Labs 正在探索一个问题:AI 在游戏中学到的能力,能否迁移到真实工作场景?
公司联合创始人兼 CEO Alex Duffy 认为,游戏一直是被低估的教育工具:它们容易上手,也足够“人类化”。Good Start Labs 的核心思路,就是把游戏转化为 AI 模型的训练材料。
这家公司由 AI 媒体与工具公司 Every 孵化而来,去年 10 月独立,并获得了 360 万美元融资,投资方包括 General Catalyst、Inovia、Every 以及若干天使投资人。
从《外交》游戏观察大模型差异
这个想法的起点之一,是 2025 年一次让前沿模型玩《外交》(Diplomacy)的直播。《外交》通常需要数天甚至数周才能完成一局。
Duffy 当时在 Every 负责 AI 训练。他观察到,不同模型在游戏场景中的行为差异非常明显:
- OpenAI 的 o3 模型会通过规划未来的背叛来赢得比赛;
- Claude Opus 4 则拒绝撒谎,因此在对局中处于劣势。
这一现象让 Duffy 认为,像《外交》这样的游戏可能可以用于训练模型的某些能力,例如战略思考。一个关键原因是:游戏通常有明确、可验证的结果,这使得训练反馈更容易设计。
Duffy 后来写道,对模型进行《外交》策略游戏微调后,模型在客户支持和工业运营相关基准上的表现有所提升。
关键不只是“玩游戏”,而是训练设计
Good Start Labs 后续还进行了另一个实验:用一款铁路游戏训练 AI。结果显示,某个版本的模型在金融研究任务上有所提升。
但值得注意的是,效果并不是简单来自“让模型玩游戏”。同样的游戏材料下,训练设计的差异会影响模型是否能把游戏中学到的能力迁移到真实任务。
这意味着,游戏本身可能只是载体;真正重要的是如何把游戏中的决策、反馈、目标和评估机制组织成有效的训练过程。
为什么这件事值得关注?
如果游戏训练确实能够迁移到真实工作,它可能为 AI 训练提供一种新路径:
- 游戏环境更容易规模化;
- 游戏结果通常更容易验证;
- 游戏可以模拟策略、协作、谈判、规划等复杂行为;
- 训练成本和风险可能低于直接在真实业务场景中试错。
不过,目前已有信息仍然有限。铁路游戏训练改善金融研究表现这一点,需要结合具体实验设置、评估指标和对照组才能判断其可靠性与泛化能力。
更稳妥的结论是:游戏可能成为 AI 学习复杂技能的训练场,但能否迁移到现实任务,取决于训练目标和评估设计,而不是游戏本身。
