OpenAI 的 GPT-6 Astra 模型近日完成了一项引人注目的壮举:在没有人类帮助的情况下,从头到尾自主通关了经典解谜游戏《传送门》。开发者 cozyblaze 在 X 平台宣布了这一消息,并分享了相关代码与文档。整个游戏过程耗时约 23 小时 43 分钟,从设定初始目标开始,模型一路推进至游戏结束画面,期间未接受任何人工干预。

据 cozyblaze 估算,此次运行按 Astra 的标价计算,token 消耗费用至少为 570 美元。不过,开发者实际使用的是 200 美元 的 Codex 订阅服务,因此实际成本远低于标价。这一细节也反映出,在 API 定价与订阅模式之间,重度 AI 任务的实际开销存在显著差异。

在技术层面,GPT-6 Astra 通过 MCP模型上下文协议)和一款修改版的 SourcePauseTool 来控制游戏。该工具会在模型思考时暂停游戏进程,此时模型会获取屏幕截图、玩家位置和摄像机角度等信息,选择下一步操作后再恢复游戏运行。这种“思考-暂停-行动”的循环机制,使得模型能够在不依赖实时反应的情况下,从容规划复杂的解谜步骤。cozyblaze 发布的演示视频已剪去这些暂停片段,以呈现连贯的游戏过程。

cozyblaze 在 GitHub 上公开了相关代码和文档,供其他开发者复现或进一步研究。他在 X 平台的帖子中还提到,OpenAI 早在 2016 年 就设定了用单一智能体解决多种游戏的目标。尽管目前仍存在诸多问题,但看到智能体独立完成一整款游戏,可以说是对当年愿景的一次小小实现。他补充道,GPT-6 Astra 是“我们未来能获得的最差模型”,言下之意是,随着技术迭代,未来的模型将展现出更强大的能力。

这一事件对 AI 产业具有多重启示。从模型能力评估角度看,它展示了前沿模型在长时序、多步骤任务中的自主规划与执行潜力,而这类能力正是通用人工智能(AGI)研究的关键方向之一。从应用层面看,模型通过 MCP 等协议与外部工具(如游戏引擎)交互,意味着 AI 在自动化测试、虚拟环境模拟、乃至机器人控制等领域的应用边界可能进一步拓宽。

不过,也有观察者指出,此次通关耗时近一天、token 成本高昂,且依赖专门的暂停工具,距离“实时、低成本地驾驭复杂环境”仍有相当距离。但正如 cozyblaze 所言,这或许只是起点——随着模型能力的指数级提升,未来 AI 在游戏乃至更广泛数字环境中的自主表现,值得持续关注。