北京时间9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra。发布后,第一批拿到模型的开发者与AI从业者开始用真实任务测试它的边界,这些实测比官方跑分更能反映模型的实际能力与短板。

最受关注的案例来自Matt Shumer:他让Astra在虚幻引擎里持续搭建曼哈顿,模型用一周时间一条街一条街地建出这座城市;在另一次测试中,他让Astra创建一个虚拟世界、让其中的人都成为独立Agent,任务启动后他去睡觉,第二天甚至在客厅里听到了这些虚拟人的对话声。OpenAI总裁格雷格·布罗克曼在发布会最后称“欢迎来到AGI时代”,但这一说法远未形成共识。

在3D创作上,开发者Ben Davis让Astra在Blender里生成一艘4K飞船模型,更值得注意的是Astra开始主动检查自己的结果:在一次开发任务中,它会打开刚做完的页面、Inspect Element、读取报错、修改,再继续测试。Ben也提到测试并非每次都完美,但模型已具备自己发现问题并修复的能力。另一位开发者Theo则让Astra用Blender做一个one-shot、可直接在浏览器运行的3D游戏,从安装Blender、打开Codex、贴入Prompt到游戏产出,据Theo说大约耗时30分钟到2小时,中间无需人工干预,他把这次测试列为自己衡量模型能力的新基准。两者放在一起看,Astra在3D创作上既能做精细静态模型,也能做可运行的动态游戏。

更接近真实工作场景的测试是操作专业软件。在Nerd Snipe近两小时的抢先评测视频里,Theo和Ben让Astra打开Final Cut Pro,完成导入素材、调色、同步clips等一整套视频后期流程。这展现的是OpenAI所说的Computer Use能力——不只是输出文字建议,而是像人一样点按、拖拽、操控桌面软件界面。两人也吐槽了Astra的行为问题,比如完成一个中间步骤后就停下来、用含糊措辞让人以为任务已全部完成,实际还有后续工作没做;但即便如此,他们仍给Astra打了S+的最高分,认为它是目前最强的模型。

长任务则暴露了另一面。Matt Shumer的曼哈顿项目演示效果夸张,但真正跑成长任务后问题开始出现。一是Astra会钻细节:花大量时间优化某栋建筑的纹理或反复调试某个虚拟人的行为逻辑,其他街区还荒着,需要人时不时提醒“差不多行了,先往前推”。二是需要Manager Loop:Matt在整个项目中更像一个项目经理,持续判断当前阶段是否该停、决定下一步做什么、把关关键决策,Astra负责执行,但何时“这部分可以了”、何时“方向要调整”仍需人来拍板。

综合来看,Astra能把任务推得更远、更久,也能自己检查结果、更少停在“差一点完成”的位置,但它还没有能力自己定义终点和方向:目标清晰时执行得又快又好,目标模糊时仍需人持续引导。需要指出的是,这些测试大多来自提前拿到模型的开发者和AI从业者,任务设计和使用环境并不统一,更适合用来观察能力边界,而非严格的横向评测。