OpenAI的新一代模型Astra近日被曝已扩大内部测试,其前端生成能力在开发者社区引发轰动。一位ID为@Lentils80的开发者发现,OpenAI已将Astra的内部测试版本代号定为mozaik-alpha-fdm,并放出了两个在Max effort模式下的零样本生成结果:一个是3D像素风格的城堡,另一个是完整的前端网页,均一次直出,无需任何样本参考。与此同时,一批获得灰度测试资格的开发者几乎同时放出了Astra的首批实测,展示出它对细节的强大把控力——统一的视觉语言、复杂元素间的空间关系、页面层级以及交互所需的代码结构,都能一次性管理到位。有开发者看完后直接宣布“Frontend is solved”(前端问题已解决)。业界普遍预测,Astra将在下周四(9月3日)前后正式面世,与Anthropic的Fable 5.1正面交锋。
前端生成一直是大型语言模型的难点。以往模型在生成UI时,常出现CSS臃肿、配色刺眼、布局错乱等问题。而Astra在零样本条件下展现出的细节控制力,让不少观察者看到了质变的苗头。例如,它生成的可交互3D等距王国地图,需要同时处理几何透视、图层堆叠、动态交互和视觉一致性,Astra在最大思考程度下能一次成型。另一位开发者MeSun用Astra直接生成了一个带物理效果的3D自行车测试网页(HTML),车身比例可随意调整;甚至让它生成一个3D第一人称Roguelike游戏,主打战斗爽感,结果同样“一把过”。有爆料大咖感叹,这是历史上第一次“想法”开始碾压“执行”——“你能想到的,AI就能给你做出来”。
Astra的前端能力为何能如此脱胎换骨?结合泄露特征与行业预测,其核心技术突破可能集中在四个维度。第一是端到端多智能体编排:Astra可能不再是一个单纯的单体代码生成器,而是原生集成了多智能体架构,例如让Codex处理编程任务、另一个子模型处理自然语言查询,最后由主模型整合结果。在生成3D网页时,模型内部相当于并发运行了“UI设计师、前端工程师和代码审查员”,从而保证布局、样式和逻辑的三位一体。这与GPT-5.6中已以beta形态推出的Multi-agent功能一脉相承,但Astra可能将其内化为端到端训练的原生能力。第二是超长程任务能力:以往模型在编写涉及多组件和复杂CSS/JS联动的项目时,极易出现“遗忘”和“幻觉”,而Astra展现出的完整度,证明其上下文窗口内的注意力机制得到优化,足以支撑从零构建复杂工程。它解决十个数学问题的表现也显示,模型能在极长时间跨度内维持推理一致性,这对代码项目的持续开发、论文级研究任务以及复杂工作流的自主执行意义重大。第三是持久化推理模式:Astra在Max effort下的思考量显著超过Sol,模型不会一次性输出答案,而是在内部反复验证、纠错、迭代,直到输出满意为止。这意味着它能“记住”当前DOM树的结构,在后续生成中保持设计语言和代码规范的绝对一致。第四是即时自我纠错:Astra可能在生成代码的同时,在内部沙盒中完成“虚拟渲染”或AST语法树的逻辑跑通,自动发现前端错位并重构,最后才将完美的零样本结果呈现给用户。零样本复刻PS5手柄这类高细节渲染任务,本身就是自我纠错能力的间接证据。
不过,好戏还在后头。就在这一周,Anthropic也被曝正在加速推进Fable 5.1,其发布时间窗口恰好与Astra前后脚。从灰度测试者反馈看,Fable 5.1的升级重点几乎与Astra撞了个正着:前端代码更稳、复杂组件逻辑一次成型;长思维链推理更强,不容易推着推着就“忘了前提”;工具调用和分步规划进一步强化,越来越接近成熟的AI Agent。两家公司已杀进同一块战场:代码能力要更强,任务要跑得更久,过程中还得尽量少让人接手。目前双方甚至已开始隔空PK——同样生成一张“女子自画像”SVG矢量图,Astra与Fable 5.1的细节、结构、完成度被直接摆上台面对比。
但真正可能决定胜负的,或许不只是模型能力。从爆料看,Astra除了性能强悍,还可能在性价比上继续下压。如果OpenAI真能以更低的API调用成本,交付一款自带Max effort、自纠错能力更强、又不需要复杂工程编排的模型,那么Fable 5.1面对的就不只是Benchmark上的压力。下周四的“巅峰之战”,到底谁能拿下新王宝座,市场正拭目以待。