OpenAI 的 GPT-6 Astra Ultrafast 已正式上线,可通过 OpenAI API 调用,并向符合条件的 ChatGPT Work 与 Codex 用户开放。该模式运行在英伟达 Blackwell GPU 上,依托针对 Blackwell 架构的推理优化,token 生成速度最高可达 Astra 标准模式的 8 倍。
对开发者而言,更快的生成速度意味着编程智能体的编辑—测试—调试循环被压缩,工具调用之间等待模型生成响应的时间减少,交互式应用的响应感也随之提升。这种提速在重复性工作流中价值更明显:智能体先写代码、再调用工具、检查结果、决定下一步,每一步都依赖模型快速给出输出。Ultrafast 把 Astra 的能力带入这些对时间敏感的循环中,而英伟达的 AI 基础设施则帮助 OpenAI 在开发者需要时输出更多有用的模型结果。
OpenAI 推理负责人 Philippe Tillet 表示,英伟达在工具链与文档上的深度投入,使 OpenAI 的模型在编写 Blackwell 与 Rubin GPU 程序方面表现突出;Astra 能把这种知识转化为高性能内核,让英伟达硬件在延迟、吞吐与成本的前沿区间都具备吸引力,而 Astra Ultrafast 则让智能体在写代码、用工具、处理复杂任务时获得更快的模型响应。
性能提升并不止步于模型部署。OpenAI 正在用自家模型帮助改进运行在英伟达 GPU 上的推理软件,利用平台的可编程性测试并落地优化。这种持续工作可以让模型响应随时间变得更快,也让已部署的基础设施产出更高。OpenAI 计算首席技术官 Uday Ruddarraju 表示,与英伟达的合作让 AI 更快、更有用,OpenAI 用内部模型优化了英伟达 GPU 上的推理,而英伟达的可编程性帮助实现了 Astra Ultrafast 背后的加速。
可编程的英伟达平台还让开发者与研究人员在模型演进过程中复用训练、推理与强化学习的基础设施。这种灵活性有助于团队在需求变化时重新调配算力资源,提高利用率,避免为每种工作负载过度配置。开发者即日起可通过 API 使用 GPT-6 Astra Ultrafast,访问方式、定价与实现细节可参考 Ultrafast 指南。
从产业角度看,这条消息的核心不只是“更快”,而是前沿模型厂商与 GPU 厂商在推理层的协同正在加深:模型侧用自身能力去优化底层内核,芯片侧则通过可编程性承接这种优化。对关注 AI 算力与资本叙事的人来说,它提供了一个观察窗口——推理效率的提升既可能降低单位调用成本,也可能因为应用场景扩张而推高总算力需求,两种力量如何平衡,将影响英伟达及其产业链上下游的长期需求结构。