英伟达于 2026 年 8 月 25 日宣布,随 CUDA 13.3 发布 CUDA Python 1.0,这是一套由英伟达官方维护的库和工具,旨在让 Python 开发者能够直接、完整地访问 CUDA 平台。该版本标志着 Python 成为使用 CUDA 平台的受支持方式,与 C++ 平起平坐,并承诺未来保持功能对等。

长期以来,Python 开发者使用 GPU 面临两难选择:要么深入学习 CUDA C++ 编写扩展并维护绑定,要么依赖 PyTorch、CuPy、RAPIDS 等上层库,但一旦需要库未暴露的功能,就陷入困境。CUDA Python 1.0 通过提供统一的官方基础层解决了这一问题。

此次发布包含多个组件:cuda.core 1.0.0 提供对 CUDA 运行时的 Pythonic 访问,将设备、流、缓冲区等基本概念转化为普通 Python 对象;cuda.compute 1.0.0 将 CCCL 的并行算法引入 Python;cuda.bindings 13.3.0 提供与 CUDA C API 一一对应的低级绑定;cuda-pathfinder 用于定位环境中安装的 CUDA 组件;nvmath-python 1.0 则以独立的稳定版本提供英伟达数学库。值得注意的是,CUDA Python 1.0 是一个里程碑名称,而非 pip 安装的版本号,各组件独立版本控制。

该版本的核心承诺是语义化版本:破坏性 API 变更仅发生在主版本,次版本添加功能,补丁版本修复错误,任何计划移除的公共 API 都会先在次版本中弃用并提供明确替代路径。这为库和应用开发者提供了稳定基础,鼓励他们放心地在 CUDA Python 组件之上构建。

cuda.core 被认为是影响最大的组件,它为所有 Python GPU 库提供了共同基础,使它们能够协作和共享资源。此前,不同库各自实现 CUDA 绑定,导致互操作复杂。现在,库之间可以组合而非仅共存,例如 Numba 内核和 cuda.compute 调用可在同一流中操作同一 GPU 缓冲区。

这一统一基础还使高级平台功能更易普及,如绿色上下文(将 GPU 流式多处理器分区,隔离延迟敏感内核)和进程检查点,现在只需在 cuda.core 中实现一次,所有基于它的库都能使用。

对开发者而言,库开发者可将精力集中于自身特色而非底层细节,应用开发者则受益于依赖项的收敛。CUDA Python 1.0 的发布,有望进一步巩固 Python 在 AI 和高性能计算领域的地位,降低开发者接触底层算力的门槛,推动更多创新应用的出现。