
NVIDIA 发布 CUDA Toolkit 13.4。这一版本最受关注的变化是把 CUDA 应用的支持范围扩展到 Windows on Arm——此前 CUDA 在 Arm 平台主要通过 Linux 提供支持。
版本还以预览方式加入 NVIDIA Rubin 架构(计算能力 107)的功能支持,开发者可以在 Rubin 的 CUDA 支持正式提供之前先行移植应用;nvcc 新增 SM_107 编译目标,宿主编译器兼容范围扩展到 GCC 16 与 Clang 22。
共享 GPU 的管理能力同步升级。多进程服务 MPS 进入 V3,提供可脚本化的命令行、命名服务实例与命名空间,并支持 TOML 配置、SM 分区控制与基于 cgroup 的显存限制,便于在容器化环境中按程序定义算力、显存边界与执行优先级。
新增的 CUDA Compute Fabric Transport(CFT)以传输为中心组织数据移动:软件用端点 ID 加偏移定位命名逻辑端点,直接从 GPU 发起异步 put、get 与归约操作,减少大规模多 GPU 系统中的虚拟地址压力,支持单播与组播,并回报完成与错误状态以便重试或改道。CFT 仅通过 CUDA Driver API 提供,面向通信库开发者,多数应用仍建议使用 NCCL 或 NVSHMEM。
内存与平台侧还有几处变化:13.4 开放局部域(locality domain)的编程访问,可把显存分配与 green context 的 SM 资源放在同一局部域,改善多局部域设备上的数据局部性;新增统一内存位置查询 API,帮助库和运行时判断数据当前驻留在哪里;在 Grace Hopper、Grace Blackwell 与 Vera Rubin 等一致性平台上,驱动默认改用 CDMM 内存管理而非 NUMA。此外,CUDA SDK 安装包不再捆绑 NVIDIA 驱动,驱动与工具包需分别安装。
Python 与工具链方面,继 CUDA Python 1.0 之后,cuda.core 1.1.0 扩展了纹理与表面编程、托管内存控制与 CUDA Graph 集成,并补齐面向开发工具的类型信息。完整的变更清单可在 CUDA Toolkit 发行说明中查阅。
WeChat
Profile