Skip to content

CUDA 对照速查(详细迁移手册)

1. 概念表

CUDA / GPUPTO / Ascend迁移提示
CUDA CoreVEC pipeline别找 warp shuffle 一一对应
Tensor CoreCUBEtile 形状更关键
SMAI Core (1C2V)内部已是异构
Shared MemoryUB / L0 tiles类型化 + 静态容量
Global MemoryGMTLOAD/TSTORE
Registers标量 + 部分 tile 驻留容量规划显式
__syncthreadsEvent/TSYNC跨 pipeline 细粒度
grid/block/threadblock_idx + tile 循环先 tile 后核
PTXPTO bytecode / IR中间层是虚拟 ISA
SASS后端实现隐藏在 pto-isa
nvccPTOAS (+毕昇/CANN)MLIR out-of-tree
TritonPyPTO / TileLang / PTODSL都可落到 PTO
cuBLAS数学库 + manual GEMM对标学习用样例
FlashAttention CUDAFA PTO kernel算法同,载体异
NCCLHCCL + PTO 通信扩展可算通融合
Nsight Systemsmsprof 时间线方法论同
Nsight Compute单元占比 / PMUBound 语言扩展
CUDA Graph任务图 / simplerMPMD 更常见

2. 思维转换练习

练习 1:把 CUDA 向量加 kernel 改写成 Tile 数据流。
练习 2:把 shared memory tiling GEMM 映射到 L1/L0/stepK。
练习 3:把 __syncthreads 换成最小 event 集。

3. 常见误迁移

误区后果
按线程想问题写不出自然 PTO 代码
到处全局同步性能崩
忽略 valid尾块错
把 SIM 性能当真机决策错误
忽视 AICPU 调度框架路径调不对

4. 检验标准

  • [ ] 完成概念表默写 15 项
  • [ ] 三个练习各一页笔记

参考 AIInfraGuide 结构,面向 PTO / Ascend CANN 生态重写