CUDA程序设计讲义.ppt

Streaming Multiprocessor执行Thread Blocks 线程以block为单位分配到SM 视资源需求, 一个SM分配至多8个block SM in G80可以接受768个线程 256 (threads/block) * 3 blocks 128 (threads/block) * 6 blocks, etc 线程并发运行 SM分配并维护线程ID SM管理并调度线程 Thread Block Size Considerations 对于矩阵乘法, 哪个thread block尺寸最好: 8X8, 16X16或者32X32? 8X8: 64 threads/block. 每个SM至多接受768 threads, 即12 blocks。但是, SM至多接受8 blocks, 所以实际上仅有512 threads 16X16: 256 threads/block.每个SM至多接受768 threads, 即3 blocks → 只要其它计算资源许可,可以满负荷工作 32X32: 1024 threads/block. SM无法处理 线程调度和执行 Thread block内部线程组织为32-thread warps An implementation decision - not part of CUDA Warp是SM调度的基本单位 Warp就是一条32路S

文档评论(0)

1亿VIP精品文档

相关文档