《基于Tensorflow的多任务分布式训练方法概述》3300字.docxVIP

  • 2
  • 0
  • 约4.43千字
  • 约 7页
  • 2026-10-07 发布于湖北
  • 举报

《基于Tensorflow的多任务分布式训练方法概述》3300字.docx

基于Tensorflow的多任务分布式训练方法概述

目录

TOC\o1-3\h\u16876基于Tensorflow的多任务分布式训练方法概述 1

229621.1多任务管理 1

22181.1.1GPU扩展 3

119251.2显存控制 4

90371.3实验结果与分析 5

217431.3.1训练速度 5

18171.3.2弹性调度 6

307481.4小结 7

多任务管理

本文选择以Tensorflow作为深度学习的计算框架,在Horovodv0.19.5的版本上构建了调度程序,使用一台24核cpu,64G内存,2080TI的机器,配置了Tensorflow2.2、CUDA、openmpi[43]等环境。

本文研究了如何建立多任务分布式训练程序,新增任务调度管理程序,可对训练任务进行管理调度分配资源。对于所有训练任务,只需要修改的少量训练代码就可以使用多任务调度程序,其中需要使用部分Horovod中的api并初始化。调度程序并不破坏Horovod结构的完整,只是对于任务进行控制和调度。

任务开始,调度程序会获得当前GPU数量和训练机器数量。以size参数标记worker数量,以local_rank标记每个worker中的GPU。完成标记之后,会以标记的数量来划分数据集。得到size份数据,每份数据是通过

文档评论(0)

1亿VIP精品文档

相关文档