期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

全文获取类型

收费全文	1篇
免费	0篇

专业分类

自动化技术

1篇

出版年

2023年

1篇

排序方式： 共有1条查询结果，搜索用时 15 毫秒

面向GPU集群的动态资源调度方法

傅懋钟胡海洋李忠金《计算机研究与发展》2023,(6):1308-1321

深度神经网络（deep neural network,DNN）已广泛应用于人类社会的许多领域.大规模的DNN模型可显著提高识别精度，然而在单个GPU设备上训练大规模的DNN模型需要耗费大量的时间.因此，如何借助分布式深度学习（distributed deep learning,DDL）技术，在GPU集群上并行地训练多DNN模型已受到工业界和学术界的广泛关注.基于此，提出一种面向GPU集群的动态资源调度（dynamic resource scheduling,DRS）方法，解决异构带宽环境下具有截止时间要求的多DNN任务调度问题.具体来说，首先基于Ring-AllReduce通信方式构建资源-时间模型，以衡量DDL任务在不同资源方案下的运行时间；然后基于截止时间需求构建了资源-性能模型，以实现高效的资源利用；最后，结合上述资源-时间和资源-性能模型设计了DRS算法，为多DNN任务训练实现资源方案决策.在DRS算法中融入最近截止时间原则进行实际资源分配，并利用资源迁移机制减少调度过程中出现的资源碎片场景的影响.在4个NVIDIA GeForce RTX 2 080 Ti的GPU集群上的异构... 相似文献