1.负责健康医疗大数据平台GPU/CPU科研计算集群的建设、运行和维护; 2.负责基于Slurm等技术的算力资源统一调度、用户管理、任务管理和资源配额管理; 3.负责NVIDIA GPU、CUDA、cuDNN、NCCL及PyTorch等AI计算环境的部署和维护; 4.负责Docker/Apptainer等容器化科研计算环境建设; 5.建设GPU及服务器监控体系,实现GPU利用率、显存、任务和资源使用情况监测; 6.支持单机多卡、多机多卡及分布式AI训练任务,协助定位GPU、通信、存储及网络性能问题; 7.建立GPU-hour等算力使用统计和资源利用分析机制,提高平台整体算力利用效率; 8.为科研人员提供AI计算环境、集群任务及算力使用相关技术支持。 |