东华理工大学先进算力服务平台
东华理工大学先进算力服务平台
先进算力服务平台人工智能与深度学习操作说明

人工智能与深度学习

平台支持人工智能训练、模型推理、Notebook、容器实例和镜像管理等功能,适用于深度学习、遥感智能解译、图像识别、文本分析、数据科学和模型服务等场景。具体功能、GPU 型号、镜像、框架版本和资源配额以平台当前页面及管理员通知为准。

建议:Notebook 适合交互式调试、课程实验、数据探索和模型原型验证;正式训练应整理为可重复执行的脚本,通过 GPU 作业或容器任务提交。

运行方式选择

Notebook适合交互式分析、代码调试、可视化、课程实验和小规模原型验证。请避免将 Notebook 长期作为无人值守训练任务运行。
GPU 批处理作业适合正式训练、参数搜索、批量推理和长时间计算。资源申请、日志、随机种子和关键参数应写入作业脚本。
容器实例适合固定 Python、CUDA、框架和专业依赖环境,也适合运行 Jupyter、SSH、Web Demo 或需要环境隔离的应用。
镜像管理适合固化实验环境、复现实验和团队共享。镜像应标注版本、框架、CUDA、用途和维护人员。
模型推理或服务适合批量预测、演示和经过审批的模型服务。对外访问、开放端口和持续运行要求应遵守平台安全规定。

推荐操作流程

  1. 准备并检查数据集、代码、配置文件和预训练模型,确认数据来源和使用授权。
  2. 选择平台已有的软件模块或可信容器镜像,确认 Python、CUDA、驱动和深度学习框架兼容。
  3. 在 Notebook 或小规模 GPU 任务中完成数据读取、模型构建和单批次运行测试。
  4. 将正式训练整理为脚本,配置日志、检查点、随机种子、资源参数和运行时长。
  5. 通过 GPU 作业或容器任务提交训练,定期查看显存、GPU 利用率、日志和存储空间。
  6. 任务结束后保存模型、配置和指标,停止 Notebook 或容器实例,并清理缓存、临时文件和无用检查点。

GPU 环境检查

正式训练前,应在已经分配 GPU 的作业或实例中确认硬件和框架状态。不要仅在登录节点执行 GPU 压力测试。

nvidia-smi
python --version
python -c "import torch; print(torch.__version__); print(torch.cuda.is_available()); print(torch.cuda.device_count())"
  • 确认程序识别到的 GPU 数量与申请数量一致。
  • 确认 CUDA、深度学习框架、相关加速库和容器镜像版本兼容。
  • 根据模型和批大小估算显存、CPU 内存、临时空间和训练时长。
  • 多 GPU 或多节点训练应先进行短时连通性测试,并检查通信库和启动方式。

Notebook 使用建议

  • 启动时按实际需要选择 CPU、内存、GPU 数量和运行时长,不要盲目申请高规格资源。
  • 将可复用代码整理到项目脚本中,Notebook 主要保留说明、实验过程和结果展示。
  • 定期保存文件、导出重要结果,长时间训练应设置模型检查点,避免实例中断造成全部结果丢失。
  • 不要共享 Notebook 访问地址、令牌、密码或 SSH 凭证。
  • 停止使用后应关闭内核并停止实例,仅关闭浏览器页面不会自动释放计算资源。

容器服务适用场景

需要固定 Python、CUDA、深度学习框架或专业依赖环境。
需要复现实验环境,或在团队内部共享经过验证的镜像。
需要运行 Jupyter、SSH、Web Demo 或经平台允许的模型服务。
需要隔离不同项目之间的软件依赖,避免公共环境冲突。

容器与镜像安全

  • 优先使用平台提供或来源可信的基础镜像,固定镜像标签或版本,避免使用来源不明的镜像。
  • 不要将账号密码、密钥、访问令牌、私有数据集或数据库连接信息写入镜像。
  • 数据集、代码和结果应通过平台支持的目录挂载方式使用,重要原始数据尽量设置为只读。
  • 不得擅自使用特权容器、开放未经批准的网络端口或绕过平台访问控制。
  • 团队共享镜像应记录维护人员、创建日期、框架版本、CUDA 版本、用途和已知限制。

训练数据与实验复现

重要实验应记录数据集版本、数据划分、预处理方法、代码版本、镜像或环境版本、随机种子、模型结构、超参数、作业脚本、GPU 型号与数量、训练时长和最终指标。
  • 训练检查点、最终模型和评估结果应保存到项目结果目录,并建立独立备份。
  • 数据缓存、下载文件和临时检查点应集中管理,任务完成后及时清理。
  • 涉及个人信息、敏感数据、受限数据集或第三方模型时,应遵守数据授权、许可证和安全审查要求。

资源使用要求

使用 GPU、Notebook 和容器资源时,请合理设置 GPU 数量、CPU、内存和运行时长。任务结束或暂时不再使用时,应及时停止实例并释放资源,避免空闲实例、遗忘内核或无效进程长期占用公共资源。

人工智能服务功能、资源规格、镜像列表、运行时长和网络访问策略如有调整,以平台页面、运维群公告和管理员最新通知为准。