人工智能与深度学习
平台支持人工智能训练、模型推理、Notebook、容器实例和镜像管理等功能,适用于深度学习、遥感智能解译、图像识别、文本分析、数据科学和模型服务等场景。具体功能、GPU 型号、镜像、框架版本和资源配额以平台当前页面及管理员通知为准。
建议:Notebook 适合交互式调试、课程实验、数据探索和模型原型验证;正式训练应整理为可重复执行的脚本,通过 GPU 作业或容器任务提交。
运行方式选择
| Notebook | 适合交互式分析、代码调试、可视化、课程实验和小规模原型验证。请避免将 Notebook 长期作为无人值守训练任务运行。 |
|---|---|
| GPU 批处理作业 | 适合正式训练、参数搜索、批量推理和长时间计算。资源申请、日志、随机种子和关键参数应写入作业脚本。 |
| 容器实例 | 适合固定 Python、CUDA、框架和专业依赖环境,也适合运行 Jupyter、SSH、Web Demo 或需要环境隔离的应用。 |
| 镜像管理 | 适合固化实验环境、复现实验和团队共享。镜像应标注版本、框架、CUDA、用途和维护人员。 |
| 模型推理或服务 | 适合批量预测、演示和经过审批的模型服务。对外访问、开放端口和持续运行要求应遵守平台安全规定。 |
推荐操作流程
- 准备并检查数据集、代码、配置文件和预训练模型,确认数据来源和使用授权。
- 选择平台已有的软件模块或可信容器镜像,确认 Python、CUDA、驱动和深度学习框架兼容。
- 在 Notebook 或小规模 GPU 任务中完成数据读取、模型构建和单批次运行测试。
- 将正式训练整理为脚本,配置日志、检查点、随机种子、资源参数和运行时长。
- 通过 GPU 作业或容器任务提交训练,定期查看显存、GPU 利用率、日志和存储空间。
- 任务结束后保存模型、配置和指标,停止 Notebook 或容器实例,并清理缓存、临时文件和无用检查点。
GPU 环境检查
正式训练前,应在已经分配 GPU 的作业或实例中确认硬件和框架状态。不要仅在登录节点执行 GPU 压力测试。
nvidia-smi python --version python -c "import torch; print(torch.__version__); print(torch.cuda.is_available()); print(torch.cuda.device_count())"
- 确认程序识别到的 GPU 数量与申请数量一致。
- 确认 CUDA、深度学习框架、相关加速库和容器镜像版本兼容。
- 根据模型和批大小估算显存、CPU 内存、临时空间和训练时长。
- 多 GPU 或多节点训练应先进行短时连通性测试,并检查通信库和启动方式。
Notebook 使用建议
- 启动时按实际需要选择 CPU、内存、GPU 数量和运行时长,不要盲目申请高规格资源。
- 将可复用代码整理到项目脚本中,Notebook 主要保留说明、实验过程和结果展示。
- 定期保存文件、导出重要结果,长时间训练应设置模型检查点,避免实例中断造成全部结果丢失。
- 不要共享 Notebook 访问地址、令牌、密码或 SSH 凭证。
- 停止使用后应关闭内核并停止实例,仅关闭浏览器页面不会自动释放计算资源。
容器服务适用场景
容器与镜像安全
- 优先使用平台提供或来源可信的基础镜像,固定镜像标签或版本,避免使用来源不明的镜像。
- 不要将账号密码、密钥、访问令牌、私有数据集或数据库连接信息写入镜像。
- 数据集、代码和结果应通过平台支持的目录挂载方式使用,重要原始数据尽量设置为只读。
- 不得擅自使用特权容器、开放未经批准的网络端口或绕过平台访问控制。
- 团队共享镜像应记录维护人员、创建日期、框架版本、CUDA 版本、用途和已知限制。
训练数据与实验复现
重要实验应记录数据集版本、数据划分、预处理方法、代码版本、镜像或环境版本、随机种子、模型结构、超参数、作业脚本、GPU 型号与数量、训练时长和最终指标。
- 训练检查点、最终模型和评估结果应保存到项目结果目录,并建立独立备份。
- 数据缓存、下载文件和临时检查点应集中管理,任务完成后及时清理。
- 涉及个人信息、敏感数据、受限数据集或第三方模型时,应遵守数据授权、许可证和安全审查要求。
资源使用要求
使用 GPU、Notebook 和容器资源时,请合理设置 GPU 数量、CPU、内存和运行时长。任务结束或暂时不再使用时,应及时停止实例并释放资源,避免空闲实例、遗忘内核或无效进程长期占用公共资源。
人工智能服务功能、资源规格、镜像列表、运行时长和网络访问策略如有调整,以平台页面、运维群公告和管理员最新通知为准。