源码系统概览
文章正文
HAI Platform 是一个开源的 AI 训练分时调度平台,通过 docker-compose 或 Kubernetes 部署,提升 GPU 算力利用效率。
本项目为中文社区维护版本,主打多用户公平调度,让有限的显卡资源被多人按策略共享,避免闲置与抢占冲突,适合实验室与企业的协作训练场景。
源码简介
平台提供训练任务分时调度、任务管理、Jupyter 开发容器与运行环境管理,由 HFAiLab 维护并以 LGPL 协议发布。
它依赖集中存储与 k8s 集群,将分散的算力统一编排,适合多用户共享场景。
通过 haienv 可管理多版本 Python 与 CUDA 运行环境,配合 CLI 工具把训练任务接入既有研发流程,整体降低集群运维成本。
调度策略可按队列与优先级灵活配置,兼顾公平性与关键任务的时效,适合长期多团队共用。
适用场景
高校与企业的 AI 实验室、需要多用户共享 GPU 的团队、训练任务排队与时段分配等场景适合使用 HAI Platform。
它让有限的算力被多人公平调度,提升整体利用率与协作效率,也方便管理员统计资源占用与成本,支撑科研管理。
功能亮点
训练任务分时调度与排队,公平高效。
Jupyter 开发容器即开即用,降低环境准备成本。
haienv 多版本运行环境管理,切换方便。
docker-compose 与 k8s 双部署形态,适配不同规模。
CLI 工具便于集成到既有流程,运维灵活,扩展性强。
技术架构与部署指南
技术栈与运行环境
前端:studio 用户界面(独立仓库维护)
后端:Python(调度核心)
数据库:集中存储(nfs/ceph/weka 共享)
运行环境:Python 3、k8s、Docker(容器编排)
其他依赖:RDMA(可选加速)、CUDA 镜像
安装与部署提示
通过 one/release.sh 构建 all-in-one 镜像,或使用预构建镜像配合 hai-cli 安装。
部署前需准备集中存储与 k8s 集群,并在配置中声明计算节点是否支持 RDMA,确保调度与网络通信正常,再导入训练镜像与运行环境,验证调度链路。
截图与演示说明
studio 界面提供 Jupyter 容器入口与任务提交表单,开箱即可编写与运行代码。
调度页以列表与图表展示各任务的排队与占用情况,便于管理员掌握全局。
运行环境管理页列出可用 haienv 版本。
实际界面以部署后为准,本文未附截图,请以实测界面为准。
常见问题
问:必须用 k8s 吗?
支持 docker-compose 单机形态与 k8s 集群形态,小规模可先使用 compose,后续按需扩展到集群,迁移平滑。
问:如何提交训练任务?
通过 hai-cli 或 studio 界面提交,平台按分时策略排队并分配算力,使用直观,无需手写编排。
问:支持哪些环境?
内置 haienv 管理多版本 Python 与 CUDA 运行环境,也可自定义训练镜像,适配不同框架与硬件。
安全风险提示
特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!
下载说明
源码仅供学习研究、测试部署和二次开发参考,请勿用于任何商业或违规用途。
商用前请自行确认对应项目的开源授权、版权归属与潜在安全风险,下载后建议先在隔离环境进行安全审计。
最后更新:2026-08-27