返回案例列表
自有案例自有案例算力托管
智文科技智能算力调度平台
支持多租户 SLURM 与 K8s 融合的 GPU 算力云管理平台
项目概述
为智文科技自身及合作伙伴构建的智能算力调度平台,实现对数百卡 A800/H800 GPU 算力集群的分配、监控、多租户配额管理以及弹性伸缩调度,支撑大模型微调与推理的高并发需求。
合作流程
1
网络组网
1 周完成 GPU 服务器互联的 RoCE RDMA 高速网络拓扑设计与打通
2
调度配置
2 周配置 SLURM 调度器,集成 K8s Volcano 批任务管理
3
监控搭建
1 周基于 Prometheus 指标收集器与 Grafana 构建显卡水位监控大屏
4
负载压测
3 天进行千亿参数大模型分布式多机多卡训练压力测试与网络调优
5
投入使用
持续开放给内部微调团队及外部算力合作方,进入日常运维
业务挑战
- 大模型微调及分布式多机多卡训练极易出现显存溢出与网络阻断,需要精细化调度监控
- 不同算法工程师、不同的业务项目对 GPU 算力需求波峰波谷明显,算力闲置浪费严重
- 网络通信带宽(RDMA)易成为分布式训练的瓶颈,需要网络拓扑级别的资源分配
我们的方案
自研算力管理系统,底层打通 SLURM 集群调度器与 Volcano 批处理引擎。支持 GPU 多租户虚拟化划分(MIG),引入基于 InfiniBand/RoCE 网络拓扑感知的任务分配算法,最大化降低多机并行通信开销,并构建大屏实时监控显存温度及算力水位。
技术架构
智能算力调度平台架构
物理设施层(液冷高密机柜 + A800 GPU 服务器集群)→ 网络通信层(RoCE / InfiniBand 高密 RDMA 网络)→ 调度编排层(SLURM + AI K8s + Volcano)→ 监控计费层(Prometheus + GPU Exporter)
核心技术栈
SLURMKubernetesVolcanoPrometheus / GrafanaInfiniBand / RoCEPython
我们的合作模式
每个项目都遵循标准化的合作流程,确保交付质量与客户满意度
需求沟通
方案设计
PoC 验证
敏捷交付
持续运维
关键成果
GPU 算力利用率提升45%
训练任务网络通信损耗降低 30%
多卡多机故障恢复时间< 10 分钟
“智文科技自研的算力平台是我们大模型业务的坚实底座。每一块芯片的高效调度,都在为客户节省宝贵的算力成本。”
—— 智文技术团队
相关服务
想了解类似的方案?
联系我们

