返回案例列表
自有案例自有案例算力托管

智文科技智能算力调度平台

支持多租户 SLURM 与 K8s 融合的 GPU 算力云管理平台

项目概述

为智文科技自身及合作伙伴构建的智能算力调度平台,实现对数百卡 A800/H800 GPU 算力集群的分配、监控、多租户配额管理以及弹性伸缩调度,支撑大模型微调与推理的高并发需求。

合作流程

1

网络组网

1 周

完成 GPU 服务器互联的 RoCE RDMA 高速网络拓扑设计与打通

2

调度配置

2 周

配置 SLURM 调度器,集成 K8s Volcano 批任务管理

3

监控搭建

1 周

基于 Prometheus 指标收集器与 Grafana 构建显卡水位监控大屏

4

负载压测

3 天

进行千亿参数大模型分布式多机多卡训练压力测试与网络调优

5

投入使用

持续

开放给内部微调团队及外部算力合作方,进入日常运维

业务挑战

  • 大模型微调及分布式多机多卡训练极易出现显存溢出与网络阻断,需要精细化调度监控
  • 不同算法工程师、不同的业务项目对 GPU 算力需求波峰波谷明显,算力闲置浪费严重
  • 网络通信带宽(RDMA)易成为分布式训练的瓶颈,需要网络拓扑级别的资源分配

我们的方案

自研算力管理系统,底层打通 SLURM 集群调度器与 Volcano 批处理引擎。支持 GPU 多租户虚拟化划分(MIG),引入基于 InfiniBand/RoCE 网络拓扑感知的任务分配算法,最大化降低多机并行通信开销,并构建大屏实时监控显存温度及算力水位。

技术架构

智能算力调度平台架构

物理设施层(液冷高密机柜 + A800 GPU 服务器集群)→ 网络通信层(RoCE / InfiniBand 高密 RDMA 网络)→ 调度编排层(SLURM + AI K8s + Volcano)→ 监控计费层(Prometheus + GPU Exporter)

核心技术栈

SLURMKubernetesVolcanoPrometheus / GrafanaInfiniBand / RoCEPython

我们的合作模式

每个项目都遵循标准化的合作流程,确保交付质量与客户满意度

需求沟通

方案设计

PoC 验证

敏捷交付

持续运维

关键成果

GPU 算力利用率提升45%
训练任务网络通信损耗降低 30%
多卡多机故障恢复时间< 10 分钟

智文科技自研的算力平台是我们大模型业务的坚实底座。每一块芯片的高效调度,都在为客户节省宝贵的算力成本。

—— 智文技术团队

想了解类似的方案?

联系我们
立即开启数智化转型之旅

准备好开启数智化转型了吗?

告诉我们你的需求,技术专家将为你量身定制解决方案

立即咨询
企业微信二维码
扫码加企微