AI 工作负载与 NPU / GPU 编排

RunNPU
让每张算力卡都在工作

用于 AI 工作负载和异构算力编排的平台。从开发到训练与推理,动态编排资源,最大化每张卡的价值。

面向 1–10 台多卡工作站与小集群 · 昇腾 / NVIDIA 等异构算力 · 可完全离线

RunNPU Overview:逐卡实时网格、项目配额与排队负载

概览

借助动态编排加速 AI 工作流

RunNPU 通过动态资源分配、完整的 AI 生命周期支持与策略驱动的资源管理, 解决一体机与小集群上的算力争用问题。跨项目汇集配额、公平借用与抢占, 显著提高 NPU / GPU 效率与可同时运行的工作负载数量。

什么是智能编排?

AI 原生工作负载编排将开发环境、训练任务与推理服务统一为可调度单位, 用项目配额、优先级与分卡把物理算力变成可共享的战略资产—— 无需用户理解 K8s 队列与设备插件细节。

阅读架构设计 →

什么是 RunNPU?

在整个 AI 生命周期内通过动态编排加速 AI 操作:最大化卡利用率、扩展工作负载, 并与 Kueue、HAMi、Kubernetes 生态无缝集成。决策层自研,机制层复用生态—— 不重写调度内核,专注产品语义与可解释性。

了解技术架构 →

特性

AI 工作负载和算力编排,以大规模构建、训练和部署

对标企业级编排能力,为工作站与小集群裁剪到可交付体积。

AI 原生工作负载编排

跨节点集中管理开发、训练与推理负载,将分散的算力变成可扩展的 AI 工厂。单一 RunWorkload CRD,产品侧分类型体验。

动态算力分配与分卡

实时匹配资源与需求。按整卡或显存百分比 / GB 分卡,预置算力档位,确保每张 NPU / GPU 都能提供最大价值。

策略驱动型治理

项目配额、保证额度、借用与抢占;Policy 约束镜像白名单、卡数上限与强制可抢占。安全高效地跨团队共享算力。

可解释调度证据链

每个排队、借用、抢占决策可追溯。以负载 CR UID 为主键串联事件,把「为什么还在排队」变成可查询日志。

模板与资产预填

环境、算力、数据卷、凭证、调度配置资产化。模板链接资产后更新自动生效,训练师无需理解基础设施细节。

一屏可见总览

已分配但空闲卡、排队列表、空闲负载点名到人。提交时项目卡片可视化配额余量,避免提交后干等。

存储配额体系

StoragePool 纳管、按池告警与停供水位、项目按池配额。持久占用 / 运行时占用 / 剩余三段口径,治理算力之外的磁盘。

开放式体系架构

K8s API 唯一总线;队列复用 Kueue,分卡复用 HAMi。API 优先,与主流 AI 框架、工具链与观测栈无缝集成。

性能与设计目标

为真实共享算力而设计的编排

动态调度与配额仲裁提升吞吐量、实现公平共享,并更大限度提高卡利用率。

–10
台机规模

工作站到小集群的目标部署形态

负载类型

交互 / 批处理 / 无状态 / 有状态服务

0 内核改写
生态复用

队列用 Kueue,分卡用 HAMi

+ 天
证据链保留

调度决策可追溯、可审计

工作负载

从开发到训练和部署,统一编排

生命周期不同的负载在产品侧分页面管理,底层统一为 RunWorkload, 调度器只面对「资源请求 + 调度语义」。

开发 / 训练环境

interactive

Jupyter、VS Code、SSH 交互式环境。可配置可抢占与空闲回收;单机 Sandbox,多机 JobSet 支持手动分布式训练。

训练任务

batch

批处理训练与预置微调任务。有完成态、重试与分布式 gang 准入;主入口为预置任务 + 用户数据集。

无状态推理服务

statelessService

vLLM、Embedding、Web 应用等可互换副本服务。支持自动扩缩,部分副本准入是常态。

有状态 / 分布式服务

stateful · distributed

向量库等有状态服务,以及 LeaderWorkerSet 多机多卡大模型推理,组间独立准入。

RunNPU Workloads:开发环境、训练任务与推理服务列表

优势

释放算力基础设施的全部潜力

专为 AI 调度与基础设施管理打造,在 AI 全生命周期中加速工作负载,缩短价值实现时间。

01

更大限度提高利用率,降低算力成本

动态汇集配额、空闲借用与抢占回收,消除「人走了卡还占着」。将计算能力与项目优先级对齐,提升 ROI。

02

从开发到部署无缝加速 AI

开发环境 → 训练任务 → 推理服务同一平台编排。模板与资产减少重复配置,缩短从想法到可服务模型的周期。

03

集中式编排与全面可见性

端到端查看节点、逐卡状态、项目用量与排队原因。策略驱动治理,IT 与训练师共用一套事实源。

04

灵活集成,可离线交付

开放架构对接主流框架与观测栈。单机到 10 台内小集群;支持完全离线,适配高校、科研与政企内网。

用例

借助智能编排加速 AI 工作负载

为真实中小算力场景打造:提高效率、动态扩展训练与推理。

1

团队共享多卡工作站

5–20 人模型团队共用 1 至数台 910B / GPU 工作站。项目配额保证公平,空闲开发环境可回收,避免「抢卡大战」。

2

分卡并行推理与调试

在同一物理卡上并行跑调试环境与小推理服务。按显存切分提高 Token 吞吐与整体利用率,减少整卡空转。

3

预置微调与批处理训练

预置图像分割、分类、LLM 微调等任务。用户上传数据集、调超参即可提交;分布式训练 gang 全有或全无。

4

OEM 一体机搭售

随整机预装交付,OOBE 开箱激活。伙伴售前可演示配额、分卡与一键工作负载,售后减少版本兼容现场故障。

技术

通过动态编排实现加速 AI 运营

决策权自研,机制层复用生态。以最低复杂度、最高可解释性扩展 AI 运营。

控制台 · L1

  • Web UI + API
  • 项目 / 用户 / 角色
  • 模板 · 资产 · 策略
  • 配额卡片与总览

决策层 · L2

  • RunWorkload operator
  • QuotaGrant / DataVolume
  • Policy webhook
  • AdmissionCheck advisor

机制层 · 生态

  • Kueue 队列与公平
  • HAMi 分卡与落位
  • JobSet / Sandbox
  • Prometheus · OTel
Kubernetes·唯一总线
Kueue·配额 / 借用 / gang
HAMi·分卡 / 隔离
JobSet·分布式负载
agent-sandbox·交互式环境
RKE2·发行版底座

部署

跨越各种环境灵活交付

三形态一套代码。默认私有化可离线——避免被误传成「只能用的云服务」。

Airgapped推荐

私有化离线

  • 控制面在客户机房,完全离线
  • 高校 / 科研 / 政企内网主场景
  • OOBE 开箱 + License 可选
  • 日志与终端数据不出集群
Connected可选

私有化联网

  • 可下载更新,不上传业务数据
  • 与离线版同一套代码路径
  • 适合有顾虑但非涉密客户
  • 仍保留本地控制面
SaaS增量

云端控制面

  • 集群仅出站连接
  • 伙伴售前演示与模板落地
  • 多集群注册与心跳
  • 敏感操作隧道转发不落盘

FAQ

常见问题

产品定位对标 Run:ai 的「AI 工作负载与 GPU 编排」能力:配额、公平共享、分卡、策略治理与全生命周期工作负载。面向 1–10 台工作站/小集群做减法,砍掉多集群与臃肿角色;调度内核不自研,复用 Kueue + HAMi。
以昇腾 NPU 为主,同时覆盖 NVIDIA GPU 等异构算力。分卡与隔离依赖 HAMi 及厂商 device plugin。
可以。私有化 Airgapped 是推荐形态,控制面在客户机房,适合高校、科研与政企内网。
产品侧按开发/训练环境、训练任务、无状态推理、有状态/分布式服务管理;底层统一 RunWorkload CRD,用 type × distributed 映射到 Sandbox、Job、JobSet、Deployment、StatefulSet、LeaderWorkerSet。
支持可抢占策略与空闲回收;交互式环境可挂起释放配额并保留数据盘。策略可强制开发环境可抢占。
架构与 ADR:github.com/EM-GeekLab/run-npu-doc;前端原型:github.com/EM-GeekLab/run-npu-prototypes。

仓库实现进度

RunNPU 功能交付进度

141 项产品功能分层统计;Operator 看板覆盖其中 72 项职责能力

查看功能明细

Operator 职责项平均完成度

%
29
完成
27
部分
16
未完
前端31.3%

139 项适用 · 22 完成 / 55 部分 / 62 未完成

后端29.6%

135 项适用 · 27 完成 / 31 部分 / 77 未完成

SDK71.1%

90 项适用 · 49 完成 / 39 部分 / 2 未完成

“不适用”不计入平均完成度;mock 页面、未接真实后端及仅有底层字段的能力不计为已完成。

后续步骤

准备好开始了吗?

借助 RunNPU 的智能编排,加速 AI 从开发到部署。 欢迎 OEM 伙伴、集成商与模型团队一起试用与共创。