概览
借助动态编排加速 AI 工作流
RunNPU 通过动态资源分配、完整的 AI 生命周期支持与策略驱动的资源管理, 解决一体机与小集群上的算力争用问题。跨项目汇集配额、公平借用与抢占, 显著提高 NPU / GPU 效率与可同时运行的工作负载数量。
特性
AI 工作负载和算力编排,以大规模构建、训练和部署
对标企业级编排能力,为工作站与小集群裁剪到可交付体积。
AI 原生工作负载编排
跨节点集中管理开发、训练与推理负载,将分散的算力变成可扩展的 AI 工厂。单一 RunWorkload CRD,产品侧分类型体验。
动态算力分配与分卡
实时匹配资源与需求。按整卡或显存百分比 / GB 分卡,预置算力档位,确保每张 NPU / GPU 都能提供最大价值。
策略驱动型治理
项目配额、保证额度、借用与抢占;Policy 约束镜像白名单、卡数上限与强制可抢占。安全高效地跨团队共享算力。
可解释调度证据链
每个排队、借用、抢占决策可追溯。以负载 CR UID 为主键串联事件,把「为什么还在排队」变成可查询日志。
模板与资产预填
环境、算力、数据卷、凭证、调度配置资产化。模板链接资产后更新自动生效,训练师无需理解基础设施细节。
一屏可见总览
已分配但空闲卡、排队列表、空闲负载点名到人。提交时项目卡片可视化配额余量,避免提交后干等。
存储配额体系
StoragePool 纳管、按池告警与停供水位、项目按池配额。持久占用 / 运行时占用 / 剩余三段口径,治理算力之外的磁盘。
开放式体系架构
K8s API 唯一总线;队列复用 Kueue,分卡复用 HAMi。API 优先,与主流 AI 框架、工具链与观测栈无缝集成。
性能与设计目标
为真实共享算力而设计的编排
动态调度与配额仲裁提升吞吐量、实现公平共享,并更大限度提高卡利用率。
工作站到小集群的目标部署形态
交互 / 批处理 / 无状态 / 有状态服务
队列用 Kueue,分卡用 HAMi
调度决策可追溯、可审计
工作负载
从开发到训练和部署,统一编排
生命周期不同的负载在产品侧分页面管理,底层统一为 RunWorkload, 调度器只面对「资源请求 + 调度语义」。
开发 / 训练环境
interactiveJupyter、VS Code、SSH 交互式环境。可配置可抢占与空闲回收;单机 Sandbox,多机 JobSet 支持手动分布式训练。
训练任务
batch批处理训练与预置微调任务。有完成态、重试与分布式 gang 准入;主入口为预置任务 + 用户数据集。
无状态推理服务
statelessServicevLLM、Embedding、Web 应用等可互换副本服务。支持自动扩缩,部分副本准入是常态。
有状态 / 分布式服务
stateful · distributed向量库等有状态服务,以及 LeaderWorkerSet 多机多卡大模型推理,组间独立准入。

优势
释放算力基础设施的全部潜力
专为 AI 调度与基础设施管理打造,在 AI 全生命周期中加速工作负载,缩短价值实现时间。
更大限度提高利用率,降低算力成本
动态汇集配额、空闲借用与抢占回收,消除「人走了卡还占着」。将计算能力与项目优先级对齐,提升 ROI。
从开发到部署无缝加速 AI
开发环境 → 训练任务 → 推理服务同一平台编排。模板与资产减少重复配置,缩短从想法到可服务模型的周期。
集中式编排与全面可见性
端到端查看节点、逐卡状态、项目用量与排队原因。策略驱动治理,IT 与训练师共用一套事实源。
灵活集成,可离线交付
开放架构对接主流框架与观测栈。单机到 10 台内小集群;支持完全离线,适配高校、科研与政企内网。
用例
借助智能编排加速 AI 工作负载
为真实中小算力场景打造:提高效率、动态扩展训练与推理。
团队共享多卡工作站
5–20 人模型团队共用 1 至数台 910B / GPU 工作站。项目配额保证公平,空闲开发环境可回收,避免「抢卡大战」。
分卡并行推理与调试
在同一物理卡上并行跑调试环境与小推理服务。按显存切分提高 Token 吞吐与整体利用率,减少整卡空转。
预置微调与批处理训练
预置图像分割、分类、LLM 微调等任务。用户上传数据集、调超参即可提交;分布式训练 gang 全有或全无。
OEM 一体机搭售
随整机预装交付,OOBE 开箱激活。伙伴售前可演示配额、分卡与一键工作负载,售后减少版本兼容现场故障。
技术
通过动态编排实现加速 AI 运营
决策权自研,机制层复用生态。以最低复杂度、最高可解释性扩展 AI 运营。
控制台 · L1
- Web UI + API
- 项目 / 用户 / 角色
- 模板 · 资产 · 策略
- 配额卡片与总览
决策层 · L2
- RunWorkload operator
- QuotaGrant / DataVolume
- Policy webhook
- AdmissionCheck advisor
机制层 · 生态
- Kueue 队列与公平
- HAMi 分卡与落位
- JobSet / Sandbox
- Prometheus · OTel
部署
跨越各种环境灵活交付
三形态一套代码。默认私有化可离线——避免被误传成「只能用的云服务」。
私有化离线
- 控制面在客户机房,完全离线
- 高校 / 科研 / 政企内网主场景
- OOBE 开箱 + License 可选
- 日志与终端数据不出集群
私有化联网
- 可下载更新,不上传业务数据
- 与离线版同一套代码路径
- 适合有顾虑但非涉密客户
- 仍保留本地控制面
云端控制面
- 集群仅出站连接
- 伙伴售前演示与模板落地
- 多集群注册与心跳
- 敏感操作隧道转发不落盘
FAQ
常见问题
仓库实现进度
RunNPU 功能交付进度
141 项产品功能分层统计;Operator 看板覆盖其中 72 项职责能力
Operator 职责项平均完成度
139 项适用 · 22 完成 / 55 部分 / 62 未完成
135 项适用 · 27 完成 / 31 部分 / 77 未完成
90 项适用 · 49 完成 / 39 部分 / 2 未完成
“不适用”不计入平均完成度;mock 页面、未接真实后端及仅有底层字段的能力不计为已完成。
