全栈 AI 基础设施
从单一GPU实例到大规模裸金属集群。以三种服务形态满足客户的各类AI基础设施需求。可用配置和提供条件将单独告知。
服务提供流程
需求调研
详细了解客户的AI工作负载、需求和预算。
方案设计
设计最优服务形态和基础设施配置,制作详细提案书。
导入建设
获批后,专业团队迅速可靠地完成导入和建设。
运营优化
上线后持续监控和优化,持续支撑客户的AI基础设施。
公有云
面向开发者的按需计算服务。可快速启动Jupyter Notebook和ML环境,采用按量计费模式,支持小规模起步。
- 快速启动环境 — 快速启动Jupyter Notebook和ML环境,立即开始开发。
- 按量计费模式 — 灵活的按用量付费体系,降低初始成本。
- 丰富的GPU选择 — 可从单一实例使用NVIDIA H100、A100、L40S等最新GPU。
- 开发者友好 — 通过REST API、CLI、Web控制台管理资源,可集成到DevOps工作流。
800G
InfiniBand
5,000
Max GPU
専有
Bare-Metal
※ 800G InfiniBand及最多5,000个GPU通过合作伙伴设施提供。配置和条件将单独告知。
私有AI集群
面向Tier-1客户的裸金属集群。通过高速网络架构构建大规模GPU集群,在专有环境中实现稳定性能。可用配置和提供条件将单独告知。
超低延迟、超高带宽网络,优化GPU节点间通信。
提供适用于大规模LLM训练和仿真的GPU集群配置方案。
完全专有环境,不与其他租户共享资源,确保安全性和稳定性。
根据客户需求定制网络配置、存储、冷却系统。
基础设施配置概要
高速
网络
支持InfiniBand
大规模
GPU规模
裸金属
快速
启动时间
云环境
高可用
可用性
条件单独告知
托管AI工厂
全托管运营服务。bloomax负责建设和运营包含高速网络、NVMe分层存储、Slurm编排的环境,为客户提供专注于AI工作负载的环境。
- Slurm编排 — 使用行业标准Slurm作业调度器,高效管理大规模HPC工作负载。
- NVMe分层存储 — 结合高速NVMe SSD和大容量HDD的分层存储,优化I/O性能。
- 高速网络 — 高带宽网络优化节点间通信,提升训练效率。
- 全托管运营 — 监控、故障处理、维护全部代劳,客户可专注于AI开发。
比较三种服务形态
| 公有云GPU | 私有AI集群 | 托管AI工厂 | |
|---|---|---|---|
| 适用场景 | 开发、验证、小规模起步 | 大规模LLM训练和推理 | AI工作负载的持续运营 |
| 环境形态 | 按需使用(按量计费) | 专有(裸金属) | 全托管(详情单独告知) |
| 建设·运营负责范围 | 客户自行管理 | bloomax支持建设(运营体制单独商议) | bloomax负责建设和运营 |
| 咨询时的确认事项 | GPU类型、使用量、使用期限 | GPU数量、网络需求、安全需求 | 工作负载内容、SLA要求、运营体制 |
公有云GPU
适用场景
开发、验证、小规模起步
环境形态
按需使用(按量计费)
建设·运营负责范围
客户自行管理
咨询时的确认事项
GPU类型、使用量、使用期限
私有AI集群
适用场景
大规模LLM训练和推理
环境形态
专有(裸金属)
建设·运营负责范围
bloomax支持建设(运营体制单独商议)
咨询时的确认事项
GPU数量、网络需求、安全需求
托管AI工厂
适用场景
AI工作负载的持续运营
环境形态
全托管(详情单独告知)
建设·运营负责范围
bloomax负责建设和运营
咨询时的确认事项
工作负载内容、SLA要求、运营体制
各服务的提供条件、价格和覆盖范围将单独告知。下表基于目前公开的信息。