按精度选卡
FP32 训练优先选 A100/V100;FP16/INT8 推理选 L20 或 A10;显存需求超过 40 GB 时选 A100 80 GB 或多卡 NVLink 方案。
输入关键词开始搜索,支持产品名、别名、场景与关键词。
GPU 云服务器基于 NVIDIA 与阿里云自研 PPU 加速卡,提供从单卡推理到千卡集群的异构计算能力。gn8/gn7 系列覆盖 L20、A10、V100、A100 等主流加速卡,配合 PAI 平台与 ACK 容器服务可快速构建分布式训练与在线推理集群,按量付费让算力成本与业务节奏对齐。
需要自建模型训练或推理环境、对 GPU 型号与显存有明确要求的团队;希望通过抢占式实例大幅降低算力成本的 AI 初创公司;需要短时大规模算力做实验或渲染的项目。
以下参数用于快速比对本产品的核心能力边界。
| GPU 型号 | NVIDIA L20(48 GB)、A10(24 GB)、V100(16/32 GB)、A100(40/80 GB)、阿里云 PPU |
|---|---|
| 单机 GPU 数 | 1 / 2 / 4 / 8 卡 |
| 配套 vCPU | 8 – 96 vCPU |
| 配套内存 | 32 – 768 GiB |
| 互联 | NVLink / NVSwitch(多卡机型) |
| 本地存储 | NVMe SSD,部分机型最高数 TB |
| 镜像 | PyTorch、TensorFlow、CUDA、NGC 容器镜像 |
| 典型网络 | 最高 100 Gbps 内网(RDMA 支持) |
价格为整理时的参考区间,实际以下单页面为准。计费模式:按量付费(推荐) · 包年包月 · 抢占式实例 · 节省计划。
| 套餐 / 规格 | 配置说明 | 参考价格 | 备注 |
|---|---|---|---|
| gn7i(推理) | 1 × A10 24 GB / 8 vCPU / 32 GiB | 6.4 元/小时 起 | 性价比推理卡 |
| gn8is(推理/微调) | 1 × L20 48 GB / 24 vCPU / 96 GiB | 12.8 元/小时 起 | 当前主力机型 |
| gn8v(训练) | 8 × A100 80 GB / 96 vCPU / 768 GiB | 168 元/小时 起 | 大模型训练 |
| 抢占式实例 | 同规格,可被回收 | 按量价 30%–50% | 适合可中断训练任务 |
省钱提示:长期稳定负载优先包年包月并叠加节省计划;无状态批处理可用抢占式实例,成本可低至按量价的 10%。 查看成本优化指南 →
FP32 训练优先选 A100/V100;FP16/INT8 推理选 L20 或 A10;显存需求超过 40 GB 时选 A100 80 GB 或多卡 NVLink 方案。
通过 ACK 容器服务或 PAI 平台组建多机多卡训练集群,支持 Horovod、DeepSpeed、Megatron 等分布式框架,RDMA 网络降低通信瓶颈。
无状态、可 checkpoint 的训练任务可使用抢占式实例,价格仅为按量付费的 30%–50%,配合自动重试机制可获得极高性价比。
提供预装 CUDA、cuDNN、PyTorch、TensorFlow 的公共镜像与 NGC 容器镜像,开箱即用,避免环境配置耗时。
结合 PAI-EAS 模型在线服务或 BladeLLM 推理加速框架,可显著提升吞吐、降低单次推理成本。
取决于模型参数量与微调方式。7B 模型全量微调建议 8 卡 A100 起;13B–70B 需要多机多卡;如果使用 LoRA 等参数高效微调方法,单卡 80 GB 或双卡即可起步。
GPU 实例提供底层算力,PAI 平台提供任务调度、分布式训练框架与模型服务能力。生产环境推荐用 PAI 管理 GPU 集群,避免手工维护多机环境。
需要实现 checkpoint 机制:训练脚本定期保存模型权重与优化器状态,实例被回收后从最近 checkpoint 恢复。同时配合弹性伸缩自动补充实例。
7B 级模型用单张 L20(48 GB)可承载中等并发;如果并发很高或需要更低的单次成本,考虑多卡 L20 或多实例部署 + 负载均衡。
弹性可伸缩的 IaaS 级计算服务,阿里云最核心的产品
从数据标注到模型训练的全链路 AI 工程平台
弹性模型推理服务,把模型变成稳定的在线 API
一站式大模型应用开发平台,从调用到 Agent 编排