计算 热门 支持免费试用

GPU 云服务器

面向 AI 训练、推理与图形渲染的异构算力

GPU 云服务器基于 NVIDIA 与阿里云自研 PPU 加速卡,提供从单卡推理到千卡集群的异构计算能力。gn8/gn7 系列覆盖 L20、A10、V100、A100 等主流加速卡,配合 PAI 平台与 ACK 容器服务可快速构建分布式训练与在线推理集群,按量付费让算力成本与业务节奏对齐。

产品概述

GPU 云服务器基于 NVIDIA 与阿里云自研 PPU 加速卡,提供从单卡推理到千卡集群的异构计算能力。gn8/gn7 系列覆盖 L20、A10、V100、A100 等主流加速卡,配合 PAI 平台与 ACK 容器服务可快速构建分布式训练与在线推理集群,按量付费让算力成本与业务节奏对齐。

加速卡选择多:NVIDIA L20 / A10 / V100 / A100 与阿里云自研 PPU,按精度与显存需求匹配
整机交付:单实例最高 8 卡,支持 NVLink/NVSwitch 高速互联,适合大模型训练
弹性与抢占:支持按量付费与抢占式实例,AI 训练任务成本可下降 50%–70%
生态完整:预装 CUDA、cuDNN、PyTorch、TensorFlow 等深度学习框架镜像
与 PAI 深度集成:一键接入人工智能平台 PAI,获得分布式训练与模型服务能力
最适合谁

需要自建模型训练或推理环境、对 GPU 型号与显存有明确要求的团队;希望通过抢占式实例大幅降低算力成本的 AI 初创公司;需要短时大规模算力做实验或渲染的项目。

规格速查

以下参数用于快速比对本产品的核心能力边界。

GPU 型号 NVIDIA L20(48 GB)、A10(24 GB)、V100(16/32 GB)、A100(40/80 GB)、阿里云 PPU
单机 GPU 数 1 / 2 / 4 / 8 卡
配套 vCPU 8 – 96 vCPU
配套内存 32 – 768 GiB
互联 NVLink / NVSwitch(多卡机型)
本地存储 NVMe SSD,部分机型最高数 TB
镜像 PyTorch、TensorFlow、CUDA、NGC 容器镜像
典型网络 最高 100 Gbps 内网(RDMA 支持)

价格与计费

价格为整理时的参考区间,实际以下单页面为准。计费模式:按量付费(推荐) · 包年包月 · 抢占式实例 · 节省计划。

套餐 / 规格 配置说明 参考价格 备注
gn7i(推理) 1 × A10 24 GB / 8 vCPU / 32 GiB 6.4 元/小时 起 性价比推理卡
gn8is(推理/微调) 1 × L20 48 GB / 24 vCPU / 96 GiB 12.8 元/小时 起 当前主力机型
gn8v(训练) 8 × A100 80 GB / 96 vCPU / 768 GiB 168 元/小时 起 大模型训练
抢占式实例 同规格,可被回收 按量价 30%–50% 适合可中断训练任务
按量付费(推荐)包年包月抢占式实例节省计划

省钱提示:长期稳定负载优先包年包月并叠加节省计划;无状态批处理可用抢占式实例,成本可低至按量价的 10%。 查看成本优化指南 →

适用场景

大语言模型训练与微调 AI 推理服务部署 计算机视觉与图像生成 自动驾驶仿真 科学计算与分子动力学 影视渲染与云游戏 视频智能分析

功能拆解

按精度选卡

FP32 训练优先选 A100/V100;FP16/INT8 推理选 L20 或 A10;显存需求超过 40 GB 时选 A100 80 GB 或多卡 NVLink 方案。

分布式训练

通过 ACK 容器服务或 PAI 平台组建多机多卡训练集群,支持 Horovod、DeepSpeed、Megatron 等分布式框架,RDMA 网络降低通信瓶颈。

抢占式实例

无状态、可 checkpoint 的训练任务可使用抢占式实例,价格仅为按量付费的 30%–50%,配合自动重试机制可获得极高性价比。

框架镜像

提供预装 CUDA、cuDNN、PyTorch、TensorFlow 的公共镜像与 NGC 容器镜像,开箱即用,避免环境配置耗时。

推理加速

结合 PAI-EAS 模型在线服务或 BladeLLM 推理加速框架,可显著提升吞吐、降低单次推理成本。

常见问题

训练大模型需要多少张卡?

取决于模型参数量与微调方式。7B 模型全量微调建议 8 卡 A100 起;13B–70B 需要多机多卡;如果使用 LoRA 等参数高效微调方法,单卡 80 GB 或双卡即可起步。

GPU 实例和 PAI 平台怎么配合?

GPU 实例提供底层算力,PAI 平台提供任务调度、分布式训练框架与模型服务能力。生产环境推荐用 PAI 管理 GPU 集群,避免手工维护多机环境。

抢占式实例被回收怎么办?

需要实现 checkpoint 机制:训练脚本定期保存模型权重与优化器状态,实例被回收后从最近 checkpoint 恢复。同时配合弹性伸缩自动补充实例。

推理用哪种卡性价比高?

7B 级模型用单张 L20(48 GB)可承载中等并发;如果并发很高或需要更低的单次成本,考虑多卡 L20 或多实例部署 + 负载均衡。

相关产品

准备使用 GPU 云服务器?

新用户可先领取免费试用额度验证,再决定购买配置与时长。

  • 加速卡选择多
  • 整机交付
  • 弹性与抢占