人工智能 支持免费试用

模型在线服务 PAI-EAS

弹性模型推理服务,把模型变成稳定的在线 API

模型在线服务 PAI-EAS(Elastic Algorithm Service)是面向模型部署的弹性推理服务平台,支持将训练好的模型一键部署为高可用在线 API。EAS 支持按量付费与常驻实例两种模式,具备自动扩缩容、多版本管理与灰度发布能力,是模型上线的标准方案。

产品概述

模型在线服务 PAI-EAS(Elastic Algorithm Service)是面向模型部署的弹性推理服务平台,支持将训练好的模型一键部署为高可用在线 API。EAS 支持按量付费与常驻实例两种模式,具备自动扩缩容、多版本管理与灰度发布能力,是模型上线的标准方案。

一键部署:支持主流框架模型与自定义镜像,几分钟内完成上线
弹性伸缩:按 QPS 或 GPU 利用率自动扩缩容,闲时缩容降低成本
高可用:多实例负载均衡与健康检查,实例故障自动摘除
多版本与灰度:支持模型多版本共存与按流量比例灰度发布
推理加速:集成 BladeLLM 等加速框架,显著提升吞吐、降低成本
最适合谁

有自研模型需要上线提供推理服务的团队;需要为多个模型统一提供 API 的算法中台;希望按实际调用量付费、避免 GPU 长期闲置的业务。

规格速查

以下参数用于快速比对本产品的核心能力边界。

支持模型 PyTorch、TensorFlow、ONNX、XGBoost、HuggingFace、自定义镜像
部署方式 按量付费、常驻实例、弹性资源组
扩缩容 按 QPS、GPU 利用率、自定义指标自动伸缩
加速 BladeLLM、TensorRT、量化与蒸馏支持
版本管理 多版本共存、灰度发布、一键回滚
监控 QPS、延迟、GPU 利用率、错误率
GPU 类型 A10、L20、V100、A100 等
调用方式 HTTP API、gRPC

价格与计费

价格为整理时的参考区间,实际以下单页面为准。计费模式:按量付费(实例时长) · 包年包月(常驻实例) · 弹性伸缩按实际用量。

套餐 / 规格 配置说明 参考价格 备注
CPU 实例 按规格 按量 元/小时 小模型与预处理
GPU 实例 A10 / L20 等 按量 元/小时 深度学习推理
常驻实例 包年包月 低至 5 折 稳定流量更省
弹性伸缩 闲时缩容 按实际用量 按量付费
按量付费(实例时长)包年包月(常驻实例)弹性伸缩按实际用量

省钱提示:长期稳定负载优先包年包月并叠加节省计划;无状态批处理可用抢占式实例,成本可低至按量价的 10%。 查看成本优化指南 →

适用场景

大模型推理服务 图像识别 API 服务 推荐模型在线推理 NLP 模型服务化 多模型统一部署管理 A/B 测试与灰度发布

功能拆解

多框架支持

原生支持 PyTorch、TensorFlow、ONNX 等主流框架的模型格式,也支持通过自定义镜像部署任意推理环境,适配各类模型资产。

弹性扩缩容

根据 QPS、GPU 利用率或自定义指标自动增减实例。业务高峰期自动扩容保证响应,低谷期自动缩容避免为闲置 GPU 付费。

推理加速

集成 BladeLLM 大模型推理加速框架,通过连续批处理、PagedAttention、量化等技术显著提升吞吐,可把单位推理成本降低数倍。

多版本与灰度

同一服务可部署多个模型版本,按流量比例分配。新模型可先小流量灰度验证效果,确认无误后全量切换,出问题一键回滚。

全链路监控

提供服务级与实例级的 QPS、响应延迟、GPU 利用率、显存占用与错误率监控,配合告警及时发现性能退化与异常。

与 PAI 无缝衔接

在 PAI 平台训练完成的模型可直接部署到 EAS,模型版本与血缘信息自动关联,形成从训练到上线的完整闭环。

常见问题

EAS 和 GPU 云服务器自建推理有什么区别?

EAS 免去了服务框架搭建、负载均衡、健康检查、扩缩容与监控的工作,按实例时长计费;自建 GPU 服务器灵活度更高但需要自行实现全套服务化能力,且需为 24 小时常驻付费。

大模型推理成本怎么降?

三个方向:一是使用推理加速框架(如 BladeLLM)提升吞吐;二是使用量化(INT8/INT4)降低显存占用与计算量;三是配置弹性伸缩,在低峰期缩容。

支持流式输出吗?

支持。EAS 部署的大模型服务可提供 SSE 流式输出接口,配合前端实现打字机效果,显著改善大模型应用的交互体验。

相关产品

准备使用 PAI-EAS?

新用户可先领取免费试用额度验证,再决定购买配置与时长。

  • 一键部署
  • 弹性伸缩
  • 高可用