多框架支持
原生支持 PyTorch、TensorFlow、ONNX 等主流框架的模型格式,也支持通过自定义镜像部署任意推理环境,适配各类模型资产。
输入关键词开始搜索,支持产品名、别名、场景与关键词。
模型在线服务 PAI-EAS(Elastic Algorithm Service)是面向模型部署的弹性推理服务平台,支持将训练好的模型一键部署为高可用在线 API。EAS 支持按量付费与常驻实例两种模式,具备自动扩缩容、多版本管理与灰度发布能力,是模型上线的标准方案。
有自研模型需要上线提供推理服务的团队;需要为多个模型统一提供 API 的算法中台;希望按实际调用量付费、避免 GPU 长期闲置的业务。
以下参数用于快速比对本产品的核心能力边界。
| 支持模型 | PyTorch、TensorFlow、ONNX、XGBoost、HuggingFace、自定义镜像 |
|---|---|
| 部署方式 | 按量付费、常驻实例、弹性资源组 |
| 扩缩容 | 按 QPS、GPU 利用率、自定义指标自动伸缩 |
| 加速 | BladeLLM、TensorRT、量化与蒸馏支持 |
| 版本管理 | 多版本共存、灰度发布、一键回滚 |
| 监控 | QPS、延迟、GPU 利用率、错误率 |
| GPU 类型 | A10、L20、V100、A100 等 |
| 调用方式 | HTTP API、gRPC |
价格为整理时的参考区间,实际以下单页面为准。计费模式:按量付费(实例时长) · 包年包月(常驻实例) · 弹性伸缩按实际用量。
| 套餐 / 规格 | 配置说明 | 参考价格 | 备注 |
|---|---|---|---|
| CPU 实例 | 按规格 | 按量 元/小时 | 小模型与预处理 |
| GPU 实例 | A10 / L20 等 | 按量 元/小时 | 深度学习推理 |
| 常驻实例 | 包年包月 | 低至 5 折 | 稳定流量更省 |
| 弹性伸缩 | 闲时缩容 | 按实际用量 | 按量付费 |
省钱提示:长期稳定负载优先包年包月并叠加节省计划;无状态批处理可用抢占式实例,成本可低至按量价的 10%。 查看成本优化指南 →
原生支持 PyTorch、TensorFlow、ONNX 等主流框架的模型格式,也支持通过自定义镜像部署任意推理环境,适配各类模型资产。
根据 QPS、GPU 利用率或自定义指标自动增减实例。业务高峰期自动扩容保证响应,低谷期自动缩容避免为闲置 GPU 付费。
集成 BladeLLM 大模型推理加速框架,通过连续批处理、PagedAttention、量化等技术显著提升吞吐,可把单位推理成本降低数倍。
同一服务可部署多个模型版本,按流量比例分配。新模型可先小流量灰度验证效果,确认无误后全量切换,出问题一键回滚。
提供服务级与实例级的 QPS、响应延迟、GPU 利用率、显存占用与错误率监控,配合告警及时发现性能退化与异常。
在 PAI 平台训练完成的模型可直接部署到 EAS,模型版本与血缘信息自动关联,形成从训练到上线的完整闭环。
EAS 免去了服务框架搭建、负载均衡、健康检查、扩缩容与监控的工作,按实例时长计费;自建 GPU 服务器灵活度更高但需要自行实现全套服务化能力,且需为 24 小时常驻付费。
三个方向:一是使用推理加速框架(如 BladeLLM)提升吞吐;二是使用量化(INT8/INT4)降低显存占用与计算量;三是配置弹性伸缩,在低峰期缩容。
支持。EAS 部署的大模型服务可提供 SSE 流式输出接口,配合前端实现打字机效果,显著改善大模型应用的交互体验。
从数据标注到模型训练的全链路 AI 工程平台
国产开源大模型旗舰,全模态能力覆盖
一站式大模型应用开发平台,从调用到 Agent 编排
面向 AI 训练、推理与图形渲染的异构算力