大数据
大数据链路可分为「采、存、算、管、用」五段。阿里云以 DataWorks 作为开发治理中枢,MaxCompute 承担离线批量计算,实时计算 Flink 版处理流式数据,Hologres 与 AnalyticDB 支撑实时数仓,Quick BI 与 DataV 完成可视化呈现。
这个分类该不该用?
大数据链路可分为「采、存、算、管、用」五段。阿里云以 DataWorks 作为开发治理中枢,MaxCompute 承担离线批量计算,实时计算 Flink 版处理流式数据,Hologres 与 AnalyticDB 支撑实时数仓,Quick BI 与 DataV 完成可视化呈现。
选型要点
- 01 离线批量计算与数仓:MaxCompute,按量或包年包月
- 02 实时流处理与 CDC 同步:实时计算 Flink 版
- 03 实时数仓与高并发点查:Hologres
- 04 开源生态自建集群:E-MapReduce(Hadoop/Spark/Hive)
- 05 日志检索与全文分析:检索分析服务 Elasticsearch 版
- 06 数据开发与调度治理:DataWorks
- 07 报表与自助分析:Quick BI
本分类产品清单
云原生大数据计算服务 MaxCompute
EB 级离线数据仓库,PB 级数据分钟级处理
- Serverless:无需管理集群,按实际计算量与存储量付费
- EB 级规模:单集群支持 EB 级存储与十万级并发作业
实时数仓 Hologres
一体化实时数仓,写入即可查、高并发低延迟
- 一体化:实时写入、点查、OLAP 分析在同一系统完成,无需多套组件拼装
- 写入即查:数据写入后立即可查,无需等待批处理,延迟秒级
实时计算 Flink 版
全托管流计算引擎,流批一体处理实时数据
- 全托管:免去 Flink 集群部署、状态后端配置与容错调优
- 流批一体:同一套 SQL 同时处理实时流与历史批数据,逻辑统一
检索分析服务 Elasticsearch 版
全文检索与日志分析的开源标准,全托管免运维
- 全托管:自动处理集群部署、扩缩容、备份与版本升级
- 全文检索强:中文分词、相关性排序、模糊匹配与高亮
开源大数据平台 E-MapReduce
云上 Hadoop 生态集群,开源组件全兼容
- 组件齐全:Hadoop、Spark、Hive、HBase、Flink、Presto、Kafk…
- 全兼容开源:使用原生开源组件与 API,无厂商锁定,代码可移植
大数据开发治理平台 DataWorks
数据开发与治理中枢,让数据链路可管可控
- 一体化开发:数据集成、开发、调度、运维在统一界面完成
- 任务调度:支持分钟级调度、复杂依赖、跨周期依赖与补数据
智能商业分析 Quick BI
自助式 BI 分析,让业务人员自己看懂数据
- 零代码分析:拖拽式操作,业务人员可自助完成分析
- 可视化丰富:40+ 图表类型,支持仪表盘、大屏与故事线
关于大数据的常见问题
MaxCompute 和自建 Hadoop 的区别?
MaxCompute 是 Serverless 服务,无需采购服务器、部署集群、调优 HDFS/YARN,且支持弹性伸缩;自建 Hadoop 灵活度与可控性更高,但需要专职团队运维,且需为峰值长期预留硬件。
按量付费会很贵吗?
关键在表设计与 SQL 优化。使用分区表并确保查询带分区条件,避免全表扫描,成本通常可控。如果不加分区直接全表扫描,大表一次查询就可能产生可观费用。
Hologres 和 ClickHouse 怎么选?
Hologres 在写入实时性、高并发点查与 PostgreSQL 兼容性上更强,适合实时数仓与在线服务;ClickHouse 在单表大宽表聚合性能上极致,适合固定模式的日志分析。需要实时写入 + 高并发查询选 Hologres。
必须配合 MaxCompute 使用吗?
不是必须,但组合使用效果最好。MaxCompute 负责海量历史数据的离线加工,Hologres 负责实时数据与对外服务,两者通过联邦查询打通。
Flink SQL 和 DataStream 怎么选?
SQL 开发效率高、易维护,覆盖 80% 以上的实时计算场景,推荐优先使用;当需要复杂自定义逻辑、自定义状态管理或精细控制时使用 DataStream API。
怎么同步 MySQL 到数仓?
使用 Flink CDC 连接器,通过 CDAS 语法一条语句即可完成整库同步。支持全量 + 增量自动切换,无需停机,是当前最推荐的数据库同步方案。