大数据基础组件发展史

01 一图看懂

下面这张长图分为两部分:同类能力的替代链(谁取代了谁)+ 时间轴(每个组件是什么、为什么出现)

02 一句话记忆

Google 出论文 → Hadoop 抄成开源(HDFS + MR)→ Hive 加 SQL → Spark 干掉 MR → Kafka + Flink 补上实时 → Hudi / Iceberg 给湖加事务 → Doris / Trino 做实时查询,HMS 被新一代 Catalog 接班

真正的主线是:存储、调度、引擎、表格式、元数据这几层不断解耦,每一层内部各自迭代替代

03 同层能力的替代关系

按解耦后的分层看,每一层内部才存在真正的"替代",跨层组件其实是搭档而不是竞争:

  • 存储:GFS → HDFS → 对象存储(S3 / OSS / MinIO)
  • 资源调度:MR1 JobTracker → YARN → Kubernetes
  • 批处理引擎:MapReduce → Spark
  • SQL 引擎:Hive on MR → Impala / Presto / SparkSQL → Trino / Doris / StarRocks
  • 表格式:Hive Table → Hudi / Iceberg / Delta
  • 元数据 Catalog:HMS → Glue / Unity / Iceberg REST Catalog
  • 流处理:Storm → Spark Streaming → Flink
  • 消息 / 日志:Kafka → Pulsar(挑战者)

04 六个时代的分水岭

  • 2003–2006 · 起源:Google 发表 GFS、MapReduce、Bigtable 三篇论文,直接催生了 HDFS / Hadoop MR / HBase
  • 2006–2010 · Hadoop 生态:HDFS + MR 成开源事实标准;Hive 顺手发明了 HMS,成为之后十几年的元数据默认底座
  • 2011–2014 · YARN + Spark:资源调度从 MR 里剥离出来,Spark 用内存 DAG 把 MR 淘汰出批处理主流
  • 2011–2016 · 实时化:Kafka 成为管道中枢;流处理从 Storm 的"逐条低延迟弱语义",经 Spark Streaming 的微批,落到 Flink 的"真流 + exactly-once"
  • 2017–2020 · 湖仓时代:Hudi / Iceberg / Delta 把 ACID、upsert、schema 演进这些数据库能力下沉到文件层,云上对象存储彻底压过 HDFS
  • 2020–至今 · 现代:Doris / StarRocks / Trino 承接实时 OLAP,Glue / Unity / Iceberg REST Catalog 开始替换 HMS,Spark / Flink on K8s 逐步取代 YARN
最后更新时间 8/5/2026, 8:45:04 PM