Apache Spark™

Apache Spark™

大规模数据分析的统一引擎Apache Spark™ 是面向数据工程、数据科学和机器学习的多语言计算引擎,支持在单机或集群上执行批处理、实时流处理、SQL 分析和机器学习任务。

Apache Spark™ 页面快照
5种
支持的主要编程语言:Python、SQL、Scala、Java 和 R
2,000+
开源项目贡献者,来自产业界与学术界
80%
来源页面所述使用 Apache Spark™ 的财富 500 强企业比例
8倍
来源页面所述自适应查询执行对 TPC-DS 1TB 查询的最高加速幅度
核心能力

统一处理数据、分析与机器学习工作负载

Apache Spark™ 将批处理与实时流处理、分布式 SQL、规模化数据科学和机器学习整合在同一套计算引擎中,并支持多种编程语言。

批处理与实时流处理

统一处理批量数据和实时数据流,可使用 Python、SQL、Scala、Java 或 R。

分布式 SQL 分析

执行 ANSI SQL 查询,支持仪表板分析和临时报告,并处理结构化表与非结构化数据。

规模化数据科学

支持在大规模数据上开展探索性数据分析,无需依赖下采样。

分布式机器学习

可在笔记本电脑上训练机器学习算法,并使用相同代码扩展到容错集群。

自适应查询执行

Spark SQL 可在运行时调整执行计划,例如自动设置 reducer 数量和连接算法。

官方资源

从安装、文档到源代码

提供下载、快速入门、最新文档、常见问题、示例、社区资源和 GitHub 源代码入口。

Apache Spark™

从这里开始使用Apache Spark™。