批处理与实时流处理
统一处理批量数据和实时数据流,可使用 Python、SQL、Scala、Java 或 R。
大规模数据分析的统一引擎Apache Spark™ 是面向数据工程、数据科学和机器学习的多语言计算引擎,支持在单机或集群上执行批处理、实时流处理、SQL 分析和机器学习任务。
Apache Spark™ 将批处理与实时流处理、分布式 SQL、规模化数据科学和机器学习整合在同一套计算引擎中,并支持多种编程语言。
统一处理批量数据和实时数据流,可使用 Python、SQL、Scala、Java 或 R。
执行 ANSI SQL 查询,支持仪表板分析和临时报告,并处理结构化表与非结构化数据。
支持在大规模数据上开展探索性数据分析,无需依赖下采样。
可在笔记本电脑上训练机器学习算法,并使用相同代码扩展到容错集群。
Spark SQL 可在运行时调整执行计划,例如自动设置 reducer 数量和连接算法。
提供下载、快速入门、最新文档、常见问题、示例、社区资源和 GitHub 源代码入口。