Spark (产品编号:2953)
Apache Spark是一个用于大规模数据处理的快速通用引擎。
标签:
数据分析
算法
机器学习
下载量: 下载量:0
收藏: 收藏:0
查看价格
试用下载
温馨提示:本产品的分类与介绍仅供参考,具体以商家网站介绍为准,如有疑问请来电023-62585653咨询。
产品介绍
动态
下载
购买
资源
Spark
Apache Spark 是 UC Berkeley AMP 实验室开源的通用并行框架,类似于 Hadoop MapReduce,但能将作业中间结果保存在内存中,从而避免频繁读写 HDFS。它更适合数据挖掘与机器学习等需要迭代计算的算法。
核心功能
- 高速:内存中运行比 Hadoop MapReduce 快上百倍,磁盘快数十倍。
- 先进的 DAG 执行引擎,支持循环数据流与内存计算。
- 易用:支持 Java、Scala、Python、R 快速编写程序。
- 提供 80 多个高阶运算符,便于构建并行应用。
- 通用:可无缝结合 SQL、流处理与复杂分析。
- 组件库堆栈包括 SQL/DataFrames、MLlib、GraphX、Spark Streaming。
- 无处不在:可运行于 Hadoop、Mesos、Standalone 与云端。
- 可访问 HDFS、Cassandra、HBase、Hive、S3 等多种数据源。
适用场景
适用于机器学习、迭代算法、流处理与交互式数据分析等场景。对需要在内存中反复迭代、追求高吞吐的大数据团队较为合适。
技术规格与支持平台
- Apache Spark
- Scala/Java/Python/R
- Hadoop/云
- 授权形态:商业软件(需授权使用)
渝公网安备50010702505508