Spark一：Spark介绍、技术栈与运行模式-编程知识

Spark一：Spark介绍、技术栈与运行模式

news/2025/2/21 3:48:45/文章来源:https://blog.csdn.net/eight_Jessen/article/details/135337172

一、Spark简介

Spark官网 https://spark.apache.org/

1.1 Spark是什么

Spark是一种通用的大数据计算框架，是基于RDD(弹性分布式数据集)的一种计算模型。
是一种由 Scala 语言开发的快速、通用、可扩展的大数据分析引擎。

1.2 Spark作用

中间结果输出
Spark的Job中间输出结果可以保存在内存中，从而不再需要读写HDFS
MapReduce的替代方案
Spark比MapReduce平均快10倍以上的计算速度；因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。而且兼容HDFS、Hive，可融入Hadoop的生态系统，以弥补MapReduce的不足。

1.3 Spark特点

速度快
跟MapReduce对比速度更快
易用性
支持多种开发语言
通用性
- 一栈式解决方案:批处理、交互式查询、实时流处理、图计算及机器学习
- 多种运行模式
- YARN、 Mesos、 EC2、 Kubernetes、 Standalone(独立模式)、 Local(本地模式)

二、Spark技术栈

在这里插入图片描述

Spark Core：实现了 Spark 的基本功能，包含 RDD、任务调度、内存管理、错误恢复、与存储系统交互等模块。

Spark SQL：Spark 用来操作结构化数据的程序包。通过 Spark SQL，我们可以使用 SQL 操作数据。

Spark Streaming：Spark 提供的对实时数据进行流式计算的组件。提供了用来操作数据流的 API。

Spark MLlib：提供常见的机器学习(ML)功能的程序库。包括分类、回归、聚类、协同过滤等，还提供了模型评估、数据导入等额外的支持功能。

GraphX(图计算)：Spark 中用于图计算的 API，性能良好，拥有丰富的功能和运算符，能在海量数据上自如地运行复杂的图算法。

集群管理器：Spark 设计为可以高效地在一个计算节点到数千个计算节点之间伸缩计算。

Structured Streaming：处理结构化流,统一了离线和实时的 API。

三、Spark运行模式

3.1 Local本地模式（单机模式）–学习测试使用

分为 local 单线程和 local-cluster 多线程

3.2 standalone 独立集群模式–学习测试使用

典型的 Mater/slave 模式。

3.3 standalone-HA 高可用模式–生产环境使用

基于 standalone 模式，使用 zk 搭建高可用，避免 Master 是有单点故障的。

3.4 on-yarn 集群模式–生产环境使用

运行在 yarn 集群之上，由 yarn 负责资源管理，Spark 负责任务调度和计算。
好处：计算资源按需伸缩，集群利用率高，共享底层存储，避免数据跨集群迁移。

3.5 on mesos 集群模式–国内使用较少

运行在 mesos 资源管理器框架之上，由 mesos 负责资源管理，Spark 负责任务调度和计算.

3.6 on cloud 集群模式–中小公司未来会更多的使用云服务

参考链接：https://mp.weixin.qq.com/s/caCk3mM5iXy0FaXCLkDwYQ

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.hqwc.cn/news/316560.html

如若内容造成侵权/违法违规/事实不符，请联系编程知识网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！

相关文章

Android--Jetpack--WorkManager详解

Android--Jetpack--WorkManager详解

2024已经到来，愿你安睡时，山河入梦。愿你醒来时，满目春风。愿你欢笑时，始终如一。愿你行进时，前程似锦，坦荡从容。编程语言的未来？ 目录一，定义二，特点三&#xff0c…

阅读更多...

Kubernetes 集群搭建(新人白嫖青云服务器) 一个master节点+两个工作节点

Kubernetes 集群搭建(新人白嫖青云服务器) 一个master节点+两个工作节点

文章目录 1， 购买青云服务器（白嫖）2，创建 VPC3，连接测试4，安装 docker4.1，安装docker 20.10.74.2，配置加速镜像 5，安装 Kubernetes5.1，要求5.2，设…

阅读更多...

【算法】一维、二维前缀和解决算法题（C++）

【算法】一维、二维前缀和解决算法题（C++）

文章目录 1. 前缀和算法介绍2. 一维前缀和模板引入DP34【模板】前缀和 3. 利用一维前缀和解题724.寻找数组的中心下标238.除自身以外数组的乘积560.和为K的子数组974.和可被K整除的子数组525.连续数组二维前缀和模板1314.矩阵区域和 1. 前缀和算法介绍前缀和算法用于高…

阅读更多...

opencv期末练习题（2）附带解析

opencv期末练习题（2）附带解析

图像插值与缩放 %matplotlib inline import cv2 import matplotlib.pyplot as plt def imshow(img,grayFalse,bgr_modeFalse):if gray:img cv2.cvtColor(img,cv2.COLOR_BGR2GRAY)plt.imshow(img,cmap"gray")else:if not bgr_mode:img cv2.cvtColor(img,cv2.COLOR_B…

阅读更多...

图像识别快速实现

图像识别快速实现

文本的跑通了，接下来玩玩图片场景 1. 引入模型再另起类test_qdrant_img.py，转化图片用到的模型和文本不太一样，我们这里使用ResNet-50模型 import unittest from qdrant_client.http.models import Distance, VectorParams from qdrant_cl…

阅读更多...

一起读《奔跑吧Linux内核（第2版）卷1：基础架构》- 大小端字节序

一起读《奔跑吧Linux内核（第2版）卷1：基础架构》- 大小端字节序

关注点赞不错过精彩内容大家好，我是硬核王同学，最近在做免费的嵌入式知识分享，帮助对嵌入式感兴趣的同学学习嵌入式、做项目、找工作! Hello，大家好我是硬核王同学，是一名刚刚工作一年多的Linux工程师&#xff0…

阅读更多...

【FPGA/verilog -入门学习15】vivado FPGA 数码管显示

【FPGA/verilog -入门学习15】vivado FPGA 数码管显示

1，需求：使用xc720 开发板的8个数码管显示12345678 2，需求分析： 75hc595 1，74hc595驱动，将串行数据转换成并行输出。对应研究手册 2，发送之前将要发的数据，合并成高8位:SEG,低8位&…

阅读更多...

我在CSDN的2023年

我在CSDN的2023年

一、引言在2023年的这一年当中，在CSDN的生活让我得到许多知识与启发，也让我获得一些快乐和成就二、自己的收获在这一年当中，我从一个只会看别人写的文章解决问题到，可以自己写文章帮别人解决问题，这种成就感是极大…

阅读更多...

内衣迷你洗衣机什么牌子好？四款最好用的迷你洗衣机品牌

内衣迷你洗衣机什么牌子好？四款最好用的迷你洗衣机品牌

最近这两年在洗衣机中火出圈的内衣洗衣机，它不仅可以清洁我们较难清洗的衣物，自带除菌功能，可以让衣物上的细菌，还能在清洗的过程中呵护我们衣物的面料，虽然说它是内衣洗衣机，它的功能不止可以清洗内衣&…

阅读更多...

（NeRF学习）NeRFStudio安装win11

（NeRF学习）NeRFStudio安装win11

参考： 【深度学习】【三维重建】windows11环境配置tiny-cuda-nn详细教程nerfstudio介绍及在windows上的配置、使用NeRFStudio官网githubRuntimeError: PytorchStreamReader failed reading zip archive: failed finding central directory原因及解决目录 requireme…

阅读更多...

Linux使用yum命令安装postgrepsql

Linux使用yum命令安装postgrepsql

1.检查安装源 yum search postgresql 2.安装 yum install postgresql-server 3.启动数据库 service postgresql start 4.查看启动状态 service postgresql status 5.登陆测试 su - postgrep psql \l6.远程连接 6.1修改配置文件在pg_hba.conf增加host all all 0.0.0…

阅读更多...

地产集团如何利用数据做好经营分析？

地产集团如何利用数据做好经营分析？

企业数字化转型离不开数据的支持，如何通过数据的沉淀、拉通及分析，更好的赋能业务和管理实现价值创造，是当前地产数字化面临的首要问题。一、地产集团数据处理和应用的现状目前地产集团都是多业态的发展模式，包括地产住宅开发、…

阅读更多...

推荐文章

最新文章