一、基本概念介绍 1,Spark Streaming (1)Spark Streaming 是 Apache Spark 提供的用于实时数据处理的组件。它通过将连续的实时数据流划分为一系列小批次来处理数据。这种离散的批处理操作使得 Spark Streaming 具有与传统的批处理作业相似的编程模型......
七、案例实操:各区域热门商品 Top3 1,数据说明 (1)首先 user_visit_action.txt 文件中存放了所有用户的行为记录,下面是截取其中的一部分内容: 文件中每行数据的详细字段说明如下: 编号 字段名称 字段类型 字段含义 1 date String 用户点击行为的日期 2 user_id Long 用户的 ID 3 session_id String Session 的 ID......
我在之前的文章中介绍了如何读取 HBase 表中数据转换为 RDD,以及如何将 RDD 中的数据保存到 HBase 数据库中(点击查看)。本文接着介绍如何通过 SparkSQL 来实现读写 HBase 中的数据。 六、HBase 的读取与写入 1,准备测试数据 (1)首先我们启动 HBase 的 shell 命令行工具......
五、Kafka 的读取与写入 1,准备工作 首先编辑项目的 pom.xml 文件,添加Kafka相关的依赖: 2,输出数据到 Kafka (1)这种方式输出离线处理的结果, 将已存在的数据分为若干批次进行处理,处理完毕后程序退出......
一、UDF(用户自定义函数) 1,基本介绍 UDF(User-Defined Function)是用户自定义函数,它允许我们在 Spark SQL 中创建自定义函数,以对 DataFrame 中的每个元素进行处理,并返回一个新的元素。 UDF 可以用于单个数据项的转换,类似于对 DataFrame 的某一列进行自定义操作......
一、SQL 语法 1,基本介绍 SQL 语法是一种结构化查询语言,用于处理和管理关系型数据。在 Spark SQL 中,我们可以使用标准的 SQL 查询语句来对注册的临时视图或者全局视图进行操作。 SQL 语法非常直观,对于熟悉 SQL 的用户来说非常友好......
一、使用集合或数组直接创建 DataSet 1,使用样例 下面代码我们定义了一个包含数据的集合和一个包含列名的数组。最后,我们通过调用 toDS 方法将集合转换为 DataFrame: import spark.implicits._ 作用是引入 SparkSession 中的隐式转换,具体功能如下......
一、使用集合或数组直接创建 DataFrame 1,使用样例 下面代码我们定义了一个包含数据的集合和一个包含列名的数组。最后,我们通过调用 toDF 方法将集合转换为 DataFrame: import spark.implicits._ 作用是引入 SparkSession 中的隐式转换,具体功能如下: 启用隐式转换:SparkSession 对象 spark 是一个特殊的......
十七、案例实操3:统计页面单跳转换率 1,数据准备 (1)我们有一个电商网站的用户行为数据文件 user_visit_action.txt,下面是截取里面一部分内容: 2,需求描述 (1)页面单跳转化率是网站转化率的一种统计形式。假设一个用户在一次 Session 过程中访问的页面路径 3,5,7,9,10,21,那么页面 3 跳到页面 5 叫一次单跳......
十六、案例实操2:统计 Top10 热门品类 1,数据准备 (1)我们有一个电商网站的用户行为数据文件 user_visit_action.txt,下面是截取里面一部分内容: (2)该文件主要包含用户的 4 种行为:搜索,点击,下单,支付。数据规则如下: 数据文件中每行数据采用逗号分隔数据 每一行数据表示用户的一次行为......