SparkSQL入门 整合Kudu实现广告业务数据分析

《SparkSQL入门 整合Kudu实现广告业务数据分析》是一套面向大数据开发初学者及数据分析从业人员的实战课程,围绕Spark SQL与Apache Kudu的技术整合展开,以广告业务数据分析为核心应用场景,带领学习者掌握大数据处理、结构化数据查询及实时数据分析的基本方法。课程将基础知识与实际业务需求相结合,帮助学员理解大数据技术在广告投放、用户行为分析和运营效果评估等场景中的应用,为后续学习大数据开发与数据平台建设打下坚实基础。

课程首先介绍Spark生态体系及Spark SQL的基本概念,讲解DataFrame、数据集、SQL查询、数据读取与写入等核心知识,帮助学习者熟悉Spark SQL的开发流程,掌握利用SQL语句处理大规模结构化数据的方法。同时,课程将结合实际案例介绍常见的数据清洗、过滤、聚合、分组统计及多表关联操作,让学员理解如何从原始数据中提取有价值的业务信息。

在数据存储与处理方面,课程重点引入Apache Kudu,介绍其基本架构、数据模型、表结构设计以及与Spark SQL的整合方式。通过学习数据写入、查询分析和数据更新等操作,学员能够了解Kudu在结构化数据存储与分析场景中的特点,并理解其与传统数据存储方案之间的差异,进一步掌握面向业务需求设计数据处理流程的方法。

在广告业务实战环节,课程围绕广告曝光量、点击量、点击率、转化效果及不同广告渠道的表现等常见指标展开分析,帮助学习者理解如何对广告投放数据进行统计、汇总与比较。通过构建完整的数据处理与查询流程,学员可以逐步掌握从数据接入、存储管理到指标计算和结果分析的基本实践思路。

总体而言,本课程注重技术整合与业务应用,适合具备一定SQL基础、希望学习Spark SQL和Kudu的大数据初学者,也适合数据开发工程师及数据分析人员进阶学习。通过课程实践,能够提升结构化数据处理、业务指标分析和大数据技术应用能力,为进一步学习Spark、数据仓库及企业级大数据平台开发积累经验。

课程截图:

课程目录:

└── 385 – Spark SQL极速入门 整合Kudu实现广告业务数据分析/
├── 第1章 课程介绍&学习指南/
│ └── 1-1 课程导学[2].mp4
├── 第2章 为什么要学Spark/
│ ├── 2-1 课程目录[2].mp4
│ ├── 2-2 MapReduce的槽点[2].mp4
│ ├── 2-3 Spark特性详解[2].mp4
│ ├── 2-4 Spark Stack[2].mp4
│ ├── 2-5 OOTB环境的使用[2].mp4
│ ├── 2-6 JDK部署[2].mp4
│ ├── 2-7 Maven部署[2].mp4
│ ├── 2-8 IDEA部署[2].mp4
│ ├── 2-9 HDFS部署[2].mp4
│ ├── 2-10 YARN部署[2].mp4
│ ├── 2-11 Hive部署[2].mp4
│ ├── 2-12 Spark运行模式[2].mp4
│ ├── 2-13 使用IDEA和Maven开发第一个Spark应用程序[2].mp4
│ ├── 2-14 词频统计按照单词出现次数的降序排列[2].mp4
│ ├── 2-15 local模式下spark-shell的使用[2].mp4
│ ├── 2-16 local模式下使用spark-submit提交Spark应用程序[2].mp4
│ ├── 2-17 YARN模式下提交Spark应用程序[2].mp4
│ ├── 2-18 Standalone模式下提交Spark应用程序[2].mp4
│ ├── 2-19 Hadoop和Spark生态圈对比[2].mp4
│ ├── 2-20 Hadoop与Spark对比[2].mp4
│ └── 2-21 Spark和Hadoop的相互协作[2].mp4
├── 第3章 Spark SQL快速入门/
│ ├── 3-1 课程目录[2].mp4
│ ├── 3-2 为什么需要SQL[2].mp4
│ ├── 3-3 SQL on Hadoop[2].mp4
│ ├── 3-4 详解Spark SQL是什么以及常见误区解读[2].mp4
│ ├── 3-5 Spark SQL概述[2].mp4
│ ├── 3-6 为什么要学习Spark SQL[2].mp4
│ ├── 3-7 Spark SQL架构[2].mp4
│ ├── 3-8 spark-shell使用详解[2].mp4
│ ├── 3-9 spark-sql使用详解并结合讲解Catalyst的执行过程[2].mp4
│ ├── 3-10 spark-shell启动流程分析之uname以及case匹配的使用[2].mp4
│ ├── 3-11 spark-shell启动流程分析之dirname和if的使用[2].mp4
│ ├── 3-12 spark-shell启动流程分析之传递参数详解[2].mp4
│ ├── 3-13 spark-shell启动流程分析之spark-submit[2].mp4
│ └── 3-14 spark-sql启动流程分析[2].mp4
├── 第4章 Spark SQL API编程/
│ ├── 4-1 课程目录[2].mp4
│ ├── 4-2 认知SparkSession[2].mp4
│ ├── 4-3 了解SQLContext[2].mp4
│ ├── 4-4 认识DataFrame[2].mp4
│ ├── 4-5 DataFrame API基本使用[2].mp4
│ ├── 4-6 DataFrame中前N条的取值方式[2].mp4
│ ├── 4-7 通过实战案例学习DataFrame常用API[2].mp4
│ ├── 4-8 Dataset概述及操作[2].mp4
│ ├── 4-9 DataFrame vs Dataset[2].mp4
│ ├── 4-10 Interoperating with RDD概述[2].mp4
│ ├── 4-11 实现方式一[2].mp4
│ └── 4-12 实现方式二[2].mp4
├── 第5章 Data Source API/
│ ├── 5-1 课程目录[2].mp4
│ ├── 5-2 Data Source概述[2].mp4
│ ├── 5-3 text数据源读写案例[2].mp4
│ ├── 5-4 SaveMode的使用详解[2].mp4
│ ├── 5-5 json数据源案例[2].mp4
│ ├── 5-6 Data Source API标准写法[2].mp4
│ ├── 5-7 Parquet数据源案例[2].mp4
│ ├── 5-8 Data Source格式转换[2].mp4
│ ├── 5-9 jdbc数据源案例[2].mp4
│ └── 5-10 通过统一配置参数管理工程中使用到的参数[2].mp4
├── 第6章 整合Hive操作及函数/
│ ├── 6-1 课程目录【微信992554354】[2].mp4
│ ├── 6-2 Spark对接Hive的原理及实操【微信992554354】[2].mp4
│ ├── 6-3 thriftserver&beeline的使用【微信992554354】[2].mp4
│ ├── 6-4 使用代码连接Server【微信992554354】[2].mp4
│ ├── 6-5 Server模式vs例行作业模式【微信992554354】[2].mp4
│ ├── 6-6 hive数据源案例【微信992554354】[2].mp4
│ ├── 6-7 Spark SQL内置函数实战【微信992554354】[2].mp4
│ └── 6-8 Spark SQL自定义UDF实战【微信992554354】[2].mp4
├── 第7章 Kudu入门/
│ ├── 7-1 课程目录[2].mp4
│ ├── 7-2 kudu概述&核心概念&架构[2].mp4
│ ├── 7-3 kudu部署[2].mp4
│ ├── 7-4 API操作之创建表[2].mp4
│ ├── 7-5 API操作之插入数据&删除表&数据查询[2].mp4
│ ├── 7-6 API操作之修改表数据及表名[2].mp4
│ └── 7-7 Spark整合Kudu的读写操作~1(更多IT教程 微信634631778)_免费IT课程加微信535950311[2].mp4
├── 第8章 基于Spark SQL和Kudu的广告业务项目实战(一)/
│ ├── 8-1 课程目录[2].mp4
│ ├── 8-2 广告业务背景[2].mp4
│ ├── 8-3 项目需求[2].mp4
│ ├── 8-4 项目架构及数据处理流程[2].mp4
│ ├── 8-5 日志字段说明[2].mp4
│ ├── 8-6 需求一之IP规则库解析[2].mp4
│ ├── 8-7 需求一之使用API编程完成日志ip字段解析[2].mp4
│ ├── 8-8 需求一之使用SQL方式完成日志ip字段解析[2].mp4
│ ├── 8-9 需求一之ODS数据落地到Kudu[2].mp4
│ ├── 8-10 需求一之落地到Kudu表重构[2].mp4
│ ├── 8-11 需求二功能实现[2].mp4
│ └── 8-12 需求一二代码结构大重构[2].mp4
├── 第9章 基于Spark SQL和Kudu的广告业务项目实战(二)/
│ ├── 9-1 课程目录[2].mp4
│ ├── 9-2 需求三之第一阶段统计功能实现[2].mp4
│ ├── 9-3 需求三之第二阶段统计功能实现[2].mp4
│ ├── 9-4 需求三之统计结果落地到Kudu[2].mp4
│ ├── 9-5 需求四功能实现[2].mp4
│ ├── 9-6 通过参数传递到Spark作业重构代码并打包[2].mp4
│ ├── 9-7 将项目运行在服务器上[2].mp4
│ ├── 9-8 定时调度提交Spark作业到服务器运行[2].mp4
│ └── 9-9 本章节小结[2].mp4
├── 第10章 Spark调优策略/
│ ├── 10-1 课程目录[2].mp4
│ ├── 10-2 调优之资源设置[2].mp4
│ ├── 10-3 广播变量在Spark中的使用一[2].mp4
│ ├── 10-4 广播变量在Spark中是使用二[2].mp4
│ ├── 10-5 广播变量思考题[2].mp4
│ ├── 10-6 Shuffle调优[2].mp4
│ ├── 10-7 Spark与GC相关概念理解[2].mp4
│ ├── 10-8 JVM GC引起的问题调优[2].mp4
│ └── 10-9 其他调优[2].mp4
├── 第11章 Presto初识/
│ ├── 11-1 课程目录[2].mp4
│ ├── 11-2 Presto是什么&能做什么&谁在使用它[2].mp4
│ ├── 11-3 Presto架构[2].mp4
│ ├── 11-4 Presto部署[2].mp4
│ ├── 11-5 整合MySQL Connector[2].mp4
│ ├── 11-6 整合Hive Connector[2].mp4
│ ├── 11-7 Presto整合多个Connector操作[2].mp4
│ └── 11-8 Presto API操作[2].mp4
├── 第12章 云平台建设的思考/
│ ├── 12-1 课程目录、[2].mp4
│ ├── 12-2 大数据项目和平台的差异性对比[2].mp4
│ ├── 12-3 认知云平台能为我们提供的能力[2].mp4
│ ├── 12-5 数据湖架构[2].mp4
│ ├── 12-6 数据存储和计算角度剖析[2].mp4
│ ├── 12-7 资源角度剖析[2].mp4
│ ├── 12-8 兼容性角度剖析[2].mp4
│ ├── 12-9 执行引擎和运行方式适配角度剖析[2].mp4
│ └── 12-10 Spark和Flink的选择[2].mp4
└── 课程资料/
├── sparksql极速入门/
│ ├── 安装包/
│ │ ├── apache-maven-3.6.1-bin.tar.gz
│ │ ├── hadoop-2.6.0-cdh5.15.1.tar.gz
│ │ ├── hive-1.1.0-cdh5.15.1.tar.gz
│ │ ├── jdk-8u91-linux-x64.tar.gz
│ │ └── spark-2.4.3-bin-2.6.0-cdh5.15.1.tgz
│ └── hadoop000.rar
└── 385.zip

声明:本站所发布的一切视频课程仅限用于学习和研究目的;不得将上述内容用于商业或者非法用途,否则,一切后果请用户自负。本站所有课程来自网络,版权争议与本站无关。如有侵权请联系客服QQ:1960026872或登录本站账号进入个人中心提交工单留言反馈,我们将第一时间处理!
侵权联系与免责声明: 1、本站资源所有内容均收集于网络,与本网站立场无关 2、本站所有资源收集于互联网,由用户分享,该帖子作者与IT课程网不享有任何版权,如有侵权请联系本站删除 3、本站部分内容转载自其它网站,但并不代表本站赞同其观点和对其真实性负责 4、如本帖侵犯到任何版权问题,请立即告知本站,本站将及时予与删除并致以最深的歉意。如有侵权请联系联系客服QQ:1960026872或登录本站账号进入个人中心提交工单留言反馈,我们将第一时间处理!