搜索关键字：spark 大数据 hadoop spark-sql，搜索到29965个结果！码迷,mamicode.com！

Hive 操作与应用词频统计

一、hive用本地文件进行词频统计 1.准备本地txt文件 2.启动hadoop，启动hive 3.创建数据库，创建文本表 4.映射本地文件的数据到文本表中 5.hql语句进行词频统计交将结果保存到结果表中。 6.查看统计结果二、hive用HDFS上的文件进行词频统计 1.准备电子书或其它大的文本 ...

分类：其他好文时间：2020-12-10 10:59:18 阅读次数：4

Hive 操作与应用词频统计

一、hive用本地文件进行词频统计 1.准备本地txt文件 2.启动hadoop，启动hive 3.创建数据库，创建文本表 4.映射本地文件的数据到文本表中 5.hql语句进行词频统计交将结果保存到结果表中。 6.查看统计结果二、hive用HDFS上的文件进行词频统计 1.准备电子书或其它大的文本 ...

分类：其他好文时间：2020-12-10 10:55:10 阅读次数：3

HADOOP之HDFS用idea操作(五)

使用idea操作HDFS、创建文件、上传文件、获取块信息、下载文件 1.搭建maven工程 2.pom依赖  <dependency> <groupI ...

分类：其他好文时间：2020-12-09 12:24:14 阅读次数：6

Hive 操作与应用词频统计

一、hive用本地文件进行词频统计 1.准备本地txt文件 mkdir wc cd wc echo "hadoop hbase" > f1.txt echo "hadoop hive" > f2.txt 2.启动hadoop，启动hive start-all.sh hive 3.创建数据库，创建文本 ...

分类：其他好文时间：2020-12-09 12:15:14 阅读次数：5

Spark存储Parquet数据到Hive，对map、array、struct字段类型的处理

利用Spark往Hive中存储parquet数据，针对一些复杂数据类型如map、array、struct的处理遇到的问题？为了更好的说明导致问题 ...

分类：其他好文时间：2020-12-08 12:44:11 阅读次数：4

基于云原生的大数据实时分析方案实践

1方案介绍大数据处理技术现今已广泛应用于各个行业，为业务解决海量存储和海量分析的需求。但数据量的爆发式增长，对数据处理能力提出了更大的挑战，同时对时效性也提出了更高的要求。实时分析已成为企业大数据分析中最关键的术语，这意味企业可将所有数据用于大数据实时分析，实现在数据接受同时即刻为企业生成分析报告，从而在第一时间作出市场判断与决策。典型的场景如电商大促和金融风控等，基于延迟数据的分析结果已经失去了

分类：其他好文时间：2020-12-07 12:19:18 阅读次数：6

不需建模型，轻松处理数据的透视分析

?进行数据分析的时候，我们会根据分析的数据内容选择合适的图表来进行数据可视化分析和展示，对较大数据进行汇总分析时，我们常常会用到数据透视表，但是，excel里做数据透视表很复杂，总是记不了步骤，也经常点错，每次使用都得重头做一遍。是否有什么软件可以拖拖拽拽，快速制作数据透视表？有！就是Smartbi ...

分类：其他好文时间：2020-12-07 12:00:40 阅读次数：4

部署单机版的hadoop+hive小记

前言在本机模拟器的ubuntu18版本上进行的部署测试，参考的官方文档： hadoop: 链接地址 hive: 链接地址使用的版本： hadoop: 3.2.1 hive: 3.1.2 全程是使用root账号进行的配置。 hadoop安装配置 hadoop使用的是虚拟集群，即单机模拟集群，dat ...

分类：其他好文时间：2020-12-05 10:52:38 阅读次数：7

按位使用数据以及union

按位使用数据以及union 例如：typedef union tagData{ long x:2; long y:4; long data;}data_item,*pdata_item; 上述是一个联合体，联合体的对象用的空间是类型中占用内存最大的哪个，例如上例中data_item变量占用4个字节。 ...

分类：其他好文时间：2020-12-04 11:18:07 阅读次数：7

图解Spark系列：RDD的创建与执行

设计Spark程式过程中最初始的是创建RDD数据集，该数据集来自定义的源数据，当RDD数据集初始后，再通过算子对RDD数据集作转换生成后续的数据集。Spark中提供了多种创建RDD数据集的方法，比如：通过内存集合创建、或使用本地文件创建以及HDFS文件创建RDD数据集。最常见的是第三种方式，生产环境下通常会读取并基于HDFS上存储的数据来创建并进行离线批处理。典型的RDD创建流程为，通过输入算子（

分类：其他好文时间：2020-12-04 10:59:58 阅读次数：4