简介 codec其实就是coder和decoder两个单词的词头组成的缩略词。CompressionCodec定义了压缩和解压缩接口,我们这里讲的codec就是实现了CompressionCodec接口的一些压缩格式的类,下面就是这些类的列表: 使用CompressionCodecs解压缩 Comp
分类:
其他好文 时间:
2016-01-31 21:11:36
阅读次数:
387
Hive默认是静态分区,我们在插入数据的时候要手动设置分区,如果源数据量很大的时候,那么针对一个分区就要写一个insert,比如说,我们有很多日志数据,我们要按日期作为分区字段,在插入数据的时候我们不可能手动的去添加分区,那样太麻烦了。还好,Hive提供了动态分区,动态分区简化了我们插入数据时的繁琐
分类:
其他好文 时间:
2016-01-31 21:12:31
阅读次数:
395
如图是效果图 我用的是SlidingMenu-master框架来实现的 左边的是侧滑界面是一个fragment,右边是一个主界面fragment,在主界面中用的是一个ViewPager来进行切换,自定义个NoScrollViewPager(不能左右划的ViewPager) 如下是主界面的代码 pac
分类:
其他好文 时间:
2016-01-31 21:12:41
阅读次数:
185
Hive中的Map Join即map side join工作原理是在Map端把小表加载到内存中,然后读取大表,和内存中的小表完成连接操作。MapJoin使用了分布式缓存技术。 Map Join的优点: 1.不消耗集群的reduce资源。 2.减少了reduce操作,加快了程序执行。 3.降低网络负载
分类:
其他好文 时间:
2016-01-31 21:13:22
阅读次数:
397
一:背景 在MapReduce模型中,reduce的功能大多是统计分类类型的总量、求最大值最小值等,对于这些操作可以考虑在Map输出后进行Combiner操作,这样可以减少网络传输负载,同时减轻reduce任务的负担。Combiner操作是运行在每个节点上的,只会影响本地Map的输出结果,Combi
分类:
其他好文 时间:
2016-01-31 21:13:04
阅读次数:
259
一:背景 在上一篇文章中我们可以对两列数据进行排序,即完成了当第一列相同时第二列数据升序排列的功能,现在我们需要进一步完善一个功能,那就是当第一列相同时求出第二列的最小值或最大值,Hadoop提供了自定义分组的功能,可以满足我们的需求。 二:技术实现 我们先来看看需求 #当第一列不相等时,第一列按升
分类:
其他好文 时间:
2016-01-31 21:12:43
阅读次数:
295
这是本人第一次使用maven这个东西。确切的说,我是一个刚刚毕业的小白程序员,对于这个比首都面貌发展还快的互联网世界,显然在学校里学习的东西都太基础了,不过基础点也好,能最起码对于我们程序员来说,有共同认知的部分,证明还没有脱离队伍太远。废话就不多说了。 本次的学习呢。主要是http://www.c
分类:
其他好文 时间:
2016-01-31 21:11:07
阅读次数:
507
MapReduce Counter为我们提供了一个窗口:观察MapReduce job运行期的各种细节数据。今年三月份,我曾专注于MapReduce性能调优工作,是否优化的绝大多评估都是基于这些Counter的数值表现。MapReduce自带了许多默认Counter,可能有些朋友对它们有些疑问,现在
分类:
其他好文 时间:
2016-01-31 21:10:49
阅读次数:
205
一:背景 很多数据源中的数据都是含有大量重复的,为此我们需要将重复的数据去掉,这也称为数据的清洗,MapReduce从Map端到Reduce端的Shuffle过程天生就有去重的功能,但是这是对输出的Key作为参照进行去重的。所以我们可以将Map端读入Value作为Key输出,就可以很方便的实现去重了
分类:
其他好文 时间:
2016-01-31 21:10:24
阅读次数:
213
对于每一个表(table)或者分区,Hive可以进一步组织成桶。Hive也是针对某一列进行桶的组织。Hive采用对列值哈希,然后除于桶的个数求余的方式决定该条记录存放在哪个桶当中。采用桶能够带来一些好处,比如JOIN操作。对于JOIN操作两个表有一个相同的列,如果对这两个表都进行了桶操作。那么将保存
分类:
其他好文 时间:
2016-01-31 21:07:37
阅读次数:
217
5.2.从数据中提取合适的特征 [root@demo1 ch05]# sed 1d train.tsv > train_noheader.tsv[root@demo1 ch05]# lltotal 42920-rw-r--r-- 1 root root 21972457 Jan 31 15:03 t
分类:
其他好文 时间:
2016-01-31 21:08:04
阅读次数:
319
1 # include<iostream> 2 # include<string> 3 # include<cstring> 4 using namespace std; 5 struct bigint{ //定义一个大整数类 6 int a[500]; 7 int remain; 8 int i;
分类:
其他好文 时间:
2016-01-31 21:09:08
阅读次数:
207
一:order by order by会对输入做全局排序,因此只有一个Reducer(多个Reducer无法保证全局有序),然而只有一个Reducer,会导致当输入规模较大时,消耗较长的计算时间。关于order by的详细介绍请参考这篇文章:Hive Order by操作。 二:sort by so
分类:
其他好文 时间:
2016-01-31 21:08:58
阅读次数:
284
zepto的tap事件的点透问题的几种解决方案 zepto的tap事件点透问题分析: 1、“点透”是什么 你可能碰到过在列表页面上创建一个弹出层,弹出层有个关闭的按钮,你点了这个按钮关闭弹出层后后,这个按钮正下方的内容也会执行点击事件(或打开链接)。这个被定义为这是一个“点透”现象。 在前面的项目中
分类:
其他好文 时间:
2016-01-31 21:08:30
阅读次数:
171
索引是标准的数据库技术,hive0.7版本之后支持索引。Hive提供有限的索引功能,这不像传统的关系型数据库那样有"键(Key)"的概念,用户可以再某些列上创建索引来加速某些操作,给一个表创建的索引数据被保存在另外的表中。Hive的索引功能现在还相对较晚,提供的选项还较少。但是,索引被设计为可使用内
分类:
其他好文 时间:
2016-01-31 21:06:03
阅读次数:
239
一、流水账 过去的2015年算是变化比较大的一年,这一年第一次踏出国门,换了第二份工作,最最重要的事情莫过于成家了。站在2016年的新起点上,回顾下这一年。 一月 一月的大事是带着老婆和双方家长见面,而后还去逛了苏州,以此揭开了这一年结婚大事的序幕。 二月 二月参加了公司的年会,外企的年会没有抽奖、
分类:
其他好文 时间:
2016-01-31 21:05:47
阅读次数:
241
使用ssh客户端(如:putty)连接Linux服务器,可能会等待10-30秒才有提示输入密码。严重影响工作效率。登录很慢,登录上去后速度正常,这种情况主要有两种可能的原因: 1. DNS反向解析问题 OpenSSH在用户登录的时候会验证IP,它根据用户的IP使用反向DNS找到主机名,再使用DNS找
分类:
其他好文 时间:
2016-01-31 21:07:07
阅读次数:
1256