码迷,mamicode.com
首页 >  
搜索关键字:spark 大数据 hadoop spark-sql    ( 29965个结果
Spark1.0.0 分布式环境搭建
软件版本如下: Hostname IP Hadoop版本 Hadoop 功能 系统 master 192.168.119.128 1.1.2 namenode jdk1.6+hadoop+scala2.9.3+spark1.0.0 centos4.9...
分类:其他好文   时间:2014-06-25 19:50:09    阅读次数:227
尝试一种新的学习方法
尝试一种新的学习方法,前年阅读Linux kernel代码,读了一半,被工作和生活上的事打断。今年重新捡起,同时也要学习MySQL和Oracle。以及hadoop。在这里收集一些文章信息,同时整理自己的知识,把学习过程的心得和疑问都写下来,希望这个方法能督促我在纷繁的工作中挤出时间,养成习惯,把这件...
分类:其他好文   时间:2014-06-25 18:52:39    阅读次数:168
Spark MLlib之线性回归源码分析
线性回归(Linear Regression)问题属于监督学习(Supervised Learning)范畴,又称分类(Classification)或归纳学习(Inductive Learning);这类分析中训练数据集中给出的数据类标是确定的;机器学习的目标是,对于给定的一个训练数据集,通过不断的分析和学习产生一个联系属性集合和类标集合的分类函数(Classification Function)或预测函数(Prediction Function),这个函数称为分类模型(Classification Mo...
分类:其他好文   时间:2014-06-24 22:58:23    阅读次数:585
CDH5上安装Hive,HBase,Impala,Spark等服务
Apache Hadoop的服务的部署比较繁琐,需要手工处理配置文件、下载依赖包等。Cloudera Manager以GUI的方式的管理CDH集群,提供向导式的安装步骤。由于需要对Hive,HBase,Impala,Spark进行功能测试,就采用了Cloudera Manager方式进行安装。本文讲解的是parcel安装方式。...
分类:其他好文   时间:2014-06-24 22:44:17    阅读次数:501
MapReduceTopK TreeMap
MapReduce TopK统计加排序中介绍的TopK在mapreduce的实现。 本案例省略的上面案例中的Sort步骤,改用TreeMap来实现获取前K个词 package TopK1; import java.io.IOException; import java.util.StringTokenizer; import org.apache.hadoop.conf.Configurat...
分类:其他好文   时间:2014-06-24 22:33:34    阅读次数:293
MapReduce程序依赖的jar包
难得想写个mapreduce程序,发现已经不记得需要添加那些jar包了,网上找了一会也没发现准确的答案。幸好对hadoop体系结构略知一二,迅速试出了写mapreduce程序需要的三个jar包。              不多不少,3个包足矣……贴出来免得其朋友再走弯路      (请忽视包的版本不一致问题,是我从其他项目中东拼西凑过来的)...
分类:其他好文   时间:2014-06-24 21:44:15    阅读次数:321
ubuntu 14.04 hadoop eclipse 初级环境配置
接触hadoop第二天,配置hadoop到环境也用了两天,将自己配置到过程写在这里,希望对大家有所帮助! ---------------安装jdk------------------------------- 1. 下载jdk1.6.0_45 2.解压到opt文件夹下,配置/etc/profile,在文件尾部加上 #set java environment JAVA_H...
分类:系统相关   时间:2014-06-24 21:02:22    阅读次数:285
品牌营销进化三大方向:场景爆破、移动互联与大数据整合
一个品牌在媒体众多、消费者被高度分散的时代,应该如何做,才能让消费者对你印象深刻,并且不断累积品牌资产?如何通过广告和营销引发消费行动?在扑面而来的移动互联网时代,品牌的传播模式正在遭受一场前所未有的革命。 这场需要重新定义传播模式的革命,根本原因,在于今天消费者生活形态的几个变化。 第一个变化,来自于消费者随时随地可以享用的移动互联网,注意力被分散,移动终端链接其他终端的需求加强...
分类:移动开发   时间:2014-06-24 17:16:36    阅读次数:312
什么是大数据?
什么是大数据?某比萨店的电话铃响了,客服人员拿起电话。客服:XXX比萨店。您好,请问有什么需要我为您服务?顾客:你好,我想要一份……客服:先生,烦请先把您的会员卡号告诉我。顾客:16846146***。客服:陈先生,您好!您是住在泉州路一号12楼1205室,您家电话是2646****,您公司电话是....
分类:其他好文   时间:2014-06-24 15:15:03    阅读次数:225
shell 脚本实战笔记(4)--linux磁盘分区重新挂载
背景: Hadoop的HDFS文件系统的挂载, 默认指定的文件目录是/mnt/disk{N}. 当运维人员, 不小心把磁盘挂载于其他目录, 比如/mnt/data, /mnt/disk01, /mnt/diska时, HDFS会选择根分区, 当往HDFS里灌数据时, 导致的结果往往是根分区被快速的....
分类:系统相关   时间:2014-06-24 15:05:25    阅读次数:304
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!