码迷,mamicode.com
首页 >  
搜索关键字:hadoop 大数据 云计算    ( 28457个结果
读书清单
2014 - 06【等待中】软件分析建模与PowerDesigner实现 (白尚旺 党伟超 著)【进行中】大话重构 (范钢著)【读 完】云计算技术指南(应用、平台与构架) (杨文志著)
分类:其他好文   时间:2014-07-16 23:18:46    阅读次数:169
社会化海量数据采集爬虫框架搭建
随着BIG DATA大数据概念逐渐升温,如何搭建一个能够采集海量数据的架构体系摆在大家眼前。如何能够做到所见即所得的无阻拦式采集、如何快速把不规则页面结构化并存储、如何满足越来越多的数据采集还要在有限时间内采集。这篇文章结合我们自身项目经验谈一下。我们来看一下作为人是怎么获取网页数据的呢?1、打开浏...
分类:其他好文   时间:2014-07-10 12:32:08    阅读次数:237
数据挖掘启程经历
2014年初经过深思熟虑,确定方向数据挖掘,作为今后工作生涯的追随领域。 3月份开始看机器学习的课程,到了4月底,参加阿里巴巴的大数据竞赛,便把课程学习给落下了—— 一大遗憾。 比赛的成绩可想而知,由于知识储备不够,况且还是单干,只能说还行,从七千个队伍到前五百名内,再从三百名到一百多名,然后遇到....
分类:其他好文   时间:2014-07-10 00:35:54    阅读次数:183
hadoop整合到web工程发布到tomcat报错
我是用的maven,至少要移出如下的jar包:org.apache.hadoophadoop-core1.0.4jackson-mapper-aslorg.codehaus.jacksonjsp-api-2.1org.mortbay.jettyjsp-2.1org.mortbay.jettyjasp...
分类:Web程序   时间:2014-07-10 00:19:29    阅读次数:267
MapReduce中TextInputFormat分片和读取分片数据源码级分析
InputFormat主要用于描述输入数据的格式(我们只分析新API,即org.apache.hadoop.mapreduce.lib.input.InputFormat),提供以下两个功能: (1)数据切分:按照某个策略将输入数据切分成若干个split,以便确定MapTask个数以及对应的s...
分类:其他好文   时间:2014-07-09 23:49:37    阅读次数:487
企业 SOA 设计(1)–ESB 设计
最近为公司完成了一个 ESB 的设计。下面简要说明一下具体的设计方案。 企业 SOA 整体方案 在前一篇《SOA、ESB、NServiceBus、云计算 总结》中说到,SOA 是面向服务的架构,其核心思想是把业务进行组件化,而业务组件的能力服务化。 我们的整个 SOA 的设计分为两个层面:一个是系统...
分类:其他好文   时间:2014-06-30 11:55:52    阅读次数:315
尖峰7月线上技术分享--Hadoop、MySQL
7月2号晚20:30-22:30 东大博士Dasight分享主题《大数据与Hadoop漫谈》 7月5号晚20:30-22:30 原支付宝MySQL首席DBA分享主题《MySQL发展趋势,MySQL各个分支介绍》、《MySQL 5.6版本特性介绍及如何从MySQL 5.5向MySQL 5.6》 7月10号晚20:30-22:30 东大博士Dasight分享主题《Hadoop与Nosql技术的适用性分析》 7月12号晚20:30-22:30 原支付宝MySQL首席DBA分享主题《1000+MySQ...
分类:数据库   时间:2014-06-30 08:40:53    阅读次数:315
CentOS6.5 Linux上面编译Hadoop2.4源码
今天来说说编译hadoop源码的事情吧~ 1、首先下载源码 地址:http://mirror.bit.edu.cn/apache/hadoop/common/hadoop-2.4.0/ 2、加压tar包到指定文件夹:/home/hadoop/soft/hadoop tar zxvf hadoop-2.4.0-src.tar.gz 3、Linux编译环境准备 java环境...
分类:系统相关   时间:2014-06-30 06:18:12    阅读次数:379
Hadoop多目录输入,join,进入reduce,数据流分析
前言 在做需求时,经常遇到多个目录,也就是多个维度进行join,这里分析一下,数据是怎么流动的。 1、多目录输入 使用MultipleInputs.addInputPath()  对多目录制定格式和map 2、数据流分析 map按行读入数据,需要对不同的输入目录,打上不同的标记(这个方法又叫reduce端连接),map在输出后会进行partition和sort,按照key进行排序,然后输...
分类:其他好文   时间:2014-06-29 23:09:07    阅读次数:348
Hbase快速开始——shell操作
一. 介绍 HBase是一个分布式的、面向列的开源数据库,源于google的一篇论文《bigtable:一个结构化数据的分布式存储系统》。HBase是Google Bigtable的开源实现,它利用Hadoop HDFS作为其文件存储系统,利用Hadoop MapReduce来处理HBase中的.....
分类:其他好文   时间:2014-06-29 19:20:17    阅读次数:252
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!