随着BIG DATA大数据概念逐渐升温,如何搭建一个能够采集海量数据的架构体系摆在大家眼前。如何能够做到所见即所得的无阻拦式采集、如何快速把不规则页面结构化并存储、如何满足越来越多的数据采集还要在有限时间内采集。这篇文章结合我们自身项目经验谈一下。我们来看一下作为人是怎么获取网页数据的呢?1、打开浏...
分类:
其他好文 时间:
2014-07-10 12:32:08
阅读次数:
237
storm启动流程 storm是一个流行的开源的,分布式实时处理框架,关于storm的基本介绍可以参加这篇官方文档。大致的拓扑结构如图所示: 其中Nimbus是一个后台管理进程,运行在ma...
分类:
其他好文 时间:
2014-07-10 00:36:32
阅读次数:
439
2014年初经过深思熟虑,确定方向数据挖掘,作为今后工作生涯的追随领域。 3月份开始看机器学习的课程,到了4月底,参加阿里巴巴的大数据竞赛,便把课程学习给落下了—— 一大遗憾。 比赛的成绩可想而知,由于知识储备不够,况且还是单干,只能说还行,从七千个队伍到前五百名内,再从三百名到一百多名,然后遇到....
分类:
其他好文 时间:
2014-07-10 00:35:54
阅读次数:
183
欢迎转载,转载请注明出处,徽沪一郎。Spark Streaming能够对流数据进行近乎实时的速度进行数据处理。采用了不同于一般的流式数据处理模型,该模型使得Spark Streaming有非常高的处理速度,与storm相比拥有更高的吞能力。本篇简要分析Spark Streaming的处理模型,Spa...
分类:
其他好文 时间:
2014-07-07 14:44:43
阅读次数:
213
通信接口是webservice快还是scoket快webservice和scoket都可以做为通信接口,一个走HTTP访问,一个走TCP协议访问问1:通讯速度是webservice快还是scoket快问2:并发数量是webservice大还是scoket大问3:大数据包是webservice合适还是...
分类:
Web程序 时间:
2014-07-07 13:35:21
阅读次数:
212
下面是自己安装和测试storm的一些笔记,比较乱,后续有时间在整理一篇。storm jar all-my-code.jar com.storm.MyTopology arg1 arg2这个命令会运行主类: com.strom.MyTopology, 参数是arg1, arg2。这个类的main函数定...
分类:
其他好文 时间:
2014-07-02 00:56:33
阅读次数:
202
◎新媒体品读,一个人人都是主编的移动阅读产品关键点:收集阅读。◎大数据华云数据许广彬:2014年初获5000万美金融资,底气是什么?京东与汽车之家联姻的背后 谁借谁的势?易观数据发布手机地图市场前三:高德、百度、图吧文化中国变身阿里影业后“第一发”:网罗编剧?入股Peel,阿里在硅谷买了个“梨”阿里...
分类:
其他好文 时间:
2014-07-01 21:42:14
阅读次数:
240
(Procedure Language,过程化语言)SQL 1999各大数据库厂商通用的一种结构化语言 PL/SQL只支持Oracle数据库
基本语法
多行注释 /* */ 单行注释 --
PLSQL程序块
结构
[declare]
定义变量
begin
过程语句
[exception]
处理 异常
end;
例子 输出helloworld
begin
dbms_output.put_line('hello');
end;
--如果...
分类:
数据库 时间:
2014-06-30 18:55:36
阅读次数:
337
7月2号晚20:30-22:30 东大博士Dasight分享主题《大数据与Hadoop漫谈》
7月5号晚20:30-22:30 原支付宝MySQL首席DBA分享主题《MySQL发展趋势,MySQL各个分支介绍》、《MySQL 5.6版本特性介绍及如何从MySQL 5.5向MySQL
5.6》
7月10号晚20:30-22:30 东大博士Dasight分享主题《Hadoop与Nosql技术的适用性分析》
7月12号晚20:30-22:30 原支付宝MySQL首席DBA分享主题《1000+MySQ...
分类:
数据库 时间:
2014-06-30 08:40:53
阅读次数:
315
本篇博文详细告诉你如何安装Storm的本地开发环境,总体分为两步,具体如下:
1、从官网上下载Storm的发布包,下载完成后将其解压,并将解压后的bin目录添加到环境变量(PATH)中,以方便后续执行Storm的相关命令
2、修改Storm的配置文件(storm.yaml),主要是按照实际情况更新配置文件中的集群信息,然后将修改后的配置文件添加到目录(~/.storm/)中,目的是为了后续能够远程启动和停止集群上的计算任务(即topology)...
分类:
其他好文 时间:
2014-06-27 23:44:13
阅读次数:
505