码迷,mamicode.com
首页 >  
搜索关键字:beam 大数据    ( 12980个结果
社会化海量数据采集爬虫框架搭建
随着BIG DATA大数据概念逐渐升温,如何搭建一个能够采集海量数据的架构体系摆在大家眼前。如何能够做到所见即所得的无阻拦式采集、如何快速把不规则页面结构化并存储、如何满足越来越多的数据采集还要在有限时间内采集。这篇文章结合我们自身项目经验谈一下。我们来看一下作为人是怎么获取网页数据的呢?1、打开浏...
分类:其他好文   时间:2014-07-10 12:32:08    阅读次数:237
数据挖掘启程经历
2014年初经过深思熟虑,确定方向数据挖掘,作为今后工作生涯的追随领域。 3月份开始看机器学习的课程,到了4月底,参加阿里巴巴的大数据竞赛,便把课程学习给落下了—— 一大遗憾。 比赛的成绩可想而知,由于知识储备不够,况且还是单干,只能说还行,从七千个队伍到前五百名内,再从三百名到一百多名,然后遇到....
分类:其他好文   时间:2014-07-10 00:35:54    阅读次数:183
通信接口是webservice快还是scoket快解决方案
通信接口是webservice快还是scoket快webservice和scoket都可以做为通信接口,一个走HTTP访问,一个走TCP协议访问问1:通讯速度是webservice快还是scoket快问2:并发数量是webservice大还是scoket大问3:大数据包是webservice合适还是...
分类:Web程序   时间:2014-07-07 13:35:21    阅读次数:212
20140630 科技脉搏-互联网精神之“我不是为了输赢,我就是认真”
◎新媒体品读,一个人人都是主编的移动阅读产品关键点:收集阅读。◎大数据华云数据许广彬:2014年初获5000万美金融资,底气是什么?京东与汽车之家联姻的背后 谁借谁的势?易观数据发布手机地图市场前三:高德、百度、图吧文化中国变身阿里影业后“第一发”:网罗编剧?入股Peel,阿里在硅谷买了个“梨”阿里...
分类:其他好文   时间:2014-07-01 21:42:14    阅读次数:240
PL/SQL简介
(Procedure Language,过程化语言)SQL 1999各大数据库厂商通用的一种结构化语言 PL/SQL只支持Oracle数据库 基本语法 多行注释 /* */ 单行注释 -- PLSQL程序块 结构 [declare] 定义变量 begin 过程语句 [exception] 处理 异常 end; 例子 输出helloworld begin dbms_output.put_line('hello'); end; --如果...
分类:数据库   时间:2014-07-01 11:23:51    阅读次数:313
蔡先生论道大数据之三 , 国内互联网公司的大数据应用
上章,我简单描述了国外IT巨头在大数据方面的应用和战略,本章我们来看一下国内互联网公司如何理解大数据的。随着互联网各类网络应用的不断深入,中国的大数据技术与应用的快速发展已成为不容忽视的事实。目前国内各IT企业,特别是大型互联网企业,都开始对大数据的存储、处理..
分类:其他好文   时间:2014-07-01 09:39:28    阅读次数:205
PL/SQL简介
(Procedure Language,过程化语言)SQL 1999各大数据库厂商通用的一种结构化语言 PL/SQL只支持Oracle数据库 基本语法 多行注释 /* */ 单行注释 -- PLSQL程序块 结构 [declare] 定义变量 begin 过程语句 [exception] 处理 异常 end; 例子 输出helloworld begin dbms_output.put_line('hello'); end; --如果...
分类:数据库   时间:2014-06-30 18:55:36    阅读次数:337
尖峰7月线上技术分享--Hadoop、MySQL
7月2号晚20:30-22:30 东大博士Dasight分享主题《大数据与Hadoop漫谈》 7月5号晚20:30-22:30 原支付宝MySQL首席DBA分享主题《MySQL发展趋势,MySQL各个分支介绍》、《MySQL 5.6版本特性介绍及如何从MySQL 5.5向MySQL 5.6》 7月10号晚20:30-22:30 东大博士Dasight分享主题《Hadoop与Nosql技术的适用性分析》 7月12号晚20:30-22:30 原支付宝MySQL首席DBA分享主题《1000+MySQ...
分类:数据库   时间:2014-06-30 08:40:53    阅读次数:315
HBase的伪分布模式安装
HBase是依赖Hadoop的数据存储系统,可以实现大数据(过亿条记录)的存储,进行并行化处理。在特定的场景下HBase有自己的用武之地。下面讲述如何进行伪分布模式安装1.设置环境变量我使用的HBase版本是hbase-0.94.7-security.tar.gz,安装在机器hadoop0的/usr...
分类:其他好文   时间:2014-06-28 09:46:59    阅读次数:266
C#.NET 大型通用信息化系统集成快速开发平台 4.1 版本 - 大数据支持分表优化
公司的短信平台,数据量越来越大了,需要对数据进行一些优化,下面是拆分后的数据库量参考。新开发的软件模块,必须支持分表,拆表的功能一个数据表里,不适合保存1000万以上的记录新开发的业务模块,能分表的全分表,否则,将来我们无法用其他小型数据库,例如mysql 现在系统的短信已经进行了拆表接着打算把日....
分类:Web程序   时间:2014-06-27 23:09:12    阅读次数:309
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!