大数据基础知识(大数据入门需学习哪些基础知识)

1.大数据入门需学习哪些基础知识

前言,学大数据要先换电脑:

保证电脑4核8G内存64位操作系统,尽量有ssd做系统盘,否则卡到你丧失信心。硬盘越大越好。

1,语言要求

java刚入门的时候要求javase。

scala是学习spark要用的基本使用即可。

后期深入要求:

java NIO,netty,多线程,ClassLoader,jvm底层及调优等,rpc。

2,操作系统要求

linux 基本的shell脚本的使用。

crontab的使用,最多。

cpu,内存,网络,磁盘等瓶颈分析及状态查看的工具。

scp,ssh,hosts的配置使用。

telnet,ping等网络排查命令的使用

3,sql基本使用

sql是基础,hive,sparksql等都需要用到,况且大部分企业也还是以数据仓库为中心,少不了sql。

sql统计,排序,join,group等,然后就是sql语句调优,表设计等。

4,大数据基本了解

Zookeeper,hadoop,hbase,hive,sqoop,flume,kafka,spark,storm等这些框架的作用及基本环境的搭建,要熟练,要会运维,瓶颈分析。

5,mapreduce及相关框架hive,sqoop

深入了解mapreduce的核心思想。尤其是shuffle,join,文件输入格式,map数目,reduce数目,调优等。

6,hive和hbase等仓库

hive和hbase基本是大数据仓库的标配。要回用,懂调优,故障排查。

hbase看浪尖hbase系列文章。hive后期更新。

7,消息队列的使用

kafka基本概念,使用,瓶颈分析。看浪尖kafka系列文章。

8,实时处理系统

storm和spark Streaming

9,spark core和sparksql

spark用于离线分析的两个重要功能。

10,最终方向决策

a),运维。(精通整套系统及故障排查,会写运维脚本啥的。)

b),数据分析。(算法精通)

c),平台开发。(源码精通)

自学还是培训?

无基础的同学,培训之前先搞到视频通学一遍,防止盲目培训跟不上讲师节奏,浪费时间,精力,金钱。

有基础的尽量搞点视频学基础,然后跟群里大牛交流,前提是人家愿意,

想办法跟大牛做朋友才是王道。

2.大数据分析应该掌握哪些基础知识

随着互联网行业的不断发展。很多人想要从事互联网方面的工作,现在非常流行的就是大数据,你了解大数据是做什么的吗?学习大数据需要掌握哪些知识?大数据在未来有很大的发展机会,每个岗位需要具备的能力是不同的。下面小编为大家介绍学习大数据需要掌握的知识。

大数据业务流程有四个基本步骤,即业务理解,数据准备,数据挖掘和分析应用程序。该过程分为三个功能区:大数据系统开发,整个操作系统的构建和维护,数据准备,平台和工具开发。大数据挖掘,负责关键模型应用和研究工作。大数据分析应用程序:两者都是外部需求的访问者也是解决方案的输出,并且在许多情况下还将承担整体协调的作用。

大数据提取转换和加载过程(ETL)是大数据的重要处理环节。提取是从业务数据库中提取数据。转换是根据业务逻辑规则处理数据的过程。负载是将数据加载到数据仓库的过程中。

数据提取工具实现了db到hdfs的数据导入功能,并提供了高效的分布式并行处理能力。可以使用数据库分区,字段分区和基于分页的并行批处理将db数据提取到hdfs文件系统中,从而可以有效地按字段解析分区数据。

数据收集可以是历史数据采集或实时数据采集。它可以收集存储在数据库中的结构化数据,或收集非结构化数据,如文本,图片,图像,音频,视频等。结构变化较大的半结构化数据,可以在数据后直接存储在流量状态分析平台上收集完成。

3.自学大数据该怎么入手

想要自学大数据,知道如何下手的小伙伴有福利了,本文专门为你准备的学习计划,这些技术知识梳理、其中的定义、关系以及作用,对你以后的学习会有很大的帮助!

大数据本质也是数据,但是又有了新的特征,包括数据来源广、数据格式多样化(结构化数据、非结构化数据、Excel文件、文本文件等)、数据量大(最少也是TB级别的、甚至可能是PB级别)、数据增长速度快等。

针对大数据主要的4个特征我们需要考虑以下问题:

数据来源广,该如何采集汇总?,对应出现了Sqoop,Cammel,Datax等工具。

数据采集之后,该如何存储?,对应出现了GFS,HDFS,TFS等分布式文件存储系统。

由于数据增长速度快,数据存储就必须可以水平扩展。

数据存储之后,该如何通过运算快速转化成一致的格式,该如何快速运算出自己想要的结果?

对应的MapReduce这样的分布式运算框架解决了这个问题;但是写MapReduce需要Java代码量很大,所以出现了Hive,Pig等将SQL转化成MapReduce的解析引擎;

普通的MapReduce处理数据只能一批一批地处理,时间延迟太长,为了实现每输入一条数据就能得到结果,于是出现了Storm/JStorm这样的低时延的流式计算框架;

但是如果同时需要批处理和流处理,按照如上就得搭两个集群,Hadoop集群(包括HDFS+MapReduce+Yarn)和Storm集群,不易于管理,所以出现了Spark这样的一站式的计算框架,既可以进行批处理,又可以进行流处理(实质上是微批处理)。

而后Lambda架构,Kappa架构的出现,又提供了一种业务处理的通用架构。

为了提高工作效率,加快运速度,出现了一些辅助工具:

Ozzie,azkaban:定时任务调度的工具。

Hue,Zepplin:图形化任务执行管理,结果查看工具。

Scala语言:编写Spark程序的最佳语言,当然也可以选择用Python。

Python语言:编写一些脚本时会用到。

Allluxio,Kylin等:通过对存储的数据进行预处理,加快运算速度的工具。

以上大致就把整个大数据生态里面用到的工具所解决的问题列举了一遍,知道了他们为什么而出现或者说出现是为了解决什么问题,进行学习的时候就有的放矢了。

大数据基础知识

转载请注明出处百科知识网 » 大数据基础知识(大数据入门需学习哪些基础知识)

知识

初中七上政治重点知识点总结(七年级上册政治知识要点梳理)

阅读(22)

本文主要为您介绍初中七上政治重点知识点总结,内容包括七年级上册政治知识要点梳理,七年级上册政治复习提纲,七年级上册政治复习提纲(人民教育出版社)。思想品德七年级上册知识要点 第一单元 笑迎新生活1.初中生活与小学生活的不同有哪些?(1)学

知识

生物8上全单元知识点总结(八年级上册生物每一节的知识梳理)

阅读(27)

本文主要为您介绍生物8上全单元知识点总结,内容包括八年级上册生物每一节的知识梳理,人教版八年级上册生物知识点(条理清晰,分章分点),八年级上册生物复习提纲。第14章第1节人体内物质的运输人体内营养物质和代谢废物的运输主要依靠血液循环

知识

政治必修一二的重要知识点总结(高一政治必修一,二的知识梳理)

阅读(28)

本文主要为您介绍政治必修一二的重要知识点总结,内容包括政治必修一二的总结,高一政治必修一,二的知识梳理,政治必修12,复习重点。公有制是社会主义经济制度的基础: 社会主义商品经济是建立在社会主义公有制基础上的 原因: 1.与资本主义不同:(1

知识

基础知识字词(高中语文字词字音字型成语等基础知识总结)

阅读(25)

本文主要为您介绍基础知识字词,内容包括高中语文(必修二)基础知识重要字词字音整理,高中语文字词、字音、字型、成语等基础知识总结,语文基础知识请帮忙找一个人教版9年纪上的基础知识汇总(字词,拼。个人认为语文的基础知识还是通过作题来积累

知识

一用电安全基础知识(安全用电的基本知识)

阅读(23)

本文主要为您介绍一用电安全基础知识,内容包括安全用电的基本知识,用电安全常识,安全用电的基本常识。安全用电需注意以下几点:不要赤手赤脚去修理或移动家中带电的线路或设备,如台扇、洗衣机、电视机等等,以免触电;2、不要使用金属碰电,手湿不

知识

语文基础知识不行(语文基础很差怎么办)

阅读(27)

本文主要为您介绍语文基础知识不行,内容包括语文基础知识太差怎么办,语文基础很差怎么办,语文基础很差怎么办,怎么提高语文功底。学习语文,感觉很简单,毕竟从出生开始我们就在学习语文,可是在试卷中常常得不到高分,语文满分150,可是得到120分以

知识

设计需要了解的基础知识(学设计需要知道哪些知识)

阅读(27)

本文主要为您介绍设计需要了解的基础知识,内容包括学设计需要知道哪些知识,设计要具备哪些基本知识,建筑设计需要知道的基础知识比如墙体厚度什么的谁有总的概括啊搜。我是美术专业的.设计的源泉在于思维,需要注意多方面的文化积累.最好先了

知识

股票基础知识三(股票基础知识)

阅读(33)

本文主要为您介绍股票基础知识三,内容包括股票基础知识,股票入门的基本知识,越简单详细越好,股票的基本知识。证券基础知识,证券投资分析,以及熟悉k线指标,均线指标,kdj指标,macd指标,威廉指标和RSI相对强弱指标,充分掌握好,指标不在多,

知识

什么是临床医学基础知识(临床医学基础知识包括哪些)

阅读(21)

本文主要为您介绍什么是临床医学基础知识,内容包括临床医学基础知识和医学基础知识的区别,临床医学基础知识包括哪些,临床医学专业基础知识包括哪几门课程。主干课程主干学科:基础医学、临床医学。 主要课程:人体解剖学、组织胚胎学、生理学

知识

平板制造基础知识入门(平板电脑知识)

阅读(26)

本文主要为您介绍平板制造基础知识入门,内容包括平板电脑知识,微生物实验平板制作方法,焊接平板生产工艺的基本流程是怎样的。简介 平板电脑平板电脑是下一代移动商务PC的代表。从微软提出的平板电脑概念产品上看,平板电脑就是一款无须翻盖

知识

电动机基础知识pdf(电机的基础知识)

阅读(32)

本文主要为您介绍电动机基础知识pdf,内容包括电机的基础知识,启动电机,电机的相关基础知识,电机基本知识是什么。电机基础知识 1.什么是直流电动机?它是如何工作的? 能够把输入的直流电变为机械能输出的机械设备,叫做直流电动机。它是根据带电

知识

经济学基础知识汇总(经济学基础知识有哪些)

阅读(27)

本文主要为您介绍经济学基础知识汇总,内容包括经济学基础的每个章节的重点知识点是什么,经济学基础知识,经济学基础知识考试要点。经济学的基础课程有很多,例如:经济学基础、中级微观经济学、中级宏观经济学、政治经济学、财政学、货币银行学

知识

员工安全基础知识教育试卷(安全知识测试题及答案)

阅读(33)

本文主要为您介绍员工安全基础知识教育试卷,内容包括安全知识测试题及答案,新进员工三级安全教育培训考试题,安全教育测试题答案。小学生安全教育日竞赛题 填空题(20分) 电器打开时,不要用湿布擦拭,也不要用湿手按开关或拔插头,这样都容易( )。 2

知识

导游基础知识的考查(导游的基础知识)

阅读(30)

本文主要为您介绍导游基础知识的考查,内容包括导游的基础知识,导游基础知识应该怎么学习,导游基础知识应该怎么学习。试读结束,如需阅读或下载,请点击购买>原发布者:江勇旅游基本知识内容•第一节•第二节•第三节•第四节旅游的概念、特征及

知识

组建小型局域网的基础知识与实验原理(组建局域网基础知识)

阅读(27)

本文主要为您介绍组建小型局域网的基础知识与实验原理,内容包括组建局域网基础知识,组建局域网的基础,如何组建实验室一个小型局域如何组建实验室一个小型局域网爱问知。组建局域网的先决条件是思科的基础知识 TCP/IP 介绍: TCP/IP 是互联网