Spark修炼之道(基础篇)——Linux大数据开发基础:第一节、Linux介绍、安装及使用初步

本节主要内容

  1. Linux简史
  2. Linux特点
  3. Ubuntu Linux安装
  4. Linux使用初步

1. Linux简史

要讲述大名鼎鼎的Linux,必然要先从UNIX系统谈起,下面这幅图给出了Unix系统的进化图:

图片来源:http://baike.baidu.com/link?url=QfoqWtWGs-BjpnfEy_AUk7Bm3XHuf6JbN92HCOoUBfFfj8BuSDkbwmldtmUEmGRDUwqsQMIV4jCKHvdkSPr3Lq

从进化图中可以看到,目前所有的主流操作系统都源自Unix 6(1976),我们要讲的Linux系统只是类UNIX系统中的一种,它源自于Minix系统,由Linus Torvalds于1991年开发,那时候Linus Torvalds还是芬兰大学的一名学生,其信奉开源精神,将代码分布可互联网上,可以免费获取,自从该操作系统问世后,世界各地的程序员加入到该操作系统的维护、内核升级等工作中来,进行了大量艰辛的工作以使该操作系统能够与BSD版的Unix及System V Unix(SVR4)等商用操作系统的功能与新功能进行匹配。

Linux开源后也源生出了多种版本,从性质上划分,大体分为由商业公司维护的商业版本与由开源社区维护的免费发行版本。常用的Linux操作系统有三种,它们分别是Redhat、 debian及Ubuntu:

  1. Ubuntu Linux。Ubuntu最大的特点在于其有着漂亮的GUI界面,包管理系统较为完善的,软件源比较丰富,技术社区资源及文档比较齐全,因此Ubuntu有着漂亮的用户界面,完善的包管理系统,强大的软件源支持,丰富的技术社区,良好的硬件兼容性,它有两种版本,分别是Desktop版本及Server版。Ubuntu比较适合初学者,因为Ubuntu的GUI界面的原因,它的大众化方向比较明显,当然因为GUI的原因,它非常消耗内存对机器的配置要求较高

  2. CentOS。CentOS是生产环境使用最广泛的Linux操作系统,它是Red Hat Enterprise Linux(简称RHEL)源代码编译后的社区重新发布版,它是一个非常成熟的Linux发行版,它虽然也有图形用户界面,但不像Ubuntu那样强大。

  3. Debian。Debian也比较适合用于服务器的操作系统,它比Ubuntu要更加稳定,它的内核比较简洁,只需要128M内存就可以流畅地运行,据说Debian可以几年不重启。Debian的技术资料、文档等相对于Ubuntu、CentOS等要少,它更适合Linux的高级用户使用。

由于本课程针对想从事大数据开发的初学者,后期也需要在Ubuntu中配置Intellij IDEA Spark、Scala开发环境,在Linux系统上进行Spark、Scala应用程序开发,因此之故本教程决定采用Ubuntu Desktop版本进行教学。

2. Linux系统整体介绍

下图给出的是Linux操作系统分层视图:

引自:A Practical Guide to Linux Commands, Editors and Shell Programming

从上图可以看到,Linux大致可以分为四层,分别是硬件、内核、系统应用及用户软件层,分层结构具有较强的安全性,也为我们屏蔽了底层硬件的复杂性。所有的系统应用都是通过内核来与底层硬件打交道的。Linux主要有如下特点:

  • 提供内核编程接口,为用户操纵内核实现硬件资源访问提供了通道
  • 它是一种多用户的操作系统
  • 它是一种多任务的操作系统
  • 强大的文件系统
  • 提供Shell脚本
  • 丰富的系统命令

3. Ubuntu Linux安装

对于初学者,为方便Linux的学习,可以采用安装虚拟机的方式进行,目前流行的虚拟机有:

  1. Xen。Xen出身名门,起源于剑桥大学,后来被开源出来,它可以让多个虚拟机在单独一台机器上运行各自的操作系统。
  2. VMware。由VMware公司开发,功能强大,软件比较成熟,本课程采用VMWare作为虚拟机的容器
  3. KVM,基于Kernel的虚拟机,它也是一个开源的产品,只不过它运行在Linux上,作为Linux内核的一部分
  4. Virtual Box。Sun公司的大作,可以在Windows上运行。

由于后期需要在本机上搭建Spark集群,建议机器配置内存12G以上,一般集群至少三台,SparkMaster 4G,SparkSlave01 2G,SparkSlave02 2G,本机4G,这样整体机器运行起来才会比较流畅。现在Ubuntu版本已经升到了ubuntu 15.04,但它太耗内存了,出于机器性能考虑,本教程采用Ubuntu 10.04版,VMware版本是8.0.0

VMWare下载后按默认安装即可,下面讲解一下如何安装Ubuntu 10.04

1 File->New Virtual Machine

2 选择typical,然后next

3 选择Installer disc image file(ISO),选择Ubuntu 10.04 ISO文件

4 Personlize Linux,Full Name表示安装好的Linux hostname,Username,Password可以根据自己的需要做任意设置,然后下一步

5 设置虚拟机名称,然后next

6 设置磁盘容量,默认为20G,建议选择split virtual disk into multiple files,然后next

7 其它默认设置就可以,然后Finish

8 如此便完成Linux的配置,接下来便是系统安装过程,整个安装过程中无需人工干预,大约30分钟

4. Linux使用初步

1 命令行终端的使用

可以直接在图形用户界面上进行命令行的使用,Applications->Accessories->Terminal

也可以按Ctr+ALT+F1进入CLI(Command Line Interface)模式,

输入用户名和密码,可以得到如下界面:

切换回图形用户界面,用CTR+ALT+F8

2 超级用户root密码的设置

//采用sudo passwd命令修改root密码
xtwy@ubuntu:~$ sudo passwd
[sudo] password for xtwy:
Enter new UNIX password:
Retype new UNIX password:
passwd: password updated successfully

3 切换用户

//采用su(switch user)命令切换用户
xtwy@ubuntu:~$ su root
Password:
root@ubuntu:/home/xtwy#
//切换回xtwy
root@ubuntu:/home/xtwy# su xtwy
xtwy@ubuntu:~$

4 当前用户工作目录与根目录

//~表示用户当前工作目录
xtwy@ubuntu:~$
//可以用pwd(Print Working Directory)命令查看完整路径
xtwy@ubuntu:~$ pwd
/home/xtwy
//用cd(change directory)命令改变工作目录,例如切换到根目录
//在linux中,/表示根目录
xtwy@ubuntu:~$ cd /
xtwy@ubuntu:/$
//切换回当前用户的工作目录,可以用cd ~命令(~表示当前用户默认的工作目录)
xtwy@ubuntu:/$ cd ~
xtwy@ubuntu:~$

5 列出文件目录 ls命令的使用

//不加任何参数的ls命令,简易列出目录中的所有文件和目录
[email protected]:~$ ls
Desktop    Downloads         Music     Public     Videos
Documents  examples.desktop  Pictures  Templates
//ls -a 列出目录下的所有文件包括隐含文件
[email protected]:~$ ls -a
.             Downloads         .gvfs          .pulse-cookie
..            .esd_auth         .ICEauthority  .recently-used.xbel
.bash_logout  examples.desktop  .local         .ssh
.bashrc       .gconf            Music          .sudo_as_admin_successful
.cache        .gconfd           .nautilus      Templates
.config       .gnome2           Pictures       .update-notifier
.dbus         .gnome2_private   .profile       Videos
Desktop       .gnupg            Public         .xsession-errors
Documents     .gtk-bookmarks    .pulse         .xsession-errors.old

//列出目录下所有文件和目录的详细信息
[email protected]:~$ ls -al
total 136
drwxr-xr-x 24 xtwy xtwy 4096 2015-08-20 23:58 .
drwxr-xr-x  3 root root 4096 2015-08-20 21:53 ..
-rw-r--r--  1 xtwy xtwy  220 2015-08-20 21:53 .bash_logout
-rw-r--r--  1 xtwy xtwy 3103 2015-08-20 21:53 .bashrc
drwx------  4 xtwy xtwy 4096 2015-08-20 23:48 .cache
drwxr-xr-x  5 xtwy xtwy 4096 2015-08-20 23:35 .config
drwx------  3 xtwy xtwy 4096 2015-08-20 23:31 .dbus
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Desktop
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Documents
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Downloads
-rw-------  1 xtwy xtwy   16 2015-08-20 23:31 .esd_auth
-rw-r--r--  1 xtwy xtwy  179 2015-08-20 21:53 examples.desktop
drwx------  4 xtwy xtwy 4096 2015-08-20 23:34 .gconf
drwx------  2 xtwy xtwy 4096 2015-08-21 00:12 .gconfd
drwx------  6 xtwy xtwy 4096 2015-08-20 23:32 .gnome2
drwx------  2 xtwy xtwy 4096 2015-08-20 23:32 .gnome2_private
drwx------  2 xtwy xtwy 4096 2015-08-20 23:50 .gnupg
-rw-r--r--  1 xtwy xtwy  132 2015-08-20 23:34 .gtk-bookmarks
dr-x------  2 xtwy xtwy    0 2015-08-20 23:34 .gvfs
-rw-------  1 xtwy xtwy  636 2015-08-20 23:34 .ICEauthority
drwx------  3 xtwy xtwy 4096 2015-08-20 23:34 .local
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Music
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 .nautilus
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Pictures
-rw-r--r--  1 xtwy xtwy  675 2015-08-20 21:53 .profile
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Public
drwx------  2 xtwy xtwy 4096 2015-08-20 23:32 .pulse
-rw-------  1 xtwy xtwy  256 2015-08-20 23:31 .pulse-cookie
-rw-------  1 xtwy xtwy  218 2015-08-20 23:32 .recently-used.xbel
drwx------  2 xtwy xtwy 4096 2015-08-20 23:50 .ssh
-rw-r--r--  1 xtwy xtwy    0 2015-08-20 23:58 .sudo_as_admin_successful
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Templates
drwx------  2 xtwy xtwy 4096 2015-08-20 23:35 .update-notifier
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Videos
-rw-------  1 xtwy xtwy 1681 2015-08-20 23:52 .xsession-errors
-rw-------  1 xtwy xtwy 2829 2015-08-20 23:32 .xsession-errors.old
//ls -l列出文件和目录的详细用户,不包括隐含文件和当前目录.、上级目录..
[email protected]:~$ ls -l
total 36
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Desktop
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Documents
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Downloads
-rw-r--r-- 1 xtwy xtwy  179 2015-08-20 21:53 examples.desktop
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Music
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Pictures
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Public
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Templates
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Videos

上面四种是最为常用的ls命令,可以满足日常工作中的绝大部分需求,更多参数如下:

-a 列出目录下的所有文件,包括以 . 开头的隐含文件。
-b 把文件名中不可输出的字符用反斜杠加字符编号(就象在C语言里一样)的形式列出。
-c 输出文件的 i 节点的修改时间,并以此排序。
-d 将目录象文件一样显示,而不是显示其下的文件。
-e 输出时间的全部信息,而不是输出简略信息。
-f -U 对输出的文件不排序。
-g 无用。
-i 输出文件的 i 节点的索引信息。
-k 以 k 字节的形式表示文件的大小。
-l 列出文件的详细信息。
-m 横向输出文件名,并以“,”作分格符。
-n 用数字的 UID,GID 代替名称。
-o 显示文件的除组信息外的详细信息。
-p -F 在每个文件名后附上一个字符以说明该文件的类型,“*”表示可执行的普通
文件;“/”表示目录;“@”表示符号链接;“|”表示FIFOs;“=”表示套
接字(sockets)。
-q 用?代替不可输出的字符。
-r 对目录反向排序。
-s 在每个文件名后输出该文件的大小。
-t 以时间排序。
-u 以文件上次被访问的时间排序。
-x 按列输出,横向排序。
-A 显示除 “.”和“..”外的所有文件。
-B 不输出以 “~”结尾的备份文件。
-C 按列输出,纵向排序。
-G 输出文件的组的信息。
-L 列出链接文件名而不是链接到的文件。
-N 不限制文件长度。
-Q 把输出的文件名用双引号括起来。
-R 列出所有子目录下的文件。
-S 以文件大小排序。
-X 以文件的扩展名(最后一个 . 后的字符)排序。
-1 一行只输出一个文件。

在需要时去查文档即可。

添加公众微信号,可以了解更多最新Spark、Scala相关技术资讯

版权声明:本文为博主原创文章,未经博主允许不得转载。

时间: 2024-10-19 09:22:57

Spark修炼之道(基础篇)——Linux大数据开发基础:第一节、Linux介绍、安装及使用初步的相关文章

Spark修炼之道(基础篇)——Linux大数据开发基础:第十二节:Shell编程入门(四)

本节主要内容 shell脚本调试 shell函数 shell控制结构初步 1. shell脚本调试 当脚本出错时,需要对脚本进行调试,学会脚本调试是每个linux系统使用者必备技能.shell脚本调试无需任何额外的工具,只需要要在脚本文件前加-x选项即可,创建debug.sh文件,内容如下: #!/bin/bash #Filename: debug.sh echo "scripting" echo "debuging" ls + 使用bash -x 命令进行脚本调试

Spark修炼之道(基础篇)——Linux大数据开发基础:第五节:vi、vim编辑器(二)

本节主要内容 缓冲区的使用 文件的存盘与读盘 文本查找 文本替换 作者:周志湖 微信号:zhouzhihubeyond 网名:摇摆少年梦 1. 缓冲区的使用 在利用vim进行文本编辑时,编辑修改后的文本不会立即保存到硬盘上,而是保存在缓冲区中,如果没有把缓冲区里的文件存盘,原始文件不会被更改.vim在打开文件时将文本内容读到缓冲区中,在进行文本编辑时,修改的文本保存在缓冲区,此时硬盘上的原文件不变.下面让我们来演示一下缓冲区的使用. 假设采用vim 同时打开两个文本文件: [email prot

Spark修炼之道(基础篇)——Linux大数据开发基础:第七节:进程管理

本节主要内容 进程管理简介 进程管理常用命令 计划任务 1. 进程管理简介 (1)进程概念 进程是操作系统中非常重要的一个概念,进程是程序的执行过程,相对于程序,进程是动态的,在linux系统中,它与用户权限相关,程序与进程并没有一一对应,一个程序可能对应多个进程,例如: //ps命令列出当前所有对应当前用户的活动进程 xtwy@ubuntu:~$ ps PID TTY TIME CMD 2087 pts/0 00:00:00 bash 2105 pts/0 00:00:00 ps xtwy@u

Spark修炼之道(基础篇)——Linux大数据开发基础:第六节:vi、vim编辑器(二)(转载)

转自云栖社区: https://yq.aliyun.com/articles/60354?spm=5176.8251999.569296.36.siyXRn 周志湖 2015-08-25 21:23:00 浏览305 评论0 摘要: 本节主要内容 缓冲区的使用 文件的存盘与读盘 文本查找 文本替换 作者:周志湖 微信号:zhouzhihubeyond 网名:摇摆少年梦 1. 缓冲区的使用 在利用vim进行文本编辑时,编辑修改后的文本不会立即保存到硬盘上,而是保存在缓冲区中,如果没有把缓冲区里的文

大数据开发基础知识

日志聚合与分析 日志聚合的作用就在于可以把来自不同服务器上不同应用程序产生的日志聚合起来,存放在单一的服务器上,方便进行搜索和分析.在日志聚合方面,已经有不少成熟的开源软件可以很好的满足需求.本文中要介绍的是 logstash,一个流行的事件和日志管理开源软件.logstash 采用了一种简单的处理模式:输入 -> 过滤器 -> 输出.logstash 可以作为代理程序安装到每台需要收集日志的机器上.logstash 提供了非常多的插件来处理不同类型的数据输入.典型的包括控制台.文件和 sys

转:Hadoop大数据开发基础系列:七、Hive基础

https://blog.csdn.net/hehe_soft_engineer/article/details/102820968 原文地址:https://www.cnblogs.com/ambdyx/p/11779609.html

Spark修炼之道——Spark学习路线、课程大纲

课程内容 Spark修炼之道(基础篇)--Linux基础(15讲).Akka分布式编程(8讲) Spark修炼之道(进阶篇)--Spark入门到精通(30讲) Spark修炼之道(实战篇)--Spark应用开发实战篇(20讲) Spark修炼之道(高级篇)--Spark源代码解析(50讲) 部分内容会在实际编写时动态调整.或补充.或删除. Spark修炼之道(基础篇)--Linux大数据开发基础(15讲). Linux大数据开发基础--第一节:Ubuntu Linux安装与介绍 Linux大数据

大数据成神之路-Linux基础

Linux命令 我是小白,我从来没玩过Linux,请点这里: https://user-gold-cdn.xitu.io/2019/2/24/1691e1dda7807059 推荐的一个Git仓库 我有些基础,推荐一个快速查询命令的手册,请点这里: https://github.com/jaywcjlove/linux-command 大数据成神之路目录 大数据开发基础 Java基础 NIO 并发 JVM 分布式 Zookeeper RPC Netty Java基础 NIO 并发容器 JVM 分

2017最新大数据零基础视频教程下载

2017零基础大数据就业课程(全网最全,856课时) 课程观看地址:http://www.xuetuwuyou.com/course/181 课程出自学途无忧网:http://www.xuetuwuyou.com 本套课程是风舞烟老师团队历时四个月打造的全网最全的一套大数据就业课程.可以说是完全0编程基础起步,一部到就业!课程分2大模块,14个课程,65章,共计856课时! 课程大纲: 一.Java模块课程 课程一.[大数据必知必会]- Java负基础扫盲篇 01.Java基础语法.变量.数据类