R语言:ggplot2精细化绘图——以实用商业化图表绘图为例

本文旨在介绍R语言中ggplot2包的一些精细化操作,主要适用于对R画图有一定了解,需要更精细化作图的人,尤其是那些刚从excel转ggplot2的各位,有比较频繁的作图需求的人。不讨论那些样式非常酷炫的图表,以实用的商业化图表为主。包括以下结构:

1、画图前的准备:自定义ggplot2格式刷
2、画图前的准备:数据塑形利器dplyr / tidyr介绍
3、常用的商业用图:

1)简单柱形图+文本(单一变量)
2)分面柱形图(facet_wrap/facet_grid)
3)簇型柱形图(position=”dodge”)
4)堆积柱形图(需要先添加百分比,再对百分比的变量做柱形图)
5)饼图、极坐标图
6)多重线性图

转载才会看到的:本文版权归http://www.cnblogs.com/weibaar 所有,转载请保留此段文字谢谢!

前言

这篇文章其实是我之前那篇博文的一个延续。因为接了一个活要用R定制化数据报表,其中涉及大量的对图表精雕细琢的工作。在深入研究ggplot2时,深深感觉到用ggplot2画图与用excel画图的不一样。

如果要用ggplot2画图,还是需要了解很多技术细节的。这些细节要么散落在R可视化技术ggplot2:数据分析与图表技术这两本书里,要么散落在网上。因此在这里以我学习和总结的过程,对ggplot2的精细化画图做一个阐述,介绍我整理后的作图理念。

如果有进一步学习需要的各位,请直接买书或者自己实践学习。很多技术细节需要自己摸索才知道的,祝大家好运。

1、画图前的准备:自定义ggplot2格式刷

在画图前,我们首先定义一下ggplot2格式刷

首先,ggplot2本身自带了很漂亮的主题格式,如theme_gray和theme_bw。但是在工作用图上,很多公司对图表格式配色字体等均有明文的规定。像我们公司,对主色、辅色、字体等都有严格的规定。如刘万祥老师早期的一篇配色博文里,大家更是可以看到,很多商业杂志的图表,配色风格都是非常相近的。因此,修改主题,使其更加适合我们的商业需求,保持图表风格统一,是非常必要的。

虽然ggplot2可以通过代码的追加,细细修改表距、背景色以及字体等框架。但是如果每做一个图,都要如此细调,代码将会非常繁琐,而且万一老板突然兴起要换风格时,代码修改将会非常痛苦。

幸运的是,ggplot2允许我们事先定制好图表样式,我们可以生成如mytheme或者myline这样的有明确配色主题的对象,到时候就像excel的定制保存图表模板或者格式刷,直接在生成的图表里引用格式刷型的主题配色,就可以快捷方便的更改图表内容,保持风格的统一了。

在运行之前,首先加载相关包

library(ggplot2)
library(dplyr)
library(ColorBrewer)
library(tidyr)
library(grid)
#载入格式刷
######

#定义好字体
windowsFonts(CA=windowsFont("Calibri"))

接下来是一个示范。我首先共享了我常用的一个主题刷,配色参考以下:

主体色:蓝色 085A9C ,红色 EF0808,灰色 526373
辅助色:浅黄色 FFFFE7,橙色 FF9418, 绿色 219431, 明黄色 FF9418,紫色 9C52AD

定制了mytheme, myline_blue, mycolour等多个对象:

 1 #定义好字体
 2 windowsFonts(CA=windowsFont("Calibri"))
 3 #事先定制好要加图形的形状、颜色、主题等
 4 #定制主题,要求背景全白,没有边框。然后所有的字体都是某某颜色
 5 #定制主题,要求背景全白,没有边框。然后所有的字体都是某某颜色
 6 mytheme<-theme_bw()+theme(legend.position="top",
 7                           panel.border=element_blank(),
 8                           panel.grid.major=element_line(linetype="dashed"),
 9                           panel.grid.minor=element_blank(),
10                           plot.title=element_text(size=15,
11                                                   colour="#003087",
12                                                   family="CA"),
13                           legend.text=element_text(size=9,colour="#003087",
14                                                    family="CA"),
15                           legend.key=element_blank(),
16                           axis.text=element_text(size=10,colour="#003087",
17                                                  family="CA"),
18                           strip.text=element_text(size=12,colour="#EF0808",
19                                                   family="CA"),
20                           strip.background=element_blank()
21
22                         )
23 pie_theme=mytheme+theme(axis.text=element_blank(),
24                         axis.ticks=element_blank(),
25                         axis.title=element_blank(),
26                         panel.grid.major=element_blank())
27 #定制线的大小
28 myline_blue<-geom_line(colour="#085A9C",size=2)
29 myline_red<-geom_line(colour="#EF0808",size=2)
30 myarea=geom_area(colour=NA,fill="#003087",alpha=.2)
31 mypoint=geom_point(size=3,shape=21,colour="#003087",fill="white")
32 mybar=geom_bar(fill="#0C8DC4",stat="identity")
33 #然后是配色,考虑到样本的多样性,可以事先设定颜色,如3种颜色或7种颜色的组合
34 mycolour_3<-scale_fill_manual(values=c("#085A9C","#EF0808","#526373"))
35 mycolour_7<-scale_fill_manual(values=c("#085A9C","#EF0808","#526373",
36 "#FFFFE7","#FF9418","#219431","#9C52AD"))
37 mycolour_line_7<-scale_color_manual(values=c("#085A9C","#EF0808","#526373",
38                                              "#0C8DC4","#FF9418","#219431","#9C52AD"))

把以上代码在R里面运行以后,就可以直接使用了。譬如以下:

1)先生成一个简单的图表:

#未使用格式刷
p<-ggplot(iris,aes(x=species,y=sepal_length)) +geom_bar(stat="identity")+ ggtitle("sepal_length by species")
p

简单地指定x轴为离散型变量species,y为求和,会得到下面的柱形图

这时候,套用一下之前设置好的主题(mytheme),背景、坐标轴还有字体颜色就相应改变了。

p+mytheme

然后,因为之前格式刷部分我设定了一个蓝色的柱形图样式(mybar),这里直接引用的话,就可以直接生成蓝色的柱形图了。

ggplot(iris,aes(x=species,y=sepal_length)) +ggtitle("sepal_length by species")+mybar+mytheme


2、画图前的准备:数据塑形利器dplyr / tidyr

有了事先设定的一些格式刷以后,我们就可以快速有效地作图了。

但是在作图之前,就像excel作图总要先把数据用处理成想要的形式 。在excel里面,我们常用的是数据透视表或者一些公式辅助,而在R里,则是用一些常用的包,如dplyr及tidyr,对数据进行重塑再造

在我之前看的那两本ggplot2的书里,基本用的都是reshape2+plyr的组合。但实际上hadley后续出的dplyr与tidyr更加有用。具体的使用方法,在JHU Getting and cleaning data有介绍,老师还编了一个swirl课程供人使用,安装方法如下。

install.packages("swirl")
library(swirl)
#安装getting and cleaning data相关的课程教学包
install_from_swirl("Getting and Cleaning Data")
swirl()

其他的也可以参考我这篇博文

总之,用好dplyr的话,你可以快速的把一些数据,如下面的股票逐笔成交记录

随你所欲地汇总(group_by & summarize) 甚至再拆分 (spread),譬如示例里面就是把成交记录按照成交价格和BuySell拆分

data #刚刚演示的那些数据,在预测者网可以下载
data %>% group_by(Price,BuySell) %>% summarize(Money=sum(Money,na.rm=TRUE)) %>% spread(BuySell,Money)

要想做好ggplot2的图,对数据快速进行塑形的方法是我们必须要掌握的。上面的s wirl课程非常有用,而且值得是最新的一个技术方法,值得大家学习。

3、常用的商业用图

接下来分享一下我在这次作图过程中,最常用的几个图形的代码。首先声明,这些图形的进一步做法以及变形,基本都可以在这两本参考书籍里(R可视化技术 | ggplot2:数据分析与图表技术 )找到。我这里更多的摘取一些我比较常用的图表进行讲解

1、简单柱形图+文本(单一变量)
2、分面柱形图(facet_wrap/facet_grid)
3、簇型柱形图(position=”dodge”)
4、堆积柱形图(需要先添加百分比,再对百分比的变量做柱形图)
5、饼图、极坐标图
6、多重线性图

在作图之前,首先讲一下ggplot2的局限。

ggplot2最大的局限是,它基本不支持双坐标图和饼图。即使能做这些图形,也要很多设置,做起来非常繁琐。
按我个人理解,这个局限的根源与ggplot2开发者Hadley本身的审美习惯以及分析习惯脱不了关系。具体请看他在stackoverflow的这一段问答

It’s not possible in ggplot2 because I believe plots with separate y scales (not y-scales that are transformations of each other) are fundamentally flawed.

大神有技术就能任性。即使一堆人在他那回复下面各种求双坐标。。不知道Hadley现在有没有改变主意,把双坐标列为ggplot2的下一个更新点。但是如果你想画双坐标图或者饼图,至少经个人的实践,这些都是比较困难的,设置繁琐而且不美观。要么选择用excel完成,要么听大神的话,用分面图(facet)或者柱形图代替,会更加省事一些。

所以,在了解以下常用图形前,我们需要记住,ggplot2不是万能的,它虽然能做出非常美观的图表,但是总有一些图不能做,因此多个工具结合使用是非常必要的。

在知道以上前提下,我们以ggplot2自带的diamonds数据集为基础,结合dplyr/tidyr的应用,介绍一下常用图形的画法。

然后来讲一下除了双坐标图和饼图以外,ggplot2可以支持的常用图形的画法。数据的话,我们使用ggplot2自带的数据包diamonds

首先定义一下

mytitle="演示:以diamond为例"

1)简单柱形图


代码组成如下,这里使用格式刷mybar和mytheme,然后用geom_text添加柱形图标签(vjust=1表示在柱形图里面显示)

data1<-diamonds %>% group_by(cut) %>% summarize(avg_price=mean(price))
柱形图<-ggplot(data1,aes(x=cut,y=avg_price,fill=as.factor(cut)))+
        mytitle+mybar+mytheme+
        geom_text(aes(label=round(avg_price)),vjust=1,colour="white")

2)带分类的柱形图

举个例子来说,在有时候,我们想要快速绘图。使用facet_wrap或者facet_grid可以快速绘制相应图形。这也是ggplot2不太支持双坐标的原因:可以快速绘图,就不需要做那么多无用功了。

代码如下:

#dplyr处理数据
data2<-diamonds %>% group_by(cut,color) %>% summarize(avg_price=mean(price))
#画图,套用设定好的绘图元素
ggplot(data2,aes(x=color,y=avg_price))+facet_wrap(~cut,ncol = 2)+
        mytitle+mybar+mytheme
#在facet_wrap里面,如果加上scales="free"的话,坐标就不一样了。

3)簇型图
制图要点是,对数据作图后,添加geom_bar时,position=”dodge”(分开的)如果去掉这部分,默认是生成堆积图.

代码如下:

data3<-diamonds %>% filter(cut %in% c("Fair","Very Good","Ideal")) %>%
        group_by(cut,color) %>% summarize(avg_price=mean(price))
#簇状图
簇状柱形图<-ggplot(data3,aes(x=color,y=avg_price,fill=cut))+
        geom_bar(stat="identity",position="dodge")+
        mytheme+mytitle+mycolour_3
簇状柱形图

这里如果想要定义颜色的相应顺序的话,可以使用factor

譬如以下,只是用这行代码对颜色重新定义一下,用levels改变factor顺序,再画图的时候,颜色以及柱子顺序就会跟着改变了。非常方便。

data3$cut<-factor(data3$cut,levels=c("Very Good","Ideal","Fair"))

4)百分比堆积图
制图前要事先添加一个百分比的数据之后才好作图,这里我们用mutate(percent=n/sum(n))添加该百分比数据。同时去掉position=”dodge”

data4<-diamonds %>% filter(cut %in% c("Fair","Very Good","Ideal")) %>%
         count(color,cut) %>%
        mutate(percent=n/sum(n))
堆积图<-ggplot(data4,aes(x=color,y=percent,fill=cut))+mytitle+
        geom_bar(stat="identity")+mytheme+mytitle+mycolour_3
堆积图

当然,也可以做面积图。不过如果数据有缺失,面积图出错几率蛮大的

5)饼图以及极坐标图

参考一下这篇文章《【R】初吻R–ggplot绘制Pie Chart饼图》以及这篇文章使用ggplot2画图
在ggplot2里并没有直接画饼图的方法,基本上都是先画出柱形图,再用coord_polar转化为饼图

有两种作图方法:
1)不指定x轴,直接用geom_bar生成y轴,然后fill=分类颜色,coord_polar直接投影y
该方法的好处代码是比较简单(coord_polar(“y”)
加标签方法请见: http://stackoverflow.com/questions/8952077/pie-plot-getting-its-text-on-top-of-each-other#

data5<-diamonds %>% count(cut) %>%
        mutate(percent=n/sum(n))
ggplot(data5,aes(x=factor(1),y=percent,fill=cut))+geom_bar(stat="identity",width=3)+mycolour_7+
        coord_polar("y")+pie_theme+mytitle

2)指定x轴,x轴同时也是颜色(fill),先画柱形图,再转化为圆形。坏处是公式相对比较繁琐一些。

ggplot(data5,aes(x=cut,y=percent,fill=cut))+
        geom_bar(stat="identity",width=3)+
        mycolour_7+coord_polar("x")+pie_theme+mytitle

但是我尝试了多次,在饼图里加标签方法非常难以理解。。如果要饼图加标签的话,或许还不如柱形图

附上分面柱形图画法:

data5_1<-data5 %>% filter(color %in% c("D","E","F","G"))
ggplot(data5_1,aes(x=factor(1),y=percent,fill=cut))+geom_bar(stat="identity",width=3)+mycolour_7+
        coord_polar("y")+pie_theme+facet_wrap(~color,ncol = 4)+
        theme(legend.position="bottom")+mytitle

6、折线图

除了以上柱形图以外,折线图我们做的也比较多。
简单的折线图直接做就好了
然后像下图这样的

要点是,先做成如A-B-变量这样的二联表,然后,x轴为A,group为b,colour为b
下面代码展示了这个处理
如果去掉group的话,折线图会不知道怎么去处理数字。

data6<-diamonds %>% count(color,cut) %>% filter(color %in% c("D","E","F"))%>%
        mutate(percent=n/sum(n))
ggplot(data6,aes(x=cut,y=n,group=color,colour=color))+geom_line(size=1.5)+mypoint+
        mycolour_line_7+mytheme+mytitle

还有一些其他有用的图形
 
总之,ggplot2的语法还是比较独特的,而且其实处处有坑,处处有惊喜。如果作为商业绘图的话,需要一点一点地去探索去改变,保证风格和细节完美无缺。
不过ggplot2绘图有个好处是,一旦整理出常用的绘图代码,以后就可以无限次套用,尤其是那些格式刷,事先设定好的主题等。即ggplot2绘图,是完全可以做到越绘越快,再开发成本低廉的。

另外补充说明的是,ggplot2绘图,个人更看好其多种映射,以及在探索性数据分析里快捷绘图的能力,还有跟地图啊等结合的能力。还有动态交互等等。

譬如现在比较流行的R/Python与动态网页(大部分是D3)的结合 示例1,示例2

但愿各位不要将绘图局限于上述所选的一些最常用的图形与格式化调整里。请容我吐槽一句,这样子调风格学习真的很苦(づ ̄ ~~ ̄|||)づ

转载才会看到的:本文版权归http://www.cnblogs.com/weibaar 所有,转载请保留此段文字谢谢!

参考资料:

1、刘万祥老师的商业图表系列
2、R可视化技术
3、ggplot2:数据分析与图表技术
4、万能的stackoverflow
5、ggplot2
6、配色相关:
刘万祥老师早期的一篇配色博文
html两色搭配大全,以及html按风格分的配色盘

时间: 2024-10-12 15:08:25

R语言:ggplot2精细化绘图——以实用商业化图表绘图为例的相关文章

R语言︱机器学习模型评估方案(以随机森林算法为例)

R语言︱机器学习模型评估方案(以随机森林算法为例) 笔者寄语:本文中大多内容来自<数据挖掘之道>,本文为读书笔记.在刚刚接触机器学习的时候,觉得在监督学习之后,做一个混淆矩阵就已经足够,但是完整的机器学习解决方案并不会如此草率.需要完整的评价模型的方式. 常见的应用在监督学习算法中的是计算平均绝对误差(MAE).平均平方差(MSE).标准平均方差(NMSE)和均值等,这些指标计算简单.容易理解:而稍微复杂的情况下,更多地考虑的是一些高大上的指标,信息熵.复杂度和基尼值等等. 本篇可以用于情感挖

R语言ggplot2 简介

ggplot2是一个绘制可视化图形的R包,汲取了R语言基础绘图系统(graphics) 和l attice包的优点,摒弃了相关的缺点,创造出来的一套独立的绘图系统: ggplot2 有以下几个特点: 1) 图形映射, 自动化的将数据映射到图形上: 2) 图层叠加, 将不同形状的图表视为图层(layer),  可以方便的进行叠加 3)提供了范围控制(scale), 坐标系转换(coord), 分面(facet)等特性: 先看一个最简单的例子,用ggplot2 绘制一副散点图: 代码示例: libr

R语言ggplot2绘图设置X轴刻度,字体大小及绘图区大小

> colnames(data1)[seq(2,ncol(data1), 15)]  [1] "AAAA" "AAGG" "ATGC" "ACGT" "AGGA" "TACG" "TTCC" "TCCT" "TGCA" "CATG" [11] "CTTC" "CCTT&qu

R语言中文社区历史文章整理(类型篇)

R语言中文社区历史文章整理(类型篇) R包: R语言交互式绘制杭州市地图:leafletCN包简介 clickpaste包介绍 igraph包快速上手 jiebaR,从入门到喜欢 Catterplots包,让你绘制不一样的图 今天再来谈谈REmap包 ggplot2你需要知道的都在这... R访问数据库管理系统(通过RODBC包和RMySQL包两种方式) NLP--自然语言处理(三)text2vec包 Rattle:数据挖掘的界面化操作 借助caret包实现特征选择的工作 R语言的高质量图形渲染

R语言入门 (有其他编程语言基础)

慢慢才意识到概率统计的重要性,当时学的时候只知道很重要,是机器学习基础啥的,但是却没有真正意识到( ╯□╰ ).我现在的理解是,统计学习可以从大数据中挖掘出规律(其实和数据挖掘还是很相关的),在科研工作和生活中都可以帮助和指导我们.生活中,我们可以通过分析数据,“透过现象看本质” (learning from data),参考大概率发生的事件,帮助我们少走一些弯路,做出正确的决策. 最开始的概率思维来自大一的近现代史老师,老师说 “为什么公司要区分985,211等学位?”,其实我当时也不是很理解

R语言数据可视化之散点图

散点图简介 散点图通常是用来表述两个连续变量之间的关系,图中的每个点表示目标数据集中的每个样本. 同时散点图中常常还会拟合一些直线,以用来表示某些模型. 回到顶部 绘制基本散点图 本例选用如下测试数据集: 绘制方法是首先调用ggplot函数选定数据集,并在aes参数中指明横轴纵轴.然后调用散点图函数geom_point()便可绘制出基本散点图.R语言示例代码如下: 1 2 3 4 # 基函数 ggplot(ah, aes(x = ageYear, y = heightIn)) +   # 散点图

第五篇:R语言数据可视化之散点图

散点图简介 散点图通常是用来表述两个连续变量之间的关系,图中的每个点表示目标数据集中的每个样本. 同时散点图中常常还会拟合一些直线,以用来表示某些模型. 绘制基本散点图 本例选用如下测试数据集: 绘制方法是首先调用ggplot函数选定数据集,并在aes参数中指明横轴纵轴.然后调用散点图函数geom_point()便可绘制出基本散点图.R语言示例代码如下: # 基函数 ggplot(ah, aes(x = ageYear, y = heightIn)) + # 散点图函数 geom_point()

R语言︱机器学习模型评价指标+(转)模型出错的四大原因及如何纠错

笔者寄语:机器学习中交叉验证的方式是主要的模型评价方法,交叉验证中用到了哪些指标呢? 交叉验证将数据分为训练数据集.测试数据集,然后通过训练数据集进行训练,通过测试数据集进行测试,验证集进行验证. 模型预测效果评价,通常用相对绝对误差.平均绝对误差.根均方差.相对平方根误差等指标来衡量. 只有在非监督模型中才会选择一些所谓"高大上"的指标如信息熵.复杂度和基尼值等等. 其实这类指标只是看起来老套但是并不"简单",<数据挖掘之道>中认为在监控.评估监督模型

R语言学习笔记之: 论如何正确把EXCEL文件喂给R处理

前言: 应用背景兼吐槽 继续延续之前每个月至少一次更新博客,归纳总结学习心得好习惯. 这次的主题是论R与excel的结合,又称 论如何正确把EXCEL文件喂给R处理 分为: 1. xlsx包安装及注意事项 2.用vba实现xlsx批量转化csv 以及,这个的对象,针对跟我一样那些从R开始接触编程的,一直以来都是用excel做数据分析的人……编程大牛请轻拍 之所以要研究这个,是因为最近工作上接了个活,要把原来在excel端的报表迁移到R端,自动输出可视化图形,并制作PDF或PPT. 这个活可以分为