Lecture 5: R Group Comparison
前言
本书是”数据驱动的可重复性研究”系列课程的第五讲,以 R 语言分组比较 为核心主题,系统介绍从 R 语言基础到分组数据统计分析的完整知识体系。
为什么要学习分组数据统计分析?
在科学研究中,分组比较 是最基本也是最常用的分析范式——无论是比较实验组与对照组的差异、评估不同处理条件的效果,还是探索多个因素之间的交互作用,都离不开分组数据的统计分析。然而,面对不同的数据特征(样本量、分布、变量数量),研究者需要在参数方法与非参数方法之间做出合理选择,并掌握从单变量到多变量的完整分析体系。
本书正是为此而设计:帮助读者建立系统的分组比较方法论,从假设检验的基本流程出发,逐步掌握 t 检验、ANOVA、Wilcoxon 检验、PERMANOVA 等核心方法,并通过真实数据实战,学会用 R 语言完成从数据处理到发表级图表的全流程。
学习目标
通过本书的学习,你将能够:
- 掌握 R 语言的基本数据类型、数据结构和核心软件包的使用
- 理解假设检验的标准流程,并能根据数据特征选择合适的统计方法
- 使用参数方法(t 检验、ANOVA)和非参数方法(Wilcoxon 检验、Kruskal-Wallis 检验)进行分组比较
- 掌握多变量分析方法(MANOVA、RDA、CCA、PERMANOVA、Mantel 检验)的基本原理与 R 实现
- 使用
ggplot2、ggpubr等工具制作发表级图表 - 从原始数据出发,通过 R 代码实现数据处理、统计分析和可视化的全流程自动化
适用读者
本书适合以下读者:
- 具有基本统计学概念(如均值、标准差、p 值)的研究生和科研人员
- 希望从 Excel/SPSS 过渡到 R 语言进行数据分析的初学者
- 需要进行分组比较和多变量分析的生物学、农学、生态学等领域研究者
章节结构
本书共分为四个主要章节,按照”基础→方法→实战”的逻辑递进组织:
- R 语言入门(1 R 语言入门):介绍 R 语言的基本概念、数据结构和核心软件包
- 经典数据集分析(2 经典数据集分析):通过 R 自带数据集演示因子设计、ANOVA、混合效应模型等分析方法
- 分组数据分析方法(3 分组数据分析):系统梳理从简单到复杂的分组比较统计方法体系
- 分组数据分析实战(4 分组数据分析实战):以真实论文数据为例,展示完整的可重复性研究流程
使用说明
本书中的所有代码均可直接在 R 环境中运行。建议读者在阅读时同步执行代码,以加深理解。书中使用的主要 R 包包括 tidyverse、ggplot2、ggpubr 等,请确保已安装这些包。
环境准备
从课程仓库下载本课程的源代码:
git clone git@github.com:D2RS-2026spring/lecture5-r-group-comparison.git在开始学习之前,请确保你的 R 版本 ≥ 4.1.0,并已安装以下软件包:
cat(paste0("本次使用的 R 版本:", R.version.string))本次使用的 R 版本:R version 4.5.2 (2025-10-31)
install.packages("pak") # 推荐使用 pak 包安装
pak::pak(c("tidyverse", "ggpubr", "vegan", "nlme",
"car", "dunn.test", "pheatmap", "cowplot",
"corrplot", "kableExtra", "agricolae"))如果你了解 renv,还可以一键创建一个可重复的本地分析环境。
renv::restore()然后在终端运行 quarto render --to html 编译全书内容1。