Lecture 5: R Group Comparison

Author

Chun-Hui Gao

Published

March 18, 2026

前言

本书是”数据驱动的可重复性研究”系列课程的第五讲,以 R 语言分组比较 为核心主题,系统介绍从 R 语言基础到分组数据统计分析的完整知识体系。

为什么要学习分组数据统计分析?

在科学研究中,分组比较 是最基本也是最常用的分析范式——无论是比较实验组与对照组的差异、评估不同处理条件的效果,还是探索多个因素之间的交互作用,都离不开分组数据的统计分析。然而,面对不同的数据特征(样本量、分布、变量数量),研究者需要在参数方法与非参数方法之间做出合理选择,并掌握从单变量到多变量的完整分析体系。

本书正是为此而设计:帮助读者建立系统的分组比较方法论,从假设检验的基本流程出发,逐步掌握 t 检验、ANOVA、Wilcoxon 检验、PERMANOVA 等核心方法,并通过真实数据实战,学会用 R 语言完成从数据处理到发表级图表的全流程。

学习目标

通过本书的学习,你将能够:

  1. 掌握 R 语言的基本数据类型、数据结构和核心软件包的使用
  2. 理解假设检验的标准流程,并能根据数据特征选择合适的统计方法
  3. 使用参数方法(t 检验、ANOVA)和非参数方法(Wilcoxon 检验、Kruskal-Wallis 检验)进行分组比较
  4. 掌握多变量分析方法(MANOVA、RDA、CCA、PERMANOVA、Mantel 检验)的基本原理与 R 实现
  5. 使用 ggplot2ggpubr 等工具制作发表级图表
  6. 从原始数据出发,通过 R 代码实现数据处理、统计分析和可视化的全流程自动化

适用读者

本书适合以下读者:

  • 具有基本统计学概念(如均值、标准差、p 值)的研究生和科研人员
  • 希望从 Excel/SPSS 过渡到 R 语言进行数据分析的初学者
  • 需要进行分组比较和多变量分析的生物学、农学、生态学等领域研究者

章节结构

本书共分为四个主要章节,按照”基础→方法→实战”的逻辑递进组织:

  • R 语言入门1  R 语言入门):介绍 R 语言的基本概念、数据结构和核心软件包
  • 经典数据集分析2  经典数据集分析):通过 R 自带数据集演示因子设计、ANOVA、混合效应模型等分析方法
  • 分组数据分析方法3  分组数据分析):系统梳理从简单到复杂的分组比较统计方法体系
  • 分组数据分析实战4  分组数据分析实战):以真实论文数据为例,展示完整的可重复性研究流程

使用说明

本书中的所有代码均可直接在 R 环境中运行。建议读者在阅读时同步执行代码,以加深理解。书中使用的主要 R 包包括 tidyverseggplot2ggpubr 等,请确保已安装这些包。

环境准备

从课程仓库下载本课程的源代码:

git clone git@github.com:D2RS-2026spring/lecture5-r-group-comparison.git

在开始学习之前,请确保你的 R 版本 ≥ 4.1.0,并已安装以下软件包:

cat(paste0("本次使用的 R 版本:", R.version.string))

本次使用的 R 版本:R version 4.5.2 (2025-10-31)

install.packages("pak")  # 推荐使用 pak 包安装
pak::pak(c("tidyverse", "ggpubr", "vegan", "nlme",
                    "car", "dunn.test", "pheatmap", "cowplot",
                    "corrplot", "kableExtra", "agricolae"))

如果你了解 renv,还可以一键创建一个可重复的本地分析环境。

renv::restore()

然后在终端运行 quarto render --to html 编译全书内容1


  1. 本项目推荐使用 Positron 作为开发环境。用 Positron 打开本项目后,renv 会自动识别并恢复依赖环境,Quarto 文档也可以直接预览和渲染。如果运行 quarto render 将同时生成 HTML 和 PDF。因 PDF 渲染配置容易出问题,所以如果出错,推荐先生成 HTML 文档。↩︎