简介

本书以 R 语言分组比较 为核心主题,系统介绍从 R 语言基础到分组数据统计分析的完整知识体系,并通过经典数据集和真实论文数据进行实战演练。以下是各章节的内容概要。

R 语言入门

本章将介绍 R 语言的基本概念与操作,为后续的数据分析打下基础。主要内容包括:

  • 数据类型与结构:向量、矩阵、数组、数据框、列表、因子和日期时间等基本数据结构
  • 核心软件包dplyr(数据筛选、排序与汇总)、ggplot2(基于图形语法的可视化)、tidyr(宽长格式转换)、stringr(字符串处理)等 Tidyverse 生态工具
  • 数据分析流程:从数据导入、清洗、探索、统计分析到可视化的标准化流程

经典数据集分析

本章通过 R 自带的三个经典农业数据集,展示不同实验设计下的统计分析方法:

  • npk 数据集——因子设计与 ANOVA:使用 2×2×2 全因子设计分析氮(N)、磷(P)、钾(K)肥料对作物产量的主效应和交互作用
  • ChickWeight 数据集——生长曲线与混合效应模型:利用逻辑斯蒂生长模型和 nlme 包拟合非线性混合效应模型,分析不同饲料对小鸡生长的影响
  • PlantGrowth 数据集——ANOVA 与 Tukey 检验:通过单因素方差分析和事后多重比较,演示模型诊断和发表级图表的制作

分组数据分析方法

本章系统梳理从简单到复杂的分组比较统计方法,构建完整的分析体系:

分析层次 参数方法 非参数方法
单组数据 单样本 t 检验 Wilcoxon 符号检验
两组比较 独立样本 t 检验 Wilcoxon 秩和检验
配对设计 配对 t 检验 Wilcoxon 符号秩检验
多组比较 ANOVA Kruskal-Wallis 检验
相关分析 Pearson 相关系数 Spearman 相关系数
多变量分析 MANOVA, RDA, CCA PERMANOVA, Mantel 检验

贯穿其中的核心原则是:优先检验数据假设(正态性、方差齐性),据此选择参数或非参数方法

分组数据分析实战

本章以 Gao et al. (2021) 论文为例,展示完整的可重复性研究流程:

  • 研究问题:初始接种比例如何调控大肠杆菌与恶臭假单胞菌共培养系统的最终结构与代谢能力
  • 数据处理:数据标准化、对数转换、碳源聚类分组和偏好性定义
  • 统计分析:综合运用 ANOVA、多重比较(Tukey HSD)、Wilcoxon 检验、PCA 排序分析等方法
  • 核心发现:初始比例对最终群落结构有显著影响,特定初始比例的共培养获得了更高的代谢能力

核心技能

通过本书的学习,读者将掌握以下关键技能:

  1. 假设检验的标准流程:数据探索 → 正态性检验 → 方差齐性检验 → 选择合适的统计方法 → 模型诊断 → 结果解释
  2. 方法选择策略:根据数据特征(分布、样本量、变量类型)在参数方法与非参数方法之间做出合理选择
  3. 可视化与报告:使用 ggplot2ggpubr 等工具制作带有统计标注的发表级图表
  4. 可重复研究:从原始数据出发,通过 R 代码实现数据处理、统计分析和可视化的全流程自动化