1. 数据预处理
支持 Demo 数据、CSV/TSV/XLSX 表达矩阵上传、CEL 文件 (Affymetrix) 和 GEO 数据库。
归一化方法:Log2 转换、分位数归一化、RMA。
CEL 文件处理:
需要安装 Bioconductor 的 affy 或 oligo 包。
GEO 数据:
需要安装 GEOquery 包。
2. 差异分析
limma: t_mod = t_obs × s_0 / s_obs + (1 - s_0/s_obs) × d_0
limma (Linear Models for Microarray Data):经验贝叶斯方法收缩方差估计,对小样本更稳健。
也支持经典 t 检验 (Welch / Student)。
输出:
火山图、MA 图、热图、差异基因表格。
3. 功能富集分析
ORA (过表达分析):对显著差异基因进行 GO/KEGG/Reactome 富集。
GSEA (基因集富集分析):基于全基因排序列进行富集,无需预设阈值。
依赖包:
clusterProfiler, org.Hs.eg.db / org.Mm.eg.db, enrichplot。
4. 探索分析
PCA 主成分分析、t-SNE / UMAP 降维可视化、层次聚类热图、样本相关性矩阵。
依赖包:
Rtsne, umap, plotly。
5. 数据格式说明
表达矩阵:
行=基因,列=样本,第一列为行名。支持 CSV/TSV/XLSX。
分组信息 (可选):
两列 — Sample, Group。未提供时自动从样本名推断。
基因注释 (可选):
至少含 GeneSymbol 列,用于富集分析。