Seurat V5中多样本SCT标准化与整合的工作流程解析
2025-07-02 02:38:47作者:吴年前Myrtle
背景介绍
在单细胞RNA测序数据分析中,Seurat是最广泛使用的工具之一。随着Seurat V5的发布,其工作流程与之前的V4版本相比发生了一些重要变化,特别是在处理多个样本的SCTransform(SCT)标准化和整合方面。
核心问题
许多从Seurat V4迁移到V5的用户在处理多样本数据时遇到了困惑,特别是在以下方面:
- 合并样本时应该使用RNA还是SCT assay
- 何时进行SCT标准化
- 如何正确设置整合流程
推荐工作流程
1. 样本合并
首先将所有样本合并为一个Seurat对象。在合并时,使用RNA assay即可,因为后续会统一进行SCT标准化。
# 假设OM.list是包含所有样本的列表
OM.merge <- merge(x = OM.list[[1]], y = OM.list[-1])
2. 数据分层
合并后,需要根据实验设计将数据分层。关键点是分层变量应该对应不同的测序批次或技术重复,而不是生物学条件(如疾病状态)。
# 正确的做法是按样本ID分层
OM.merge[["RNA"]] <- split(OM.merge[["RNA"]], f = OM.merge$sample_id)
# 错误的做法是按疾病状态分层
# OM.merge[["RNA"]] <- split(OM.merge[["RNA"]], f = OM.merge$disease)
3. SCT标准化
对分层后的数据进行SCTransform标准化:
OM.all <- SCTransform(OM.merge)
这一步会自动为每个层(即每个样本)拟合单独的负二项式模型,同时保留共同的基因特征空间。
4. 降维与可视化
OM.all <- RunPCA(OM.all)
OM.all <- RunUMAP(OM.all, dims = 1:30)
5. 数据整合
使用Harmony等方法进行批次校正:
OM.all <- IntegrateLayers(
object = OM.all,
method = HarmonyIntegration,
normalization.method = "SCT"
)
6. 聚类分析
OM.all <- FindNeighbors(OM.all, reduction = "harmony", dims = 1:30)
OM.all <- FindClusters(OM.all, resolution = seq(0, 1.5, by = 0.1))
技术要点解析
-
为什么按样本分层而不是按疾病状态?
- 按样本分层可以正确建模不同测序批次的技术变异
- 按疾病状态分层会混淆技术变异和生物学差异
-
V5与V4的主要区别:
- V5使用多层(multi-layer)架构代替了V4中的列表操作
- 工作流程更加线性化,减少了循环操作
- 整合方法直接作用于多层对象
-
SCT标准化的优势:
- 同时处理技术噪声和测序深度差异
- 保留生物异质性
- 适合后续的差异表达分析
常见问题解决
如果在整合后观察到奇怪的聚类模式,可以检查:
- 分层变量是否正确设置
- 是否使用了正确的标准化方法(normalization.method = "SCT")
- PCA和整合使用的维度是否合适
- 分辨率参数是否适合数据集的复杂度
通过遵循上述工作流程,用户可以有效地在Seurat V5中处理多样本单细胞数据,获得可靠的整合结果。
登录后查看全文
热门项目推荐
相关项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0153- DDeepSeek-V4-ProDeepSeek-V4-Pro(总参数 1.6 万亿,激活 49B)面向复杂推理和高级编程任务,在代码竞赛、数学推理、Agent 工作流等场景表现优异,性能接近国际前沿闭源模型。Python00
LongCat-Video-Avatar-1.5最新开源LongCat-Video-Avatar 1.5 版本,这是一款经过升级的开源框架,专注于音频驱动人物视频生成的极致实证优化与生产级就绪能力。该版本在 LongCat-Video 基础模型之上构建,可生成高度稳定的商用级虚拟人视频,支持音频-文本转视频(AT2V)、音频-文本-图像转视频(ATI2V)以及视频续播等原生任务,并能无缝兼容单流与多流音频输入。00
auto-devAutoDev 是一个 AI 驱动的辅助编程插件。AutoDev 支持一键生成测试、代码、提交信息等,还能够与您的需求管理系统(例如Jira、Trello、Github Issue 等)直接对接。 在IDE 中,您只需简单点击,AutoDev 会根据您的需求自动为您生成代码。Kotlin03
Intern-S2-PreviewIntern-S2-Preview,这是一款高效的350亿参数科学多模态基础模型。除了常规的参数与数据规模扩展外,Intern-S2-Preview探索了任务扩展:通过提升科学任务的难度、多样性与覆盖范围,进一步释放模型能力。Python00
skillhubopenJiuwen 生态的 Skill 托管与分发开源方案,支持自建与可选 ClawHub 兼容。Python0112
项目优选
收起
暂无描述
Dockerfile
733
4.75 K
Ascend Extension for PyTorch
Python
647
795
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
434
395
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.01 K
1.01 K
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
1.18 K
152
deepin linux kernel
C
30
16
华为昇腾面向大规模分布式训练的多模态大模型套件,支撑多模态生成、多模态理解。
Python
146
237
暂无简介
Dart
984
252
昇腾LLM分布式训练框架
Python
166
198
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.68 K
989