科学智能学院陈语谦团队在《Science Advances》 提出scProtoTransformer实现跨分子-细胞-组织的多尺度参考映射

时间:2026-09-04

单细胞测序与分析技术的快速发展,正推动我们在基因、细胞到个体的多层次尺度上系统理解生命。随着单细胞数据规模的爆炸式积累,如何将参考数据集中的注释与知识迁移到新的查询数据(reference mapping,参考映射),已成为人工智能驱动的生命科学研究中的关键环节。然而,现有的参考映射方法大多局限于细胞身份注释这一单一尺度,跨分子、细胞与供体(个体)等多分辨率的可扩展参考映射,仍是尚未被系统探索的领域。

近日,北京大学陈语谦团队在《Science Advances》上发表“scProtoTransformer: Scalable reference mapping across molecules, cells, and donors”的研究论文。该研究提出了一种基于生物原型(prototype)的Transformer架构scProtoTransformer,通过知识引导的原型分词器将基因表达投影为具有明确生物学定义的通路原型,并结合基础模型知识蒸馏与动态监督微调(Dynamic SFT)策略,首次在分子、细胞与供体三个尺度上实现了统一、可扩展的参考映射,为从基因到个体的系统性理解奠定了基础。

研究背景:跨尺度参考映射的两大挑战

论文指出,构建稳健的跨尺度参考映射面临两大核心挑战。

其一,批次效应(batch effects)问题。基因表达作为一种数值测量,极易受到批次效应干扰。不同实验平台与测序深度的差异,会使同一细胞类型在不同数据集间呈现明显不同的表达谱;这种“数值漂移”往往会掩盖真实的生物学信号,使模型学到技术噪声而非生物学异质性,从而降低结论在不同数据集、平台乃至实验室间的泛化能力。更为关键的是,许多现有整合方法依赖预先定义的批次信息,而在真实场景中批次效应的来源往往并不明确,主观的批次划分甚至可能严重损害研究结论的稳健性。

其二,现有方法多聚焦于细胞水平。主流方法通常利用预训练基础模型获取细胞表征,再通过监督微调(SFT)将参考数据标签迁移到查询数据,跨分子、细胞与供体等尺度的参考映射尚未被探索。然而,生物学系统本质上是分层的:在分子水平,基因间的相互作用影响通路等生物学功能;在细胞水平,不同的基因集模式刻画单细胞间的异质性;在供体水平,由细胞群体构成的表型捕捉个体间的差异。截至目前,尚缺乏一个能够同时在分子、细胞与供体三个水平实现表征学习与参考映射的统一框架。

scProtoTransformer的核心设计

scProtoTransformer无需主观选择批次,而是将基因表达抽象为一组生物学原型(参考TOSICA),在保留生物学语义的同时缓解数值批次效应的影响。其核心设计包含三大组件。

1.知识引导的原型分词器(Prototype Tokenizer)

受计算机视觉中原型建模的启发,研究者引入原型分词器:利用蛋白质语言模型ESM2(650M参数版本)对基因编码的蛋白质进行建模,将同一基因编码的蛋白嵌入求和得到基因嵌入,构建包含约2万个基因的基因词典(Gene Vocab);随后基于Reactome通路先验构建通路引导掩码,将基因词典转化为300个并行的“知识掩码线性层”,每个线性层将基因表达投影为一个通路原型token。这些原型token随后输入堆叠的Transformer层,自注意力机制建模原型之间的交互,从而刻画跨功能模块的生物学关联,同时避免原始表达数值的干扰。

2.基础模型知识蒸馏(Knowledge Distillation)

为了让scProtoTransformer继承基础模型以巨大训练成本获得的知识,团队以冻结的scGPT等基础模型作为“导航员”,通过余弦相似度用其细胞嵌入监督scProtoTransformer的学习。由此,模型仅需在scBaseCamp约2%(200万细胞)的子集上进行预训练即可获得高质量表征,将预训练规模降至全数据集的2%,大幅降低了资源需求。

3.动态监督微调(Dynamic SFT)

与基础模型的无监督预训练策略不同,动态SFT能够在数据含有标签时充分利用标签的判别力。团队从强化学习视角推导SFT的梯度,通过重要性采样与stop-gradient缩放因子设计自适应控制梯度,有效避免梯度爆炸与灾难性遗忘,在标签稀缺场景(如供体水平任务)下显著提升模型的判别能力与稳健性。

scProtoTransformer架构图。A.原型分词器将单细胞基因表达转化为通路原型token,6层Transformer建模原型交互,并以冻结基础模型为教师进行知识蒸馏、以动态SFT损失监督学习;B.原型分词器的参数初始化流程;C.原型分词器将基因表达转化为多个并行的原型表征。

结果:跨分子、细胞与供体的多尺度参考映射

1.分子水平参考映射

从scProtoTransformer中提取的基因嵌入,在UMAP可视化中按基因功能类别呈现清晰聚类,其功能编码的清晰度优于基础模型。在Geneformer基准构建的四项分子任务(转录因子作用范围、剂量敏感性、二价甲基化基因等)上,scProtoTransformer取得了与GenePT、scGPT等主流方法相当乃至更优的性能(AUROC分别达0.62、0.93、0.95、0.94)。

2.细胞水平参考映射

在BMMC(scRNA-seq,13个批次、22种细胞类型)、PBMC(scATAC-seq,2个批次、6种细胞类型)以及跨疾病泛癌数据集(13种癌症、23种细胞类型)上,scProtoTransformer在细胞类型注释的准确率(Acc)与F1分数上均取得领先(分别达0.94、0.97、0.91),优于Seurat、CellTypist、ACTINN、TOSICA、Cellcano、MetaTiME、Geneformer、scBERT、CellLM、LangCell、scGPT、KIDA等12种主流方法。其细胞嵌入不仅消除了批次效应,还增强了细胞类型间的生物学可分辨性。进一步地,将scProtoTransformer的细胞嵌入接入STATE解码器,在单细胞扰动响应预测上取得了与标准STATE模型相当的零样本性能,展示了其在虚拟细胞研究中的应用潜力。

3.可解释性:生物学原型

由于每个原型都对应一条具有明确生物学定义的通路,scProtoTransformer天然具备可解释性。对原型注意力矩阵进行差异分析,可定位CD8+ T细胞特异的通路;通路内基因在CD8+ T细胞中高表达,与真实生物学分布高度一致。基于细胞类型特异基因构建的基因共表达网络,进一步鉴定出一批与CellMarker数据库一致的CD8+ T细胞标志基因。

4.跨模态整合与空间数据适用性

在多模态整合基准(10x Multiome、Ma2020、Muto2021)上,scProtoTransformer在批次效应去除与生物学信息保守之间取得最佳平衡,总体得分超越GLUE、MultiVI、Monae、Modal-NexT等专门整合方法,且无需对抗训练即可自动完成跨模态整合与跨批次整合。在背外侧前额叶皮层(DLPFC)空间转录组数据上,scProtoTransformer无需依赖空间坐标即可实现跨切片整合,其表征质量(ARI)优于UnitedNet、scANVI、spatialDE、Pseudobulk等专门方法,并能推断出与Stitch3D一致的细胞分化轨迹。

5.供体水平参考映射

在涵盖104个公开癌症数据集、400万单细胞、3万基因的Kang-2024泛癌图谱上,团队通过基于注意力机制的多实例学习(MIL)模块,将同一供体的所有细胞嵌入聚合为供体嵌入,仅利用供体水平的肿瘤/正常标签即可实现高精度的癌症表型推断。随着参考数据规模从50%增至100%,scProtoTransformer的性能提升最为显著,在准确率与F1上均超越DEGAS、KIDA、scIDST、scVI+MIL、scTransMIL等基线方法。

供体水平参考映射。A.供体水平参考映射流程;B. Kang-2024细胞嵌入(PCA与scProtoTransformer对比);C.单细胞肿瘤标签与推断肿瘤评分,体现供体到单细胞的可追溯性;D.单细胞分辨率肿瘤预测ROC;E.不同训练数据规模下的供体水平参考映射对比;F.供体水平UMAP(按癌症类型着色);G.供体水平嵌入异质性(ARI);H.转移样本的癌症类型预测。

作者信息

该研究由北京大学深圳研究生院科学智能学院陈语谦、中山大学由林麟教授与中山大学博士毕业生(现在香港城市大学(东莞))陈观兴研究助理教授共同通讯作者。中山大学博士毕业生唐振超(现在腾讯)与中山大学硕士毕业生(现在香港理工大学博士生)何浩淮为论文共同第一作者。

论文信息

论文原文:https://www.science.org/doi/10.1126/sciadv.aef0286

代码:https://github.com/shapsider/scprototransformer

数据:https://drive.google.com/drive/folders/1zh8E2i4dFrmSq0_U0VkKzyxpI-wQS5de

联系我们

深圳市南山区西丽湖丽水路2199号北大园区

邮编:518055

版权所有 © 北京大学深圳研究生院科学智能学院  粤ICP备12081285号 公网安备44030502008554号  技术支持:its@pkusz.edu.cn