1. 这个课题为什么值得做:临床痛点与科学假设
1.1 肿瘤血栓并非普通“血块”,它是晚期肾癌的独立预后信号
对于很多非泌尿肿瘤领域的人来说,“肾细胞癌伴肿瘤血栓”听起来像个罕见的合并症,但只要在泌尿外科或者肿瘤内科待过,就知道这组病人其实并不少。肾细胞癌有一个非常鲜明的生物学特点:肿瘤细胞容易侵入肾静脉,然后沿着静脉腔继续生长,形成所谓的“静脉癌栓”。临床最常用的是Mayo分级,从0级(仅肾静脉内)到4级(血栓延伸至右心房),级别越高,手术难度和围手术期风险就越大。
这里要强调一个容易被忽视的临床事实:一旦肾细胞癌出现静脉癌栓,无论是否完整切除,患者的远处转移风险都会显著上升。传统观念里,癌栓只是“肿瘤长错了位置”,但越来越多证据表明,癌栓本身是肿瘤侵袭能力增强的表现,甚至可能代表了肿瘤内部一群更具干性和转移潜能的细胞亚群。也就是说,癌栓不是“堵塞血管的肿瘤元气外溢”,而是肿瘤演化过程中的一种生物学选择。
这篇“第16篇HD文章”做的核心事,就是把这样的癌栓组织拿到单细胞层面去解剖,看它里面的肿瘤细胞处于什么状态、和周围微环境在怎么互作,特别是盯住“细胞外基质重塑”这条线,尝试回答一个非常落地的问题:这群高侵袭能力的亚群,有没有可以被药物攻击的致命软肋?
1.2 从肿瘤细胞中心论转向微环境视角
过去二十年,肾癌研究的主旋律一直是VHL-HIF轴、血管生成、免疫检查点,成就也非常巨大,抗血管生成靶向药和PD-1抑制剂彻底改变了晚期肾癌的治疗格局。但临床中仍有一批患者,对TKI和免疫治疗的反应不理想,尤其是存在高负荷肿瘤、合并静脉癌栓的病人。所以大家逐渐把注意力从单纯的“肿瘤细胞”移向所谓的“肿瘤微环境”。
微环境里包含基质细胞、免疫细胞、成纤维细胞和大量的细胞外基质。基质这个词听起来抽象,你可以把它理解成“肿瘤组织的骨架和胶水”。胶原、纤连蛋白、层粘连蛋白、蛋白聚糖,这些成分构成了一个物理支架,还通过整合素、CD44等受体向肿瘤细胞发射各种促存活信号。肿瘤细胞反过来又会分泌MMP、LOX等酶类,主动改造这套骨架。恶性循环就这么形成了。
这项题目里最抓人的词是两个:“亚群”和“重塑能力”。前者意味着肿瘤内存在异质性,癌栓里的细胞并不是铁板一块;后者意味着ECM不是静态的“物理垃圾”,而是被一群特定细胞主动调控的动态网络。把这两个词组合起来,科学假设就很清晰了:存在一个以高ECM重塑为主要特征的肿瘤亚群,它在癌栓中富集,驱动侵袭转移,并且因为高度依赖某些ECM相关通路而留下治疗窗口。
1.3 一篇文章要回答的三个问题
落笔之前,我们先给自己定了一个可检验的逻辑链:
第一个问题,“谁在重塑”——癌栓中哪个亚群的肿瘤细胞转录组里,ECM相关基因的表达显著上调,并且这群细胞具有更高的干性特征或上皮间质转化特征。
第二个问题,“重塑了谁”——这群细胞分泌的ECM成分与重塑酶改变了对哪些下游信号通路的激活,又是如何与免疫细胞、内皮细胞对话的。这里不光要看肿瘤细胞自己,还要看肿瘤相关成纤维细胞(CAF),因为ECM重塑从来不是肿瘤细胞单打独斗。
第三个问题,“打哪里最疼”——通过富集分析和药物敏感性预测,找出这群细胞赖以生存的、且在正常组织中表达较低的关键节点,再用体外实验验证这些节点的可干预性。
这三个问题对应的就是单细胞转录组测序、细胞通讯分析和力学生物学验证三大块工作。下面我会把每一块展开来讲,包括设计思路、分析流程、实操细节和一些踩坑记录。
2. 样本、平台与整体实验设计
2.1 样本队列的取舍:手术标本为什么是这一切的前提
做这类研究的第一个门槛是样本。肾癌伴静脉癌栓的患者本身占比不高,虽然多数泌尿外科中心都有处理经验,但是能否在手术室拿到高质量的新鲜配对样本,完全取决于外科团队和科研团队的默契。我们设计的样本队列分三组:癌栓主体、原发肾肿瘤、癌旁正常肾组织(尽可能远离肿瘤至少3cm),有条件的病例还要留一管外周血做后续的突变验证。
这里最忌讳的是“只要癌栓”。因为你想从异质性的角度讲清楚“亚群富集”这个概念,就必须同时有原发灶作为参照,否则你无法区分癌栓里的特殊亚群到底是“本来就有、在癌栓中占比更高”,还是“完全新出现”的。配对设计可以把这两种情况分开。
组织获取后必须迅速处理,离体时间控制在30分钟以内,放低温保存液里运回实验室。单细胞实验最怕细胞活性下降,尤其是肿瘤细胞本身对缺氧和机械损伤很敏感,我们在前几个批次里就因为酶消化时间过长,导致肿瘤细胞成分占比偏低,后期分析时大量精力花在矫正这个偏差上。这个我后面会细说。
2.2 单细胞转录组选型:为什么是scRNA-seq加上空间验证
单细胞平台的选择方面,我们采用了10x Genomics的Chromium平台,这是目前最成熟、稳定性最高的方案。虽然国产平台有性价比优势,但对于一个涉及多例配对样本、需要批量处理和跨样本整合的研究来说,数据的稳定性和社区生态仍然很重要。另外,考虑到后续要分析ECM相关基因表达,不能用全长转录组,因为成本会明显上升,而且我们并不需要做剪切异构体层面的分析,标准3'端的scRNA-seq足够回答基因级问题。
但必须承认,单细胞转录组有一个致命短板:它丢失了空间位置信息。ECM重塑这件事天然有空间属性,胶原沉积在哪、免疫细胞被挡在哪,这些用“一管细胞”是讲不清楚的。所以我们采用了“scRNA-seq找亚群、空间转录组做定位”的组合策略,在关键病例中补做Visium切片,用来验证ECM高表达亚群是否集中在癌栓的外周区域,以及这些区域是否有T细胞排斥现象。
关于经费分配,我的建议是:多数样本用scRNA-seq建库,选出2到3例代表性样本做空间转录组,而不是平均用力。空间转录组的分辨率尚未达到单细胞级别,一个spot可能是多个细胞的混合物,它更擅长验证空间趋势,而不是定义细胞状态。
2.3 实验设计的完整流程图:用一句话管理复杂度
这类多组学项目最怕的就是“数据很多、逻辑混乱”。我们在立项时画了一张非常简单的流程图,每个阶段设定了明确的“停止或继续”的判据:
第一阶段,组织获取与质检,核心指标是细胞活率大于70%,建库后测得有效细胞数大于5000个;低于这个标准的样本直接淘汰,不进入后续分析,避免“垃圾进、垃圾出”的问题。
第二阶段,单细胞数据质控与去批次,核心指标是各样本之间细胞类型比例没有明显偏倚,UMAP上同类型细胞能够混聚而不被样本标签分群。
第三阶段,亚群定义与ECM能力评分,核心指标是候选肿瘤亚群在至少3例独立样本中可重复检出,而不是某一个样本的稀有细胞群。
第四阶段,功能验证与药物干预,核心指标是靶点的siRNA或小分子抑制剂处理能够显著影响肿瘤细胞的增殖、迁移或凋亡水平。
这个流程并不复杂,但它帮我们避免了很多后期返工,尤其是防止“为了一张漂亮的图强行堆数据”。
3. 核心分析:如何定义“ECM重塑能力强的亚群”
3.1 先从UMAP图上“看”出问题
单细胞分析走到细胞类型注释这一步时,通常观察者会看几个经典marker来定义大类:EPCAM和KRT家族是上皮肿瘤细胞,PTPRC是免疫细胞,CD31、VWF是内皮细胞,PDGFRA和COL1A1则提示成纤维细胞。我们用Seurat完成标准流程:NormalizeData、FindVariableFeatures、PCA、Harmony去批次、FindClusters,然后用UAMP可视化。
在这个项目中,最让我印象深刻的画面出现在肿瘤细胞重聚类之后。我们提取出EPCAM阳性细胞做二次聚类,分成了6个亚群。前5个亚群的top marker都相对规矩,有的高表达CA9和NDUF家族,看起来是代谢比较活跃的经典ccRCC状态;但第6个亚群非常奇怪,它的EPCAM表达略有下降,而FN1、COL1A1、COL1A2、LUM、SPP1这些基因表达特别高,说句不太严谨的,它长得很像成纤维细胞。
后来我们用inferCNV查看染色体拷贝数变化,确认这个亚群仍然带有肾癌常见的染色体3p缺失和5q扩增特征,才敢判定它确实是肿瘤细胞,只是进入了一种“基质样”状态——上皮细胞在过度激活ECM程序时会出现partial EMT,这种状态高度类似于临床上讲的肉瘤样癌特征。也就是说,癌栓里存在一撮把自己伪装成“基质制造机”的肿瘤细胞,而这一特征在配对原发灶里占比显著偏低。
3.2 “重塑能力”不能靠感觉,需要一套可复现的评分方案
有了候选亚群,接下来就是“给它画像”。ECM重塑能力强,不能停留在少数marker的口头叙述上,必须有一个量化评分,能够把每个细胞的“重塑能力”映射成一个分数,然后比较不同亚群间的差异。
我们参考了已发表文献中反复出现的ECM相关基因集,将它们分为三类:
第一类是核心基质成分,包括I型胶原(COL1A1、COL1A2)、纤连蛋白FN1、层粘连蛋白亚基(LAMA4、LAMB1、LAMC1)、蛋白聚糖(VCAN、LUM、DCN)。
第二类是重塑酶类,包括基质金属蛋白酶家族(MMP2、MMP9、MMP14)、赖氨酰氧化酶LOX及其同源蛋白LOXL2,这些酶负责降解旧基质或交联新基质。
第三类是整合素受体和下游效应分子,包括ITGAV、ITGB1、ITGB3、CD44以及FAK信号通路相关的PTK2和PI3K-AKT通路中的关键节点。
评分方式用的是ssGSEA,这个工具的好处是不需要预先设定高表达和低表达的分组,它会对每个细胞独立打分,适合亚群内部异质性的刻画。你可以理解成:给每个细胞发一份问卷,问卷里所有问题都围绕“你是不是在积极构建和改造基质”,最后汇总成单一分数。
分析结果显示,那个“基质样”肿瘤亚群在这个评分上的分布极高,和其余肿瘤亚群几乎不重叠。而且当我们把这个评分细分成“成分合成”“酶类活性”“受体激活”三个子维度时,发现该亚群在三方面都同时上调,说明它并不是某个单一基因的孤立激活,而是整套程序进入了一种全面开启的状态。
3.3 细胞通讯分析:它怎么影响周围的“邻居”
得到高ECM重塑亚群后,我们还得回答“它重塑出来的基质,到底为谁服务,伤害了谁”的问题。这就进入了细胞通讯分析的环节。
我们使用CellChat这个R包来推断配体-受体互作。它会根据两个细胞亚群的配体表达水平与受体表达水平,计算一个“通讯强度”的得分,并可以模拟信号在多个细胞类型之间的接力传导。
分析中我们发现三个非常清晰的趋势:
一个是该亚群高表达FN1、COL1A1、SPP1,与之对应的,巨噬细胞亚群表面高表达CD44、ITGAV、ITGB1。这形成了一个经典的“基质-整合素”轴,能强烈激活巨噬细胞中的促纤维化程序,让巨噬细胞从炎症表型切换到修复表型。换句话说,肿瘤细胞不仅自己造基质,还通过信号传递把巨噬细胞也拉过来当“共建者”。
另一个是CAF群体的反馈激活。该亚群分泌TGFB1,刺激CAF表达更多COL和LOX家族基因,随后高密度ECM进一步包裹肿瘤细胞,形成一个自我强化的正反馈环。这让我们意识到“ECM重塑能力”绝不是肿瘤细胞单方的事,而是肿瘤-基质细胞的双向协作。
第三个发现和免疫逃逸高度相关:该亚群表面高表达LGALS9,而T细胞表面高表达HAVCR2(TIM-3)。LGALS9-TIM3轴在文献中被反复报道与T细胞耗竭相关。在我们的数据里,这个信号轴的强度在癌栓中明显高于原发灶。于是可以把逻辑链串起来:高ECM重塑亚群构建致密屏障,招募再生型巨噬细胞,同时通过Galectin-9把T细胞推向耗竭状态,从物理和免疫两个维度同时实现免疫逃逸。
3.4 空间转录组如何“锤实”结论
细胞通讯分析只能说明不同亚群“可能互作”,不代表它们真的在空间上邻近。如果高ECM重塑亚群和耗竭T细胞根本待在不同区域,那前面的信号轴分析就只是“远程恋爱”。
我们在Visium数据上做了所谓“共定位评分”的量化,把12×8微米的空点作为最小空间单元,计算每个spot中高ECM评分细胞的比例和T细胞耗竭marker表达量的相关性。结果呈显著正相关,特别是在癌栓周边的纤维分隔带区域,高ECM信号和T细胞耗竭信号同时升高。而在原发灶中,这种空间上的耦合明显弱于癌栓。
从生信分析的角度看,这一步把“谁重塑、重塑了谁”升级为“在哪里重塑最危险”。我认为这也是文章能够站稳脚跟的关键所在——不再只是算出一个score,而是把一个抽象的分子特征还原到组织空间里,让人能够直接看到它和免疫状态的分布关系。
4. 治疗脆弱性:把基质重塑转化为可干预的靶点
4.1 ECM之所以能成为脆弱性,全因为它绑架了免疫
我们常说肿瘤耐药,其实靶向ECM相关节点的治疗逻辑和常规肿瘤靶向药不太一样。常规靶向药是直接抑制肿瘤细胞的驱动通路,而针对ECM重塑的能力,你要撬动的不仅仅是一小撮肿瘤细胞,还包括整个微环境的“分工模式”。
但这恰恰提供了另一种思路:因为基质的物理特性非常独特,高密度的交联胶原可以显著限制T细胞的迁移速度,同时通过整合素信号提高肿瘤细胞的存活能力。如果能够打断这个僵局,免疫治疗的效果就有机会被重新激活。所以我认为,这个课题发现的治疗脆弱性,本质上不是“杀死肿瘤细胞”的脆弱性,而是“解除微环境封锁”的脆弱性。这也解释了为什么这类靶点更适合联合免疫检查点抑制剂使用,而不是单打独斗。
具体来看,我们锁定了几个候选的可干预节点。FAK(PTK2)是最直接的下游枢纽,整合素接受到ECM信号后,凭FAK的磷酸化启动一系列促增殖、促存活信号,而这个轴的活性在肾癌中不算特异性特别强的,但FAK抑制剂联合PD-1的临床试验已经在多个癌种中有初步数据。LOXL2则是横跨基质成分和酶的节点,它负责胶原的交联,交联越强,基质越硬,我们通过免疫组化验证了LOXL2在癌栓区域的高表达,而它在mRNA表达层面已被多个队列证实与肾癌预后差相关。第三个是TGFBI,它是由TGFB通路诱导分泌的分泌性蛋白,与整合素相互作用,参与诱导巨噬细胞向修复表型极化,这几个条件使它像是一个“微环境调控枢纽”。
这里要特别提出一个关于“药物靶点优先级”的经验之谈。很多人喜欢把工作集中在那些“多组学分析后最显著”的基因上,但一位做转化医学的前辈给我的建议是:如果一个基因具有“分泌性”或“表面定位”的性质,它在药物开发中的优先级就应该显著提高。因为ECM重塑相关的基因,很多是转录因子或胞内酶,成药性不好;而分泌蛋白、表面受体,天然容易被抗体或重组蛋白靶向。这个观点直接影响了我们最后的候选靶点选择,也是文章最终能往“治疗脆弱性”方向延伸的重要支撑。
4.2 生信预测铺垫的实验方向
为了给后续验证实验提供方向,我们在数据分析后段加入了一系列药物敏感性分析和通路富集分析。
通路富集方面,GSEA结果显示高ECM重塑亚群显著富集在TGFB信号、WNT信号、HIF1A信号和PI3K-AKT信号通路。前两者几乎是可以预测的结果,因为TGFB和WNT本身就是ECM重塑的关键上游;HIF1A的富集则体现了肾癌处于低氧状态下的适应性反应;PI3K-AKT的意义在于,它把基质粘附信号转换成了胞内生长信号,这种信号耦合关系为“基质-存活”假说提供了通路层面的证据。
药物敏感性方面,我们用了两个互补的数据库。一个是CTRP和PRISM,这两个数据库基于细胞系的药敏数据与转录组表达谱,用机器学习方法预测对某个药物更敏感的细胞系特征。我们将高ECM评分肿瘤样本的转录组特征输入模型,发现它们对FAK抑制剂、HDAC抑制剂和部分微管类药物的预测敏感性更高。另一个是CMap数据库,将差异基因特征映射到小分子扰动特征库,寻找可能逆转该状态的化合物。
需要说明的是,这些生信预测只能作为脚手架,不能直接用来下临床结论。它们唯一的实际功能是帮我们筛选出值得在体外花时间验证的药物组合,缩小实验矩阵。文章里也要如实写清这一点。
4.3 体外验证实验的落地设计
转录组特征锁定在FAK信号、LOXL2介导的胶原交联、TGFBI介导的巨噬细胞极化三条线上后,就可以进入体外验证了。
第一步,我们用两个肾癌细胞系及一个原代癌栓来源细胞系,在二维培养中做siRNA敲降实验。把FN1和LOXL2敲掉后,细胞的迁移能力在Transwell实验里明显下降,同时MMP2/MMP9的酶谱活性也受到抑制。这些实验不复杂,但很直接:它证明了高ECM重塑不是被动的转录标签,而是一个维持迁移表型的功能依赖。
第二步,做三维基质胶培养,模拟体外ECM环境。这里有一个非常关键的实验心得:三维培养时,基质胶的浓度和胶的储存温度都会影响实验结果,必须严格批间验证;如果条件没控制好,肿瘤细胞会直接沉底形成二维生长,实验数据彻底失去意义。我们最终用的是5mg/mL的高浓度基质胶,在37度培养箱里预凝30分钟后再种细胞,才稳定住形态学差异。
第三步,加入FAK抑制剂处理。选药时我们没有选实验室里最常用的高浓度单药处理方案,而是模拟临床上的联合用药思路:FAK抑制剂低剂量联合PD-1抗体。结果很有意思,单独用药的增殖抑制其实有限,但在共培养模型中,能显著增强T细胞对肿瘤球的浸润和杀伤。这再次印证了前面的判断:ECM轴向的疗效更多体现在解除微环境抑制,而不是直接细胞毒。
4.4 我们已经证明的机制,以及还没完全证明的部分
文章里可以明确写出的是:肾细胞癌伴静脉癌栓的患者存在一个以高ECM重塑为特征的肿瘤细胞亚群;该亚群构建高硬度物理屏障并诱导巨噬细胞极化;该亚群的高丰度与T细胞耗竭呈强相关;体外敲低FN1/LOXL2可削弱其迁移能力;FAK抑制联合PD-1可增强免疫杀伤。
我们还没来得及完全证明的是:在体内环境中,仅仅抑制FAK或LOXL2是否足以逆转已建立的致密基质,实现T细胞再浸润?因为体外模型无法完全模拟ECM降解与合成之间的动态平衡,而体内实验的动物模型构建本身很费时费力。如果有后续工作,这会是优先方向。
另一件没有实现在文章里的事,是对“ECM重塑能力”与其他治疗方式的交互关系进行系统筛选。比如放疗、化疗、靶向治疗的敏感性是否也与这个评分相关。虽然我们没有把这一块写进文章,但这是一个非常值得延伸的方向,尤其对理解为什么同一分期肾癌患者治疗反应差异巨大的问题,很可能提供新的解释。
5. 常见问题与排查技巧实录
5.1 批次效应:不要让“实验日期”成为最大的分组变量
多例样本的单细胞整合项目中,批次效应永远是最容易坑人的问题。我们在早期分析中过度信任了标准化流程,直接用Seurat默认参数整合,结果UMAP图上所有样本都按“实验日期”分成了几个大岛,无论怎么调整FindClusters分辨率,主分组变量都是批次而不是生物学差异。
解决办法是引入Harmony做数据整合。它通过在低维空间中迭代寻找到最近邻,识别出哪些细胞聚类是受技术变异影响的,然后局部校正。这个工具的整合效果在我们的数据上非常好,运行速度也比Seurat的SCTransform整合方式快很多。整合后,免疫细胞、基质细胞和肿瘤细胞重新按类型聚集,肉眼可见地“干净”了许多。
一个细节值得强调:Harmony整合前,最好先确认每个样本都检测到了所有主要细胞类型。如果一个样本恰好没有捕获到某种细胞,Harmony会把其他样本中这种细胞“牵”到该样本的分布上去,形成虚假的低表达信号。我们发现这种情况存在后,干脆把该样本从对应的细胞类型分析中剔除,而不是全样本强整合。
5.2 肿瘤细胞和成纤维细胞“难舍难分”时的处理办法
这次分析中最大的“bug”就是那个基质样肿瘤亚群。它表达上皮标记的同时又表达了大量成纤维细胞标记,UAMP图上它并不在肿瘤细胞大群里,而是凑在CAF附近。如果不加分辨,非常容易被注释成CAF的一部分,然后整篇文章的故事线就彻底跑偏了。
我们解决这个问题的方法有两个,一个是用inferCNV做推断拷贝数变异。一般来说,肿瘤细胞会有大尺度的染色体拷贝数异常,而正常基质细胞保持二倍体。当我们在“疑似成纤维细胞”亚群中看到明显的3p缺失和5q扩增,就可以判断它是肿瘤细胞出身的。
另一个是看等位基因表达的模式。条件允许的情况下,可以做线粒体DNA的突变分析,因为肿瘤细胞中线粒体突变往往和核基因组突变同步累积。但我们没有单独做线粒体测序,实际用的是inferCNV加经典的肿瘤marker表达谱加以综合判断。这里要提醒新手:一定不要省掉这一步直接下结论,否则审稿人大概率会质疑你的细胞身份判定,而这种质疑在单细胞肿瘤研究中几乎是致命的。
5.3 ECM基因的“广谱性”带来的注释陷阱
细胞外基质基因在多种正常细胞和免疫细胞中都有表达,尤其是COL家族基因。如果你只看到某个簇高表达COL3A1、COL1A2、LUM,就简单粗暴地定为“纤维化相关的肌成纤维细胞”,很可能会漏掉真正的生物学目标。因为机制上讲,基质重塑正是通过“让不同来源的细胞表达相似基因”来实现的。这也是为什么我们强烈建议对ECM高表达簇进行逐细胞身份的遗传学确认。
另外一个容易掉进去的坑是,使用整合素受体作为亚群标记时需要额外谨慎。ITGAV和ITGB1不仅存在于肿瘤细胞与ECM互作场景中,在T细胞激活、巨噬细胞吞噬、血小板功能中也广泛扮演关键角色。如果把它们作为唯一亚群特征,你会把大量免疫细胞误判为基质响应细胞。必须使用多基因组合,而不是单基因定身份。
5.4 空间转录组和组织切片之间的“对位困难”
做空间转录组时,我们遇到的最常见问题是病理区域和Visium捕获点之间无法精确对齐。尤其癌栓组织经过手术分离后,容易产生边缘折叠和空隙区域,这会让组织形态学鉴定变得困难。
一种实用的做法是,在Visium切片选取前,先请经验丰富的病理医生对相邻HE切片进行区域标注,把“癌栓核心”“肿瘤边缘侵袭区”“纤维分隔带”“坏死区”等区域以数字化方式标注出来,再与Visium的spot聚类结果关联。这种先病理后转录组的工作流程,可以大幅减少后期“空间注释”中的主观臆测。
同时,我们强烈建议在空间转录组建库完成后立即保留一张HE染色的组织片备份,因为探针覆盖的spot坐标与HE图像坐标存在细微偏移,需要手动校准。如果这一步没做扎实,后面所有“某区域高表达某基因”的结论都可能缺乏可视化证据的支持。
5.5 常用工具参数速查表
这里我把本课题中用到的核心分析工具和它们在我们这批数据中最适用的参数整理成一张速查表,供后来者参考。
| 目的 | 工具 | 关键参数与说明 |
|---|---|---|
| 单细胞比对定量 | Cell Ranger | 标准参数;参考基因组使用GRCh38,基因注释版本建议与后续分析保持一致 |
| 质控过滤 | Seurat | 线粒体占比小于20%,基因数在500到6000之间,避免双细胞与过度空载 |
| 去批次整合 | Harmony | theta=1,lambda=1;若批次结构复杂,适度调至theta=2 |
| 降维与聚类 | Seurat + UMAP | RunUMAP的n.neighbors设为30,避免过度局部化;FindClusters分辨率0.6到1.0取决于你需要分辨的亚群数量 |
| 拷贝数变异推断 | inferCNV | 以基质细胞和免疫细胞为参考;cutoff默认0.1,并使用Smoother宽窗口以降低假阳性 |
| 通路评分 | GSVA/ssGSEA | 基因集建议用MSigDB中Hallmark加自己整理的ECM集合,避免只依赖单一数据库 |
| 细胞通讯推断 | CellChat | 默认参数即可;重点看配体-受体对在各组间的丰度变化,而不是总量 |
这个表是我根据多次实际项目经验浓缩出来的,未必在所有数据集中都完美,但针对“肿瘤微环境+肿瘤细胞亚群”这个分析场景,应该能帮大家少走很多弯路。
写在最后
做这个课题的过程里,我最大的体会其实是:单细胞测序给了我们一个非常高倍率的显微镜,但它也特别容易让人迷失在“看谁都很特殊”的细节里。肿瘤血栓的ECM重塑故事之所以能讲下来,靠的并不是某个基因特别惊艳,而是我们把每个步骤都绑到了一个临床问题上——为什么癌栓患者更容易耐药。当你始终带着这个问题去看数据,很多随机散落的亮点会自动连成线。
如果你也在做类似的肿瘤微环境研究,我建议你从一开始就想清楚三件事:你用来定义“亚群”的特征是否具备可重复性,你的假设是否能在空间上得到验证,以及你找到的靶点是否具备基本的成药可能性。这三点想清楚了,项目大概率不会跑偏。
另外,还有一个可以继续扩展的方向,就是癌栓和原位癌之间的配对数据分析,如果加上动态追踪或药物暴露前后的变化,可能会更有临床价值。我们把这一篇的收尾放在了“治疗脆弱性”的提出,但完整的药物传递动力学、体内模型的验证、还有和临床队列预后数据的衔接,都还有大量值得深挖的地方。希望大家能从我们踩过的坑里找到自己需要的部分,少走一点弯路。