qRT-PCR数据分析与内参选择:从Ct值到发表级图表
一、为什么数据分析这么重要?
很多同学做qRT-PCR实验的时候,前面RNA提取、反转录、引物设计、上机扩增都做得很认真,到了数据分析这一步反而草草了事——拿到Ct值,往Excel一丢,减一下就出图了。这样做出来的数据,往往经不起推敲,审稿人一看就能挑出问题。
qRT-PCR数据分析不是简单地算个除法就行了。从原始Ct值到最终的基因表达变化倍数,中间有好几个环节需要严谨地处理:基线校准、阈值设定、扩增效率校正、内参归一化、统计学检验……每一步都有可能出错,每一步都会影响最终结论的可靠性。
按照MIQE指南的要求,发表qRT-PCR数据时需要提供足够的方法学信息,包括扩增效率、线性范围、内参验证等。所以不管你是发论文还是做毕业答辩,把数据分析做规范是基本功。
这篇文章就把qRT-PCR数据分析从头到尾捋一遍,重点讲清楚相对定量和绝对定量的区别、2-ΔΔCt法的计算原理、标准曲线和扩增效率的评价标准,以及最让新手头疼的内参基因选择问题。
二、相对定量 vs 绝对定量:到底用哪个?
qRT-PCR的定量方法分两大类:相对定量和绝对定量。很多人搞不清什么时候用哪个,其实搞清楚了就不难选。
相对定量
相对定量回答的是"目标基因在实验组中比对照组高了多少倍或低了多少倍"这个问题。比如"药物处理后基因A的表达量是对照组的2.5倍"——这就是相对定量的结果。这是最常用的定量方式,绝大多数基因表达研究用的都是相对定量。
相对定量不需要知道模板的绝对拷贝数,只需要比较不同样本之间的表达差异。计算方法主要是2-ΔΔCt法(Livak法)和Pfaffl法,前者假设扩增效率为100%,后者考虑了实际扩增效率。
绝对定量
绝对定量回答的是"样本里到底有多少个拷贝"这个问题。比如"每微升血清里含有5000拷贝的病毒RNA"——这就是绝对定量的结果。绝对定量需要用已知浓度的标准品做标准曲线,然后根据样品的Ct值从标准曲线上反推浓度。
绝对定量主要用于病原体检测(病毒载量、细菌定量)、基因治疗(载体拷贝数检测)、拷贝数变异分析等需要知道精确数量的场景。

图1:qRT-PCR数据分析全流程示意图
怎么选?
90%以上的基因表达研究用相对定量就够了。只有当你需要知道"具体有多少个分子"的时候才需要做绝对定量。如果你只是比较"处理组比对照组高了几倍",那就是相对定量。
有个误区要纠正:很多人觉得绝对定量更"高级"、更"精确"。其实不是的。绝对定量的精度取决于标准曲线的质量,如果标准品稀释不准确,绝对定量的结果也不准。而且绝对定量需要制备标准品(通常是质粒或体外转录的RNA),工作量比相对定量大很多。
三、2-ΔΔCt法:相对定量的黄金标准
说到相对定量,就不得不提2-ΔΔCt法了。这个方法由Livak和Schmittgen在2001年提出,因为简单直观,迅速成为qRT-PCR相对定量最广泛使用的方法。
计算原理
2-ΔΔCt法的核心假设是:PCR扩增效率为100%,即每一轮循环产物翻倍。在这个前提下,Ct值每增加1,意味着模板量减少一半;Ct值每减少1,模板量增加一倍。
计算步骤如下:
第一步:计算ΔCt
ΔCt = Ct(目的基因) - Ct(内参基因)
这一步是"内参归一化"——用内参基因的Ct值校正目的基因的Ct值,消除不同样本间上样量和反转录效率的差异。
第二步:计算ΔΔCt
ΔΔCt = ΔCt(实验组) - ΔCt(对照组)
这一步是用对照组做基准,计算实验组相对于对照组的变化。
第三步:计算表达倍数
Fold Change = 2^(-ΔΔCt)
如果ΔΔCt为负值(实验组Ct小于对照组),说明目的基因上调,结果大于1。如果ΔΔCt为正值,说明目的基因下调,结果小于1。
使用前提
2-ΔΔCt法有两个前提条件:
第一,目的基因和内参基因的扩增效率都必须接近100%(准确说在90%-110%之间)。如果扩增效率偏离100%太多,2-ΔΔCt法的计算结果就不准确了。
第二,目的基因和内参基因的扩增效率要基本一致(差异不超过5%)。如果一个效率95%,另一个效率105%,用2-ΔΔCt法就会有偏差。这种情况下建议用Pfaffl法,它考虑了不同基因的扩增效率差异。
2-ΔΔCt法的局限
2-ΔΔCt法虽然好用,但也不是万能的。它最大的局限就是假设扩增效率为100%。实际操作中,能完全做到100%扩增效率的实验并不多。所以做数据分析前,一定要先用标准曲线验证扩增效率,确认在90%-110%范围内才能放心用2-ΔΔCt法。
另外,2-ΔΔCt法需要一个对照组作为基准。如果对照组选择不当——比如对照组的基因表达本来就有波动——结果也会偏。对照组应该是稳定不变的样本。
四、标准曲线:扩增效率的试金石
标准曲线是验证qRT-PCR方法可靠性的核心工具。不管你做相对定量还是绝对定量,标准曲线都是必须做的。
标准曲线怎么做?
做标准曲线需要先制备标准品。对于基因表达分析,标准品通常用PCR产物纯化后的DNA或质粒。把标准品做5-6个10倍系列稀释(比如1:10、1:100、1:1000、1:10000、1:100000),每个稀释度上3个技术重复。
上机完成后,以模板浓度的对数值为X轴,对应的Ct值为Y轴,做线性回归分析,就得到标准曲线了。标准曲线的方程是:Ct = a + b × log10(浓度)。

图2:标准曲线——模板浓度对数与Ct值的线性关系
如何评价标准曲线的好坏?
一个好的标准曲线要看三个指标:
线性相关系数(R²):反映数据点与拟合直线的吻合程度。R²越接近1,线性关系越好。一般要求R² ≥ 0.99,最好能达到0.999以上。如果R²太低,可能是标准品稀释不准确,或者低浓度点出了问题。
扩增效率(E):理想范围90%-110%。计算公式是E = (10^(-1/斜率) - 1) × 100%。标准曲线的斜率应该在-3.1到-3.6之间(对应效率90%-110%)。斜率绝对值越小(比如-3.0),效率越高;斜率绝对值越大(比如-4.0),效率越低。
线性范围:标准曲线的最高和最低浓度之间应该覆盖你样品的Ct值范围。如果你的样品Ct值在标准曲线范围之外,定量结果就不可靠。
做标准曲线的注意事项
第一,标准品稀释要准确。10倍系列稀释说起来简单,但操作时一定要用新的吸头,每次充分混匀。建议用1.5 mL离心管做大体积稀释,减少小体积操作的误差。
第二,每个稀释度做3个技术重复,取平均Ct值做标准曲线。如果某个重复偏差太大,剔除后重新计算。
第三,标准曲线要覆盖样品的浓度范围。如果样品Ct值为25,标准曲线的Ct值范围应该覆盖20-30左右,确保样品在标准曲线的线性范围内。
第四,标准品需要稳定保存。质粒标准品保存在-20°C,避免反复冻融。PCR产物标准品短期4°C保存,长期-20°C。建议分装保存。
五、qPCR扩增效率:90%-110%才算合格
扩增效率是qRT-PCR数据分析中最核心的指标之一。它反映了PCR反应中每一轮循环的产物增长倍数。理想状态下,每一轮循环产物翻倍,效率为100%。但实际操作中很难做到恰好100%,所以通常要求在90%-110%之间。
扩增效率怎么算?
扩增效率从标准曲线的斜率计算得到:
E = (10^(-1/slope) - 1) × 100%
比如标准曲线斜率为-3.32,那么E = (10^(1/3.32) - 1) × 100% = (10^0.3012 - 1) × 100% = (2.0 - 1) × 100% = 100%。斜率为-3.32时效率恰好100%。
斜率为-3.1时,E = (10^(1/3.1) - 1) × 100% ≈ 110%。斜率为-3.6时,E ≈ 90%。所以斜率在-3.1到-3.6之间对应效率90%-110%。
扩增效率异常的原因
效率偏低(低于90%):可能原因包括引物设计不好(Tm值偏低、容易形成二级结构)、Mg²⁺浓度不合适、模板有PCR抑制物(如SDS、苯酚残留)、dNTP或引物浓度不足。解决方法:重新设计引物、优化反应条件、重新提取RNA减少杂质残留。
效率偏高(高于110%):可能原因包括非特异性扩增(引物二聚体也被计入了产物量)、标准品稀释不准确(某些稀释度浓度偏差大)、低浓度点Ct值不稳定。解决方法:检查熔解曲线确认没有非特异性扩增、重新做标准品稀释、剔除异常数据点。
为什么扩增效率这么重要?
扩增效率直接影响定量结果的准确性。2-ΔΔCt法假设效率为100%,如果实际效率只有85%,计算出的表达倍数就会有偏差。效率偏差越大,结果偏差越大。
举个例子:假设实验组目的基因Ct=22,对照组Ct=24,内参Ct都是20。用2-ΔΔCt法计算,ΔΔCt = (22-20)-(24-20) = -2,Fold change = 2^2 = 4倍。但如果目的基因实际扩增效率只有85%(每轮增长1.85倍),实际差异应该是1.85² ≈ 3.4倍,不是4倍。差异越大,偏差越明显。
所以,做qRT-PCR数据分析前,一定要先用标准曲线验证扩增效率。如果效率不在90%-110%范围内,要么优化实验条件,要么换用考虑实际效率的计算方法(如Pfaffl法)。
六、内参基因选择:最容易踩坑的一步
内参基因(也叫参考基因、看家基因)是qRT-PCR相对定量分析的基础。它的作用是校正不同样本之间的上样量差异、反转录效率差异和PCR效率差异。理想情况下,内参基因在所有实验条件下表达量恒定不变。但现实中没有绝对恒定的基因——不同的实验条件下,所谓的"看家基因"也会波动。

图3:常用内参基因的适用场景与选择流程
常用内参基因及其适用场景
GAPDH(甘油醛-3-磷酸脱氢酶):最常用的内参基因。适用于常规细胞实验、给药实验、凋亡实验、免疫实验。但不适用于缺氧实验、糖脂代谢实验、肿瘤代谢研究、饥饿造模——因为这些条件下GAPDH本身的表达会变化。
β-actin(β-肌动蛋白):第二常用的内参。适用于动物组织样本、代谢干预实验、常规qPCR和Western Blot。但不适用于细胞迁移侵袭实验、EMT(上皮-间充质转化)实验、脂肪组织和肌肉组织——因为actin在这些条件下会变化。
18S rRNA:适用于低丰度目的基因的检测(因为18S丰度很高,可以作为稳定基准)。但不适合常规mRNA定量,因为18S是rRNA,和mRNA的反转录效率可能不同。
其他内参:UBC(泛素结合蛋白)在不同实验条件下稳定性较好;eEF-1a适用于水稻等植物研究;HPRT1适用于某些特定细胞类型;TBP和PPIA在某些实验体系中比GAPDH和β-actin更稳定。
如何验证内参基因的稳定性
不能想当然地选个GAPDH就完事了——你需要验证在你自己的实验条件下,这个内参基因到底稳不稳定。常用的验证方法有:
GeNorm:通过计算基因表达稳定值M,对候选内参基因进行排序。M值越低越稳定。一般建议选M值<0.5的基因作为内参。GeNorm还建议使用至少2个内参基因的几何平均值来归一化,提高可靠性。
NormFinder:不仅能评估单个基因的稳定性,还能考虑组间差异,推荐在不同实验组之间表达差异最小的基因作为内参。
BestKeeper:基于Ct值的标准差和变异系数来评估稳定性,标准差越小越稳定。
这几个工具大多有免费的R包或在线版本,用起来不复杂。建议至少选3-5个候选内参基因,用这些工具评估一下,选最稳定的用。
内参选择的常见误区
误区一:盲目套用文献中的内参。别人用GAPDH稳定的实验条件,不一定在你的体系里也稳定。不同细胞系、不同处理条件、不同组织来源,内参稳定性都可能不同。一定要自己验证。
误区二:只用一个内参。MIQE指南建议使用至少2-3个验证过的内参基因。单一内参有可能在某些条件下波动,用多个内参的平均值归一化更可靠。
误区三:内参Ct值波动大但视而不见。如果你发现不同样本组之间内参Ct值差了1个循环以上,说明内参不稳定了,不能直接用。需要换内参或者解释原因。
七、数据处理全流程实操
前面讲了这么多原理,现在来走一遍完整的数据处理流程,让大家有个直观的感受。
第一步:检查原始数据质量
上机完成后,导出原始Ct值。首先检查以下几项:
1. 看扩增曲线——每条曲线应该是标准的S形,没有异常形状(如锯齿、中断、跳跃)。
2. 看熔解曲线——应该只有一个主峰,NTC孔没有峰或只有很弱的引物二聚体峰。
3. 看NTC——Ct值应该大于35或者不出信号。如果NTC出峰了,数据全部作废,重新做。
4. 看技术重复的变异——同一样品三个技术重复的Ct值标准差应该小于0.5。如果某个重复偏差特别大,剔除后用剩余两个计算。
第二步:取技术重复平均值
每个样品3个技术重复的Ct值取平均值,作为该样品的代表Ct值。如果有个别重复明显异常(比如比其他两个高2个循环以上),剔除后取剩余两个的平均值。
第三步:计算ΔCt
对每个样品,计算目的基因Ct值与内参基因Ct值的差:ΔCt = Ct(目的基因) - Ct(内参基因)。
这一步是内参归一化,消除样本间的上样量差异。
第四步:计算ΔΔCt
选定对照组,计算每个样品的ΔΔCt = ΔCt(样品) - 平均ΔCt(对照组)。
对照组应该选择表达稳定的基准样本,通常是未处理的正常对照组。
第五步:计算表达倍数
Fold Change = 2^(-ΔΔCt)。
对照组的Fold Change约等于1(因为ΔΔCt约等于0)。
如果Fold Change > 1,说明目的基因上调;Fold Change < 1,说明下调。下调的结果通常用1/Fold Change表示,比如0.5写成"下调2倍"。
第六步:统计分析
每个生物学重复有一个Fold Change值,组间比较用t检验(两组)或ANOVA(三组以上)。注意要用生物学重复做统计检验,不能用技术重复。
数据通常以"均值 ± 标准误(SEM)"的形式呈现。作图时常用柱状图或散点图,标注显著性(*p<0.05, **p<0.01, ***p<0.001)。
第七步:数据呈现
发表级别的图表要求清晰、规范。Y轴标注"Relative Expression (Fold Change)",X轴标注组别。图注中注明内参基因、统计方法、样本量和生物学重复数。
如果用GraphPad Prism做图,可以用Column data类型输入Fold Change值,选t检验或ANOVA,然后出图,效率很高。
八、常见数据分析误区与纠正
误区1:不做标准曲线就直接用2-ΔΔCt法
这是最常见的错误。很多人默认扩增效率是100%,直接套2-ΔΔCt公式。但如果扩增效率偏离100%,结果就不准了。正确做法:新引物必须先做标准曲线验证效率,确认在90%-110%范围内才能用2-ΔΔCt法。
误区2:用技术重复做统计检验
技术重复反映的是操作精度,不是生物学变异。用技术重复做统计检验会高估显著性,是不正确的做法。统计检验必须基于生物学重复(不同样本、不同动物、不同批次细胞)。
误区3:内参没有验证稳定性
直接用GAPDH或β-actin做内参,没有验证它在当前实验条件下是否稳定。如果你的处理条件恰好影响了GAPDH表达(比如缺氧、糖代谢改变),整个定量结果都会偏。正确做法:用GeNorm或NormFinder等工具验证内参稳定性。
误区4:不报告扩增效率
按照MIQE指南,论文中应该报告引物的扩增效率和R²值。很多同学不报告这些信息,审稿人可能会要求补充。养成好习惯——每次写方法部分时把扩增效率、R²值、线性范围都写上。
误区5:Fold Change结果不取对数直接做t检验
Fold Change数据通常不是正态分布(上调可能到8倍、16倍,下调最多到0),直接做t检验不符合正态假设。正确做法:对Fold Change取log2转换后再做统计检验。log2转换后上调1倍变成+1,下调1倍变成-1,数据更对称。
误区6:忽略异常值
有时候某个生物学重复的Fold Change明显偏离其他样品(比如其他都是2-3倍,突然有一个是15倍)。不要直接删除,先排查原因——可能是加样错误、RNA降解或其他技术问题。如果有明确的技术原因可以剔除,否则应该保留并如实报告。
误区7:扩增效率验证只做一次
有些人验证了扩增效率后就不管了,后面换了引物批次、换了试剂批次也不重新验证。建议每次更换引物或试剂时重新验证效率。不同批次的引物可能会有微小的效率差异。
实用建议
1. 建立标准操作流程(SOP):把从RNA提取到数据分析的每个步骤都写成SOP,每次实验严格按照SOP操作,减少批次间差异。
2. 使用专业软件辅助分析:除了Excel,可以试试Bio-Rad的CFX Maestro、Thermo的Design & Analysis Software或者开源的qbase+等软件,它们能自动计算扩增效率、做归一化分析和统计分析,减少手动计算的错误。
3. 做好数据管理:每次实验的原始数据、Ct值、计算过程都存档保存,包括日期、引物批号、试剂批号等信息,方便追溯。
4. 定期做方法学验证:每隔一段时间(比如3-6个月)重新验证引物扩增效率、内参稳定性和标准曲线,确保实验体系没有漂移。
5. 生物学重复要够数:一般每组至少3个生物学重复,如果预期差异不大(比如1.5倍变化),建议增加到5-6个,提高统计检验力。
qRT-PCR数据分析不是简单的加减乘除,而是需要严谨的方法学支撑。从扩增效率验证到内参选择,从ΔΔCt计算到统计分析,每一步都要规范操作。把数据分析做扎实了,你的实验结论才站得住脚,论文才经得起审稿人的推敲。希望这篇文章能帮助大家把qRT-PCR数据分析做得更规范、更专业!
最新动态
-
09.01
qRT-PCR数据分析与内参选择:从Ct值到发表级图表
-
09.01
qRT-PCR实验全流程指南:从原理到实操避坑
-
08.31
蛋白抗体服务全攻略:从抗体制备到药物开发的完整指南
-
08.31
表面等离子共振技术全解:从原理到药物研发应用的深度指南
-
08.31
RNA合成技术全解析:从体外转录到化学合成的完整指南
-
08.31
重组蛋白实验全流程解析:从表达系统选择到纯化技术
-
08.28
qRT-PCR完全指南:从引物设计到定量分析的全流程深度解析
-
08.28
ELISA试剂盒定制完全指南:从抗体配对到方法学验证的全流程深度解析
-
08.27
酵母双杂交技术详解—从原理到操作的完整研究方案
-
08.27
外泌体研究方案全面解析—从提取鉴定到功能应用的全流程指南


