基因合成技术深度解析:全面解读基因合成的技术原理、密码子优化策略与产业应用全景

信息来源:金开瑞 作者:genecreate_cn 发布时间:2026-09-02 15:41:14

一、基因合成技术概述与发展历程

    基因合成(Gene Synthesis)是指通过化学方法人工合成DNA分子并组装成完整基因序列的技术。与传统的分子克隆技术依赖天然模板进行PCR扩增不同,基因合成不需要模板,可以根据研究者提供的序列信息,从头合成任意的DNA序列。这种"从无到有"的合成能力使得基因合成成为合成生物学和现代生物技术的核心使能技术之一,为生命科学研究、医药研发、工业生物技术等领域提供了强大的工具支撑。

基因合成技术原理与流程全景图

图1:基因合成技术原理与流程全景图。展示从寡核苷酸化学合成、PCR组装扩增到全长双链基因生成的完整技术路线。

 

1.基因合成的发展历程

    基因合成技术的发展可以追溯到上世纪60年代。1967年,Gobind Khorana等人首次提出了基因化学合成的构想,并于1970年成功合成了第一个人工基因——酵母丙氨酸tRNA基因,这项开创性的工作为Khorana赢得了1968年的诺贝尔生理学或医学奖。

    然而,早期的基因合成技术效率极低,合成一个短基因就需要耗费数年时间和大量人力。直到80年代固相亚磷酰胺合成法的发明和自动化DNA合成仪的出现,寡核苷酸的合成效率才得到质的提升,为基因合成奠定了技术基础。

    90年代以后,随着PCR技术的成熟和各种DNA组装方法的发展,基因合成进入了快速发展期。基于聚合酶循环组装(PCA)的方法使得从寡核苷酸池中组装全长基因成为可能。进入21世纪后,基因合成技术不断迭代升级,合成通量大幅提升,成本持续下降。

    2010年,Craig Venter团队成功合成了第一个完整的细菌基因组(蕈状支原体,约1.08 Mb),并将其移植到另一个细胞中,创造了世界上第一个"人造生命"——Synthia。这一里程碑事件标志着基因合成技术已经从单基因水平跃升到基因组水平,开启了合成生物学的新纪元。

    近年来,随着微阵列芯片合成技术的发展,寡核苷酸的合成成本大幅下降,基因合成的通量进一步提高。与此同时,CRISPR基因编辑技术的兴起也与基因合成形成互补,共同推动生物技术产业的快速发展。

2.基因合成与传统克隆的比较

    与传统的PCR克隆方法相比,基因合成具有显著的优势:

    (1)无需模板:基因合成不依赖天然存在的DNA模板,只要有序列信息就可以合成任何基因。这对于难以获取模板(如稀有物种、已灭绝生物、密码子差异大的物种)或需要大量序列改造的基因尤为重要。

    (2)序列完全可控:合成基因的每一个碱基都可以精确控制,可以方便地进行密码子优化、引入或消除酶切位点、改变GC含量、删除重复序列等操作,而不需要进行繁琐的定点突变。

    (3)效率高、周期短:对于长度适中的基因(如1-3 kb),专业的基因合成服务通常可以在1-2周内交付,比传统的从cDNA文库中克隆要快得多,省去了RNA提取、反转录、PCR扩增、测序验证等多个步骤。

    (4)准确性高:商业化的基因合成服务通常有严格的质量控制流程,交付的基因经过测序验证,确保序列100%正确。相比之下,高保真PCR扩增也可能引入突变,需要挑选多个克隆进行测序验证。

    (5)可合成复杂序列:对于高GC含量、含大量重复序列、二级结构复杂的基因,传统PCR扩增往往非常困难甚至无法实现,而基因合成技术可以通过优化合成策略来完成这些复杂序列的构建。

    当然,基因合成也有一定的局限性,主要是成本相对较高。随着技术的进步,基因合成的成本在持续下降,但对于大批量、超长线的基因合成,成本仍然是一个重要考量因素。此外,极长的重复序列、极端GC含量的序列仍然是基因合成的技术难点。

3.基因合成的技术路线概述

    现代基因合成技术通常包括以下几个核心步骤:

    第一步:序列设计与优化。根据研究目的和表达系统的需求,对目标基因序列进行密码子优化、GC含量调整、限制性酶切位点设计、mRNA二级结构优化等,确保合成的基因在目标宿主中能够高效、正确地表达。

    第二步:寡核苷酸合成。将全长基因序列拆分为多条较短的单链寡核苷酸(通常长度为50-100 nt),这些寡核苷酸之间有部分重叠区域,以便后续组装。利用固相亚磷酰胺化学法在DNA合成仪上合成这些寡核苷酸。

    第三步:基因组装。将合成的寡核苷酸通过各种组装方法拼接成全长的双链DNA基因。常用的组装方法包括聚合酶循环组装(PCA)、连接酶链式反应(LCR)、Gibson组装、Golden Gate组装等。

    第四步:克隆与验证。将组装好的全长基因克隆到合适的载体上,转化到大肠杆菌中,挑取单克隆进行PCR鉴定和DNA测序验证,筛选出序列完全正确的克隆。

    第五步:质量控制与交付。对最终的质粒进行多种质量检测,包括酶切鉴定、测序验证、内毒素检测等,确保产品质量符合要求。然后以质粒DNA或甘油菌的形式交付给客户。

    以上是基因合成的基本技术路线,不同的公司和服务机构可能在具体方法上有所差异,但其核心原理是一致的。以下各节将对每个技术环节进行详细介绍。

二、寡核苷酸化学合成原理与技术

    寡核苷酸(Oligonucleotide)是指较短的单链DNA或RNA分子,通常长度在10到200个核苷酸之间。寡核苷酸是基因合成的基本构建单元,其合成质量直接影响最终基因合成的成功率和准确性。目前,固相亚磷酰胺合成法是寡核苷酸化学合成的主流技术。

1.固相亚磷酰胺合成法原理

    固相亚磷酰胺合成法(Solid-phase Phosphoramidite Synthesis)由Marvin Caruthers等人于20世纪80年代初发明,是迄今为止最成熟、应用最广泛的寡核苷酸合成方法。该方法的基本原理是在固相载体(通常是可控孔径玻璃珠,即CPG)上,按照预定的序列,从3'端向5'端逐个添加核苷酸单体,逐步延长寡核苷酸链。

    每个核苷酸的添加循环包括四个化学反应步骤:

    (1)脱保护(Detritylation):固相载体上连接的核苷酸(或正在生长的寡核苷酸链)的5'端羟基被二甲氧基三苯甲基(DMT)保护。第一步反应用酸(通常是三氯乙酸TCA或二氯乙酸DCA)处理,去除DMT保护基,暴露出5'端的游离羟基。反应后用乙腈洗涤,去除废液和残余试剂。

    (2)偶联(Coupling):加入新的亚磷酰胺单体和活化剂(通常是四唑或其衍生物)。活化剂使亚磷酰胺单体的3'端磷原子质子化,增强其亲电性,从而与5'端羟基发生亲核取代反应,形成亚磷酸三酯键,将新的核苷酸添加到生长链上。偶联效率通常可达98%-99.5%以上。

    (3)加帽(Capping):由于偶联反应不是100%有效,总有一小部分(约0.5%-2%)的链未能成功添加新核苷酸,这些失败的链如果继续参与后续反应,会产生大量缺失突变的杂质。加帽步骤就是用乙酸酐等试剂将这些未反应的5'羟基封闭起来,使其不再参与后续的延伸反应,从而减少缺陷寡核苷酸的累积。加帽通常有两个试剂(Cap A和Cap B),混合后原位生成活性乙酰化试剂。

    (4)氧化(Oxidation):偶联后形成的亚磷酸三酯键不稳定,容易被酸或碱水解。氧化步骤用碘/水溶液处理,将亚磷酸三酯氧化为稳定的磷酸三酯键,即天然DNA中的磷酸二酯键的前体。氧化反应完成后,一个合成循环就结束了,可以进入下一个循环,添加下一个核苷酸。

    如此反复循环,每次循环添加一个核苷酸,直到整条寡核苷酸序列合成完毕。合成完成后,需要将寡核苷酸从固相载体上切割下来,并脱除所有保护基(包括碱基上的保护基和磷酸上的保护基)。这一步通常用浓氨水在高温下处理若干小时来完成。最后,还可以通过高效液相色谱(HPLC)或聚丙烯酰胺凝胶电泳(PAGE)对寡核苷酸进行纯化,去除失败序列和杂质,获得高纯度的产物。

2.寡核苷酸合成的规模与质量

    寡核苷酸合成的规模通常以合成的摩尔数来表示,常见的规模包括nmol级(如10 nmol、50 nmol、200 nmol、1 μmol等)。合成规模越大,得到的产物量越多,但成本也相应越高。用于基因组装的寡核苷酸通常不需要很大的合成规模,几十纳摩尔就足够了。

    寡核苷酸的合成质量主要受以下因素影响:

    偶联效率:每一步的偶联效率直接决定了全长产物的最终产率。假设每步偶联效率为99%,那么合成一条100 nt的寡核苷酸,全长产物的比例就是0.99^99 ≈ 37%;如果偶联效率为98%,全长产物比例就只有0.98^99 ≈ 13%。因此,偶联效率的微小差异对长链寡核苷酸的产率影响巨大。高质量的合成仪和优质的试剂可以获得99%以上的偶联效率。

    合成仪性能:DNA合成仪的精度和稳定性对合成质量至关重要。试剂输送的准确性、反应体系的密封性、溶剂和试剂的质量等都会影响合成效果。

    纯化方式:粗合成的寡核苷酸中含有大量的失败序列和杂质,需要纯化后才能用于基因合成。常用的纯化方式包括脱盐纯化、OPC纯化、HPLC纯化、PAGE纯化等,纯化效果依次递增,成本也随之增加。用于基因合成的寡核苷酸通常需要至少HPLC级别的纯化。

3.微阵列芯片合成技术

    传统的柱式合成仪一次可以合成96、192或384条寡核苷酸,但对于需要成千上万条寡核苷酸的高通量基因合成来说,这种方法成本仍然较高。近年来发展起来的微阵列芯片合成技术(Microarray-based Oligo Synthesis)极大地提高了寡核苷酸的合成通量,降低了合成成本。

    微阵列芯片合成的原理类似于DNA芯片,在一块小小的硅片或玻璃片上,可以同时合成数万甚至数十万条不同序列的寡核苷酸。合成采用光控化学或喷墨法进行,通过光刻掩模或微喷装置控制每个位置的核苷酸添加,实现高通量的并行合成。

    微阵列合成的寡核苷酸产量很低(通常每条只有飞摩尔级),但对于基因组装来说已经足够,因为后续可以通过PCR进行扩增。芯片合成的最大优势是单条寡核苷酸的成本极低,特别适合需要大量不同序列的高通量基因合成和文库构建。

    当然,芯片合成也有其局限性,主要是合成的错误率相对较高,寡核苷酸的长度也比柱式合成短一些。因此,基于芯片的基因合成通常需要结合纠错步骤,如使用错配特异性内切酶(如CEL酶)来切除含有错配的DNA,从而提高最终基因的正确率。

三、基因组装方法与技术路线

    基因组装(Gene Assembly)是将多条化学合成的短寡核苷酸拼接成一条全长双链DNA的过程。经过四十多年的发展,已经发展出了多种基因组装方法,各有其特点和适用范围。本节介绍几种主流的基因组装方法及其原理。

1.聚合酶循环组装法(PCA)

    聚合酶循环组装法(Polymerase Cycling Assembly, PCA),也称为聚合酶链式组装法,是目前最常用的基因组装方法之一。PCA的基本原理类似于PCR,利用寡核苷酸之间的重叠互补区域,通过多轮的变性-退火-延伸循环,逐步将短寡核苷酸拼接成长的DNA片段。

    PCA的具体过程是:将所有组成全长基因的寡核苷酸(正链和反义链)等摩尔混合,加入DNA聚合酶和dNTPs,进行PCR循环。在每个循环中,寡核苷酸通过重叠区域互补配对,在聚合酶的作用下沿3'端延伸。随着循环的进行,短片段逐渐拼接成长片段,最终形成全长的双链DNA。组装完成后,再用两端的引物进行常规PCR扩增,富集全长产物。

    PCA方法的优点是操作简单,不需要连接酶,只需要DNA聚合酶即可完成,实验周期短。对于1-3 kb以内的基因,PCA通常可以获得较好的组装效果。

    PCA的关键在于寡核苷酸的设计。寡核苷酸的长度通常为50-80 nt,重叠区域的长度通常为15-25 nt,重叠区域的Tm值应尽可能一致,以保证在同一个退火温度下所有的重叠对都能有效配对。对于GC含量高或二级结构复杂的序列,可能需要调整寡核苷酸的长度和重叠区域的位置,以避免组装失败。

2.连接酶链式反应法(LCR)

    连接酶链式反应法(Ligase Chain Reaction, LCR)是另一种经典的基因组装方法,它利用DNA连接酶将首尾相邻的寡核苷酸连接起来。与PCA不同,LCR中的寡核苷酸是连续排列的,相邻寡核苷酸之间有一个切口(nick),通过连接酶将切口封闭,形成完整的DNA链。

    LCR的具体过程是:将正链和反链的寡核苷酸与模板链(或彼此互为模板)杂交,形成带切口的双链DNA,然后加入耐热DNA连接酶,通过变温循环使连接反应循环进行,实现信号放大。

    LCR方法的优点是准确性较高,因为连接酶对错配的底物连接效率很低,能够在一定程度上筛选正确的序列。缺点是需要使用连接酶,成本相对较高,且对于长基因的组装效率不如PCA。因此,LCR方法现在更多地用于单核苷酸多态性(SNP)检测等领域,在基因合成中已逐渐被PCA和其他组装方法取代。

3.Gibson组装法

    Gibson组装法(Gibson Assembly)由Daniel Gibson等人于2009年发明,是一种高效的无缝DNA组装技术。该方法可以在一个反应体系中同时组装多个DNA片段,片段之间不需要限制性酶切位点,实现无缝拼接。

    Gibson组装的原理基于三种酶的协同作用:

    (1)T5外切酶(T5 Exonuclease):从DNA片段的5'端向3'端外切,产生3'单链突出端。由于相邻片段的末端是同源的(有重叠序列),这些3'突出端可以互补配对。

    (2)Phusion DNA聚合酶:填补互补配对后留下的单链缺口(gap)。

    (3)Taq DNA连接酶(Taq DNA Ligase):封闭DNA链上的切口(nick),形成完整的双链DNA分子。

    这三种酶在同一个反应体系中,在50℃条件下共同作用,通常30-60分钟即可完成多个片段的组装。Gibson组装的片段数可多达十几个,组装效率高,操作简便。

    在基因合成中,Gibson组装常用于将多个寡核苷酸组装得到的中等长度片段进一步拼接成更长的基因或基因组片段。它也广泛应用于常规的分子克隆中,替代传统的酶切-连接方法。

4.Golden Gate组装法

    Golden Gate组装法(Golden Gate Assembly)是基于Type IIS限制性内切酶的一种组装方法。Type IIS内切酶(如BsaI、BsmBI、BbsI等)的识别位点与切割位点是分开的,切割发生在识别位点下游的特定位置,产生4个碱基的粘性突出端。

    通过精心设计,使相邻片段之间的粘性突出端互补,同时在组装完成后识别位点被消除(不在最终产物中),就可以实现多片段的定向、无缝组装。Golden Gate组装通常将所有待组装的片段、限制性内切酶和连接酶放在同一个反应体系中,通过变温循环(酶切在37℃,连接在16℃)进行,酶切和连接反应同时进行。由于正确的连接产物不再含有限制酶识别位点,不会被再次切割,因此反应可以向产物方向积累。

    Golden Gate组装的优点是效率高、特异性好,可以同时组装多个片段(多达十几个甚至更多),且组装后的序列完全可设计。该方法特别适合构建标准化的生物元件(如BioBrick)和代谢通路,在合成生物学领域应用广泛。

5.基因组装的策略选择

    在实际的基因合成服务中,通常不会只使用单一的组装方法,而是根据基因的长度、复杂度和成本要求,采用分级组装的策略。

    例如,合成一个10 kb的长基因,可以采用"寡核苷酸→1 kb片段→10 kb全长"的两步组装策略:第一步用PCA方法将寡核苷酸组装成约1 kb的片段,第二步用Gibson或Golden Gate方法将这些1 kb片段拼接成10 kb的全长基因。每一步都进行测序验证,确保中间产物的正确性,最终获得序列完全正确的全长基因。

    对于更短的基因(如1-2 kb),通常一步PCA组装即可完成,然后直接克隆到载体上进行测序验证。对于中等长度的基因(3-5 kb),可以采用两步组装或一步长片段PCA。对于超长基因(>10 kb),则需要更多的组装步骤,技术难度和成本也相应增加。

四、密码子优化技术原理与算法

    密码子优化(Codon Optimization)是基因合成服务中最重要的增值服务之一,也是基因合成相比传统克隆的核心优势所在。由于遗传密码的简并性,大多数氨基酸都有多个同义密码子。不同的生物(甚至同一生物的不同组织)对密码子的使用偏好存在显著差异,这种密码子偏好性是影响异源基因表达水平的关键因素之一。通过密码子优化,将基因的密码子替换为表达宿主偏好的密码子,可以显著提高蛋白质的表达量,有时甚至可以达到数量级的提升。

密码子优化技术原理示意图

图2:密码子优化技术原理示意图。展示密码子偏好性替换、GC含量调整、mRNA二级结构优化三大核心模块,以及优化前后蛋白质表达量的对比。

 

1.密码子偏好性及其生物学基础

    密码子偏好性(Codon Bias)是指不同物种或同一物种的不同基因之间,同义密码子的使用频率存在显著差异的现象。例如,在人类基因组中,丙氨酸的密码子GCC使用频率最高(约40%),而GCG使用频率最低(约10%);而在大肠杆菌中,GCG是最常用的丙氨酸密码子(约33%)。

    密码子偏好性产生的生物学机制目前还没有完全阐明,但普遍认为与以下因素有关:

    (1)tRNA丰度:细胞中各种tRNA的丰度不同,对应于高丰度tRNA的密码子翻译速度更快、效率更高。高表达的基因通常倾向于使用对应高丰度tRNA的密码子,这就是"选择-突变-漂变"(selection-mutation-drift)理论的核心观点。

    (2)基因组碱基组成:不同生物的基因组GC含量差异很大,从极低GC的(如某些寄生虫GC含量仅20%左右)到极高GC的(如某些放线菌GC含量超过70%)。基因组的整体碱基组成会在很大程度上影响密码子的使用模式。

    (3)翻译准确性和效率:某些密码子在翻译过程中的错配率更低,或者与核糖体的相互作用更优,因而被高表达基因偏好使用。

    当我们将一个物种的基因在另一个异源宿主中表达时,如果该基因的密码子使用模式与宿主的偏好差异很大,就可能出现表达量极低甚至不表达的情况。这是因为宿主细胞中对应于稀有密码子的tRNA丰度很低,翻译到这些密码子时核糖体会停滞,导致翻译效率低下,甚至可能提前终止翻译或产生错误折叠的蛋白。密码子优化就是通过替换稀有密码子、调整序列组成等手段,使基因的密码子使用模式与宿主相匹配,从而提高表达效率。

2.密码子优化的核心要素

    现代的密码子优化远不只是简单地将每个氨基酸的密码子替换为宿主最偏好的那一个,而是一个多参数综合优化的过程。一个优秀的密码子优化算法通常需要考虑以下多个因素:

    (1)密码子使用频率(Codon Usage Frequency):这是最基本的优化参数,将基因中的稀有密码子替换为宿主偏好的高频密码子。通常参考密码子使用数据库(如Kazusa的Codon Usage Database)中的数据。需要注意的是,并非一定要全部替换为最高频的密码子,有时适度保留一些低频密码子对于调节翻译节奏、促进蛋白正确折叠可能有积极作用。

    (2)GC含量(GC Content):基因的GC含量对基因的表达有多重影响。GC含量过高或过低都可能导致问题。GC含量过高可能使mRNA形成稳定的二级结构,影响翻译起始和延伸;GC含量过低则可能导致mRNA不稳定。此外,GC含量还会影响转录效率、剪接(在真核生物中)等过程。密码子优化时通常会将GC含量调整到40%-60%的适宜范围内。

    (3)mRNA二级结构:mRNA的5'端二级结构对翻译起始效率有重要影响。如果翻译起始位点(AUG附近)形成稳定的茎环结构,会阻碍核糖体与mRNA的结合,从而降低翻译效率。密码子优化算法会评估并优化mRNA的二级结构,特别是翻译起始区域的结构稳定性,确保翻译起始高效进行。

    (4)剪接位点和调控序列:在真核表达系统中,需要避免在编码序列内部产生意外的剪接位点(如5'剪接位点GTAAGT、3'剪接位点CTGCAG等),否则可能导致mRNA的异常剪接。此外,还应避免内部的TATA盒、转录因子结合位点、核糖体内部进入位点(IRES)等可能影响转录和翻译的序列。

    (5)重复序列:长的同向重复序列或回文序列可能导致DNA的不稳定性,也会增加基因合成本身的难度。密码子优化时应尽量消除长的重复序列,同时使序列的碱基分布更加均匀。

    (6)限制性酶切位点:根据后续克隆的需要,可以在优化时消除或引入特定的限制性酶切位点,方便后续的载体构建操作。

3.主流密码子优化工具与算法

    目前市场上有多种密码子优化工具和服务,各有其特点。以下是一些比较知名的优化算法和工具:

    免费在线工具:此外,还有一些免费的在线密码子优化工具,如OptimumGene的免费版、JCat(Java Codon Adaptation Tool)、Optimizer等。这些免费工具功能相对简单,通常只进行基本的密码子替换,优化效果可能不如商业工具。

4.密码子优化的效果与局限

    大量的研究和实践经验表明,密码子优化确实可以显著提高异源基因的表达水平。对于密码子偏好差异较大的物种间的异源表达(如人源基因在大肠杆菌中表达),优化效果尤其显著,表达量提升几倍到几十倍都很常见。

    然而,密码子优化也不是万能的,其效果受到多种因素的制约。首先,密码子偏好只是影响基因表达的众多因素之一,启动子强度、mRNA稳定性、蛋白质折叠效率、分泌效率等因素同样重要。如果这些"瓶颈"不解决,仅靠密码子优化可能无法获得理想的表达效果。

    其次,并非所有基因都适合进行最大化的密码子优化。有些蛋白质的正确折叠需要翻译过程中适当的"停顿",而稀有密码子可能在调节翻译节奏、促进结构域独立折叠方面发挥作用。将所有密码子都替换为高频密码子可能导致翻译速度过快,新生肽链来不及正确折叠,反而形成更多的包涵体。对于这类蛋白,适当保留一些稀有密码子可能更有利于获得有活性的可溶性蛋白。

    因此,在进行密码子优化时,应根据具体的蛋白特性和表达目的进行合理设计,而不是简单地追求"最优"密码子。好的优化算法应该能够提供灵活的参数调节,满足不同研究的个性化需求。

五、基因合成服务流程与质量控制

    随着基因合成技术的成熟和产业化发展,基因合成服务已经成为生物技术服务行业的重要组成部分。专业的基因合成公司提供从序列设计到成品交付的一站式服务,大大节省了科研人员的时间和精力。本节以典型的商业基因合成服务为例,介绍其完整的服务流程和质量控制体系。

基因合成服务完整工作流程

图3:基因合成服务完整工作流程图。从序列设计与密码子优化、寡核苷酸合成、基因组装、克隆验证、质量控制到产品交付的全流程。

 

1.订单受理与序列设计

    基因合成服务的第一步是订单受理和序列设计。客户提供目标蛋白序列或核苷酸序列,以及预期的表达宿主和其他特殊要求(如酶切位点、标签序列等)。公司的技术人员会对序列进行分析和评估,判断其合成难度,并给出相应的报价和周期。

    序列设计是保证后续合成成功和表达效果的关键步骤。设计内容通常包括:

    (1)密码子优化:根据表达宿主选择合适的优化参数;

    (2)酶切位点设计:在基因两端添加合适的克隆位点,同时消除基因内部可能干扰克隆的位点;

    (3)标签序列添加:如His标签、GST标签、Flag标签、HA标签等;

    (4)信号肽/定位序列设计:根据表达定位需求添加或删除信号肽;

    (5)序列复杂度分析:评估GC含量、重复序列、二级结构等因素,对可能影响合成的区域进行必要的调整。

    设计完成后,会将优化后的序列和载体图谱反馈给客户确认,客户确认无误后正式进入合成流程。

2.寡核苷酸合成与基因组装

    确认后的序列会被拆分为多条寡核苷酸,提交到寡核苷酸合成平台进行合成。拆分算法会综合考虑寡核苷酸长度、重叠区Tm值、GC含量分布、二级结构等因素,以确保组装成功率。

    合成得到的寡核苷酸经过纯化后,进入基因组装环节。根据基因的长度和复杂度,采用合适的组装策略。对于短基因(<2 kb),通常采用一步PCA法直接组装;对于较长的基因,则采用分级组装策略,先组装成中间片段,再拼接成全长。

    组装得到的全长DNA片段通过PCR扩增富集,然后进行胶回收或柱纯化,获得足够量的纯DNA用于后续的克隆步骤。

3.克隆与测序验证

    组装好的全长基因通过限制性酶切或同源重组的方法克隆到指定的载体上。载体可以是客户指定的载体,也可以是公司提供的标准载体(如pUC系列、pET系列、pcDNA系列等)。

    连接产物转化到大肠杆菌感受态细胞中,涂布于含有相应抗生素的平板上,37℃过夜培养。第二天从平板上挑取若干个单菌落,进行菌落PCR鉴定,筛选出插入片段大小正确的克隆。

    PCR鉴定为阳性的克隆需要进行DNA测序验证。这是质量控制中最关键的一步,只有通过测序确认序列100%正确的克隆才能进入下一步。对于较长的基因,可能需要进行引物步移测序(primer walking),即每隔500-800 bp设计一个测序引物,逐段测定序列,最后拼接成完整的序列。

    如果测序发现突变,则需要重新挑取克隆进行验证,或者对突变区域进行修复(如通过定点突变或重新组装该片段)。这个过程可能需要多轮重复,直到获得序列完全正确的克隆。

4.质粒制备与质量控制

    获得序列正确的克隆后,进行质粒的扩大培养和提取。质粒提取通常采用试剂盒法(如碱裂解法结合硅胶柱纯化),获得高纯度的质粒DNA。对于需要转染哺乳动物细胞的质粒,还需要进行去内毒素处理,以降低内毒素对细胞的毒性。

    最终的质粒产品需要经过一系列的质量检测,包括:

    (1)测序验证:提供完整的测序峰图和序列比对报告,证明交付的质粒序列100%正确。

    (2)酶切鉴定:用适当的限制性内切酶消化质粒,通过琼脂糖凝胶电泳验证片段大小是否正确。

    (3)浓度与纯度测定:通过紫外分光光度法测定质粒的浓度和纯度(A260/A280比值应在1.8-2.0之间,A260/A230应大于2.0)。

    (4)内毒素检测:对于去内毒素质粒,需要检测内毒素含量(通常要求<0.1 EU/μg),确保适用于细胞转染等敏感应用。

    (5)无菌检测:对于某些特殊应用(如体内实验),可能还需要进行无菌检测。

5.产品交付

    质检合格后,产品以质粒DNA或甘油菌的形式交付给客户。标准的交付内容通常包括:

    (1)冻干形式的质粒DNA(通常为2-5 μg或更多,可按需定制);

    (2)相应的甘油菌穿刺菌液或甘油菌液(可用于长期保存和后续扩增);

    (3)测序报告(含测序峰图和序列比对结果);

    (4)质粒图谱(标注基因插入位置、抗性标记、多克隆位点等信息);

    (5)质检报告(含浓度、纯度、酶切结果等)。

    交付形式可以根据客户需求进行定制。例如,有些客户需要大剂量的质粒(如毫克级),可以提供质粒大提服务;有些客户需要直接用于表达的蛋白,则可以进一步提供蛋白表达纯化服务。

6.交付周期与价格

    基因合成的交付周期和价格主要取决于基因的长度和复杂度。常规的普通基因(1-3 kb,GC含量正常,无复杂结构)通常可以在1-2周内交付。更长的基因或更复杂的基因则需要更长的时间。

    价格方面,近年来基因合成的成本持续下降。目前,普通基因的合成价格已经降至每碱基对几毛钱到一块多人民币的水平,具体价格取决于基因长度、复杂度、订购量等因素。大批量订购通常可以获得更优惠的价格。

六、复杂基因合成的挑战与解决方案

    尽管现代基因合成技术已经相当成熟,但在实际工作中仍然会遇到一些难以合成的"困难"基因。这些基因往往具有特殊的序列特征,如极端GC含量、大量重复序列、复杂二级结构、长串联重复等,给寡核苷酸合成和基因组装带来挑战。本节讨论几类典型的复杂基因及其合成策略。

1.高GC含量基因

    GC含量过高的基因(如GC>70%)是基因合成中最常见的难题之一。高GC序列带来的问题主要包括:

    一是寡核苷酸合成困难。高GC序列往往形成强二级结构,影响合成偶联效率,导致产率低、杂质多。

    二是PCR组装和扩增困难。高GC模板的熔解温度(Tm)很高,常规PCR条件下难以有效变性;同时,单链DNA容易形成稳定的二级结构(如发夹、G-四链体等),阻碍聚合酶的延伸,导致PCR扩增效率低甚至失败。

    针对高GC基因的合成,常用的解决策略包括:

    (1)序列层面的优化:在不改变氨基酸序列的前提下,通过密码子替换降低整体GC含量。例如,将高GC的密码子替换为GC含量较低的同义密码子。但这种调整的空间是有限的,因为有些氨基酸的所有密码子都是高GC的(如脯氨酸的密码子都是CC开头,丙氨酸都是GC开头)。

    (2)优化PCR条件:使用高GC专用的PCR缓冲液和聚合酶;添加DMSO、甘油、甜菜碱等PCR添加剂,帮助降低Tm值和打开二级结构;提高变性温度、延长变性时间,确保模板充分变性;采用两步法PCR(退火和延伸合并为一步)等。

    (3)调整组装策略:对于高GC基因,可以将寡核苷酸设计得更长一些,重叠区域更长一些,以提高组装的特异性和稳定性。也可以将基因分成更小的片段进行组装,逐步拼接。

    (4)引入错配修复:高GC序列的合成错误率通常更高,需要更严格的测序验证和突变修复。可以使用错配切割酶(如Surveyor酶、CEL酶)等进行错误修复,提高正确克隆的比例。

2.低GC含量基因

    低GC含量的基因(如GC<35%)同样可能带来合成困难。低GC序列的问题主要在于Tm值太低,寡核苷酸之间的重叠区结合不稳定,导致组装效率低、特异性差。此外,极低GC的序列中往往含有大量的polyA、polyT等重复序列,增加了合成和组装的难度。

    针对低GC基因的合成策略包括:

    (1)序列优化:通过密码子优化适当提高GC含量,使序列的碱基组成更加均衡。

    (2)调整寡核苷酸设计:增加重叠区域的长度,提高退火温度,确保引物和模板的稳定结合。可以适当延长寡核苷酸的长度,增加特异性。

    (3)优化PCR条件:降低退火温度,使用对低GC模板友好的聚合酶和缓冲体系。

3.重复序列基因

    含有大量重复序列的基因(如串联重复序列、反向重复序列、长同聚物等)是另一类合成难点。重复序列带来的问题包括:

    一是寡核苷酸合成中容易产生滑链(slippage)错误,导致重复数目的增减;二是基因组装时重复序列之间可能发生非特异性的错位配对,导致序列重排和缺失;三是克隆到大肠杆菌中后,重复序列可能发生重组,导致序列不稳定。

    针对重复序列基因的合成策略包括:

    (1)密码子多样化:在不改变氨基酸序列的前提下,通过密码子替换打破长的核苷酸重复序列,降低序列重复性。例如,对于连续的相同氨基酸,可以使用不同的密码子交替排列,避免形成长的DNA重复。

    (2)分段合成与拼接:将长的重复区域分成多个片段,分别合成和验证,然后再拼接成全序列。这样可以降低每一步的组装难度。

    (3)使用特殊的大肠杆菌菌株:某些重组缺陷型的大肠杆菌菌株(如Stbl2、Stbl3、SURE等)可以减少重复序列的体内重组,提高质粒的稳定性。

    (4)优化培养条件:降低培养温度(如30℃)、缩短培养时间可以在一定程度上减少重组的发生。

4.长基因与基因组合成

    随着合成生物学的发展,对超长基因甚至整个基因组的合成需求日益增长。超长DNA的合成面临的主要挑战是组装复杂度高、错误累积多、克隆难度大、周期长、成本高。

    超长DNA合成通常采用分级组装策略,即"寡核苷酸→短片段→中等片段→长片段→全长"的自下而上(bottom-up)的组装路线。每一步都需要进行测序验证,确保序列的正确性,然后才能进入下一步组装。

    对于超过100 kb的超大DNA片段,常规的质粒载体已经无法承载,需要使用酵母人工染色体(YAC)、细菌人工染色体(BAC)等大容量载体进行克隆和扩增。酿酒酵母由于其高效的同源重组系统,常被用作长片段DNA组装的宿主。著名的合成酵母基因组计划(Sc2.0)就是利用酵母的同源重组能力,将多个DNA片段在酵母体内组装成完整的染色体。

    此外,酶切连接法(如BioBrick标准)、Gibson组装、Golden Gate组装等方法也各有其适用的长片段组装场景。实际工作中往往需要结合多种方法,发挥各自的优势。

5.基因合成的纠错技术

    无论采用哪种合成方法,错误都是不可避免的。化学合成的寡核苷酸本身就有一定的错误率(通常每千个碱基约1-3个错误),这些错误会随着组装过程累积。如果不进行纠错,得到正确克隆的概率会随着基因长度的增加而急剧下降。

    为了提高基因合成的正确率,已经发展出了多种纠错技术:

    (1)错配特异性内切酶法:利用能够识别并切割DNA双链中错配碱基的酶(如CEL I内切酶、T7内切酶I、Surveyor酶等),将含有错配的异源双链DNA切开,然后通过电泳或其他方法去除错误序列。该方法可以在组装后对DNA混合物进行整体纠错,显著提高正确序列的比例。

    (2)高通量测序筛选法:利用下一代测序技术(NGS)对组装后的基因文库进行高通量测序,从中筛选出序列完全正确的克隆。这种方法准确度高,但成本也较高,适合于高价值或难以合成的基因。

    (3)定点突变修复:对于只有个别位点突变的克隆,可以通过定点突变技术(如QuikChange法)进行修复,获得正确的序列。

    高质量的基因合成服务通常会结合多种纠错手段,确保交付给客户的产品序列100%正确。对于客户而言,选择有严格质量控制的服务提供商是获得高质量基因合成产品的关键。

七、基因合成技术的应用领域与发展趋势

    基因合成技术作为合成生物学的核心使能技术,其应用已经渗透到生命科学研究和生物技术产业的方方面面。从基础研究到应用开发,从医药健康到工业农业,基因合成技术正在深刻地改变着生物技术的面貌。本节介绍基因合成技术的主要应用领域以及未来的发展趋势。

基因合成技术的多领域应用场景

图4:基因合成技术的多领域应用全景图。展示了基因合成在医药研发、工业酶制剂、农业生物技术、诊断试剂、合成生物学和基础科研六大领域的广泛应用。

 

1.生物医药研发

    生物医药是基因合成技术最大的应用领域之一。在药物研发的各个环节,基因合成都发挥着重要作用。

    重组蛋白药物开发:重组蛋白药物(如胰岛素、干扰素、单克隆抗体等)是现代生物医药的重要组成部分。这些蛋白药物的基因通常需要经过密码子优化和人工合成,才能在表达系统中高效表达。基因合成使得研究者可以快速获得优化后的基因,大大加速了蛋白药物的研发进程。

    基因治疗与细胞治疗:基因治疗和CAR-T细胞治疗是近年来生物医药领域最热门的方向之一。这些治疗方法需要人工设计和合成各种基因元件,如启动子、治疗基因、CAR结构等。基因合成技术为基因治疗载体的构建提供了高效、灵活的工具。

    疫苗研发:疫苗研发同样离不开基因合成技术。无论是DNA疫苗、mRNA疫苗还是重组蛋白疫苗,都需要合成相应的抗原基因。基因合成的快速响应能力在应对突发传染病疫情时尤为重要,可以在获得病毒序列后迅速合成抗原基因,启动疫苗研发。

    抗体发现与优化:抗体药物的研发过程中,抗体基因的人源化、亲和力成熟等步骤都涉及大量的基因合成工作。通过基因合成可以快速构建各种抗体突变体文库,进行筛选和优化,大大提高抗体药物研发的效率。

2.工业酶制剂与生物制造

    工业酶制剂是生物技术产业的重要组成部分,广泛应用于食品加工、洗涤剂、纺织、造纸、生物能源等行业。工业酶的开发需要对酶基因进行大量的改造和优化,包括密码子优化、定点突变、定向进化等,这些工作都离不开基因合成技术的支持。

    通过基因合成,可以快速获得各种改造后的酶基因,在合适的表达系统中进行表达和酶活测定。定向进化中需要构建的大型突变体文库,更是高度依赖高通量基因合成技术。基因合成成本的持续下降,使得构建数万甚至数十万个突变体的超大文库成为可能,极大地推动了酶工程的发展。

    在生物制造领域,合成生物学方法被用来设计和构建微生物细胞工厂,通过代谢工程改造使微生物能够高效生产各种化学品、材料和燃料。构建一个复杂的代谢通路往往需要合成十几个甚至几十个基因,基因合成技术是构建这些人工代谢通路的基础。

3.农业生物技术

    基因合成技术在农业生物技术领域同样有着广泛的应用。转基因作物的培育需要合成各种功能基因,如抗虫基因(Bt基因)、抗除草剂基因、抗病基因、品质改良基因等。通过基因合成,可以对这些基因进行密码子优化,使其在植物中高效表达,提高转基因的效果。

    此外,基因编辑技术(如CRISPR/Cas9)的发展也与基因合成密切相关。gRNA表达载体、Cas9蛋白表达基因、供体DNA模板等都可以通过基因合成获得。基因合成使得研究者可以快速设计和构建各种基因编辑工具,加速了作物遗传改良的进程。

4.诊断试剂与分子检测

    分子诊断是另一个大量使用基因合成产品的领域。PCR诊断试剂盒中的引物、探针、阳性对照模板等都是化学合成的寡核苷酸或基因片段。基因合成的质量直接影响诊断试剂的灵敏度和特异性。

    随着精准医疗的发展,基因检测的需求日益增长,从遗传病检测、肿瘤基因检测到病原微生物检测,各类分子检测技术层出不穷。这些检测技术的开发和生产都需要大量的合成基因和寡核苷酸作为原材料,推动了基因合成产业的发展。

5.基础科学研究

    在基础生命科学研究中,基因合成已经成为常规的实验工具。几乎所有涉及基因操作的分子生物学实验都可能用到基因合成服务,从载体构建、报告基因制备、基因突变体构建到合成生物学研究等。

    特别是在后基因组时代,研究者关注的基因数量越来越多,传统的克隆方法已经难以满足大规模、高通量的研究需求。基因合成服务的普及使得研究者可以将更多的精力放在功能研究上,而不是耗费大量时间在基础的基因克隆工作上。

6.发展趋势与未来展望

    展望未来,基因合成技术将朝着以下几个方向继续发展:

    (1)成本持续下降:随着微阵列合成技术、自动化技术和组装技术的进步,基因合成的成本将继续下降。更低的成本将进一步释放需求,推动基因合成技术在更多领域的应用。

    (2)合成长度不断突破:从寡核苷酸到基因,从基因到基因组,基因合成的长度上限在不断提高。未来,合成完整的细菌基因组、真菌基因组甚至更复杂的基因组将成为可能。

    (3)自动化与高通量:基因合成的全流程自动化程度将不断提高,实现从序列设计到成品交付的全自动化流水线作业,进一步提高通量、降低成本、缩短周期。

    (4)与基因编辑技术融合:基因合成和基因编辑是互补的技术——基因合成长于"写",基因编辑长于"改"。两者的结合将为生物技术提供更强大的工具,无论是基础研究还是应用开发都将从中受益。

    (5)合成生物学的核心支撑:合成生物学被认为是继DNA重组技术、人类基因组计划之后的第三次生物技术革命。基因合成作为合成生物学的核心使能技术,将随着合成生物学的发展而迎来更大的发展机遇。

    总之,基因合成技术经过半个多世纪的发展,已经从实验室里的前沿技术转变为生物技术产业的基础设施。它不仅极大地加速了生命科学研究的进程,也为医药、工业、农业等领域的创新发展提供了强大的动力。随着技术的不断进步和成本的持续下降,基因合成必将在未来的生物技术革命中扮演更加重要的角色,为人类社会的发展做出更大的贡献。




X