基因合成:说清报价、难度、组装与返工的真实边界​

信息来源:金开瑞 作者:genecreate_cn 发布时间:2026-10-10 14:29:20

同一个基因,两家公司的报价能差三倍,交期能差两周,背后是分段方式、复杂度判定与质检深度的差别。本文按 9 组高频搜索关键词展开,讲的是怎么报价、怎么判定难度、怎么不被返工,不重复原理。

先给一条判断原则:基因合成的价格差异,九成来自"难度判定",而不是来自"每 bp 单价"。

单价表只对标准序列有意义。一旦序列里出现高 GC 区、重复片段、发夹结构或单体超过 3 kb,报价逻辑立刻从"按长度计价"切换到"按可行性与工艺成本计价"。所以比价时真正要比的,是两件事:对方如何判定你的序列难度,以及报价里是否已经包含返工与重做的责任边界。

基因合成多少钱:把报价拆成五项再比

一份完整的报价通常由五个部分构成,只看总价容易踩坑。

表1:基因合成报价的五项拆解与常见区间特征
报价项 计价方式 影响幅度 谈判要点
基础合成费 按长度分段计价,短片段按条计价 占总价 50%–70% 确认分段边界是否含两端接头
复杂度加价 按重复长度、GC 极值、二级结构判定 可上浮 30%–100% 要求给出判定标准,而非"看情况"
亚克隆费 克隆到客户指定载体、指定位点 常见按次计费 确认是否含读码框与方向确认
附加服务 密码子优化、突变引入、标签添加 多数免费,高级设计另计 把"免费优化"的范围写进合同
加急费 压缩交期至标准周期的 60%–70% 上浮 30%–50% 加急前先确认酶切与测序是否同步加急

一个广被忽略的事实:短序列的单条计价往往比按 bp 计价更贵。400 bp 以下的片段常按"条"报价,折算到每 bp 反而是长基因的两三倍。因此做小片段时,把多个片段合并到一条订单里,或者延长两端同源臂并入一个载体,往往比分别下单更省。

比价必问

①交付质粒的量与形式(冻干粉还是溶液、低拷贝质粒是否单独说明);②返工条款——若测序发现合成错误,重做是否收费、周期是否顺延;③紧急中止时已产生费用的结算方式。这三条写清楚,比单价便宜 5% 更有价值。

密码子优化:不要只盯 CAI

把密码子优化等同于"把稀有密码子换成高频密码子",是导致表达失败的高频原因。真正影响成败的,是优化过程不能破坏什么。

  • 隐性剪接位点:真核表达时,优化后新产生的剪接供体/受体序列可能导致 mRNA 被截短。必须在优化后重新扫描剪接位点,而不只是检查 GC。
  • 顺式调控元件:无意中引入的 poly(A) 信号、内部终止样结构、重复基序,都会影响转录与翻译效率。长度超过 6 个连续同碱基的结构建议主动打断。
  • 限制性酶切位点:既要避免引入后续克隆要用的位点,也不能顺手删掉研究者有意保留的位点。优化前把"保留位点清单"和"禁用位点清单"同时交给服务方。
  • N 端与 C 端结构:起始密码子周边序列影响翻译起始效率;N 端若带标签,第二密码子的选择会显著影响切除效率。这些位置的密码子不应被自由优化。
  • 结构域边界的同义突变风险:做结构生物学或需要精细调控的项目,优化后应核对 mRNA 二级结构是否改变,尤其是 5′ 端 30–60 nt 区域。

还有一条实践边界:宿主适配不是唯一的优化目标。同一基因要在大肠杆菌筛库、在真核细胞做功能实验时,两端需求并不一致,此时更理性的做法是保留一版"野生型密码子版本"作为对照,而不是反复优化到无法解释表型差异。

困难序列:判定标准要写清楚

所谓"困难",行业内并没有统一阈值,但有几条相对通行的判定线,谈判时可以直接引用。

≥ 70%整体或局部 GC 含量,普遍触发复杂度加价

≥ 10 bp重复序列单体长度,常被列为高难判定项

≥ 8 bp连续同一碱基(poly 结构),影响合成与测序

≥ 3 kb单次组装长度,超过后进入分级组装策略

三条可用的解决方案,按代价从低到高

  1. 沉默改写:在功能允许的位置做同义替换,打断重复与二级结构,不改变氨基酸序列。这是代价最低、成功率最高的一步,优先尝试。
  2. 分段合成 + 体外组装:把困难区切成多段,各自独立合成后拼接。适合重复序列与超长片段。
  3. 功能重设计:当重复序列本身就是功能要求(例如弹性蛋白样结构域、柔性 linker 阵列)时,只能接受加价与更长交期,或改用基因拆分表达、蛋白连接等实验方案绕开。

风险提示

被接受订单后又被取消,是行业内真实存在的失败模式。判定困难序列时,务必在开工前要求书面可行性结论("可合成 / 需加价 / 需改序列 / 不可合成"),并确认报价在开工后不再追加费用。这两条能避免项目周期被单方面消耗掉。

长片段基因合成:先定组装策略,再定测序策略

长度进入 3 kb 以上,实验的核心矛盾从"能不能合成"变成"错误怎么找出来"。错误来源包括寡核苷酸本身的合成错误、PCR 扩增引入的突变、组装接头的错配以及克隆环节的丢失,长度越长,累积概率越高。

表2:不同长度区间的组装与验证组合建议
构建体长度 组装方式 中间验证 全长验证
1–3 kb 单段合成或一次组装 菌落 PCR 确认接入 Sanger 双向
3–6 kb 分 2–3 段组装 各段 Sanger 确认 Sanger 拼接 + 接头区重点复核
6–15 kb 分级组装,先段后全长 逐段测序,合格段才进组装池 NGS 或长读长测序
> 15 kb 多级模块化组装 模块级验证 + 定点复核 长读长测序整读,避免拼接歧义

三条提升一次通过率的做法

  • 模块化设计:把大构件拆成互相独立的模块,每个模块留唯一酶切位点或唯一接头序列。后续改一个元件不必整条重做,这是长期项目最省钱的决定。
  • 降低 PCR 轮数:组装环节尽量使用高保真酶,并把循环数压到最低。若同一模板扩增后用于组装,扩增前务必先测序确认模板正确。
  • 在两端预留验证锚点:设计时把一段唯一序列放在构建体边界,便于后续用一对引物快速验证全长是否完整,而不必每次都上全测序。

还有一个容易被忽视的设计原则:为可制造性而设计。主动减少直接重复与反向重复、避免极端的局部 GC 峰、避免发夹结构与回文序列,往往比事后与服务方沟通加价更有效。序列层面的十分钟调整,可能换来一周交期。

长片段项目里的宿主与载体匹配

构件变长以后,宿主本身也会成为变量。大质粒在常规大肠杆菌宿主中常出现拷贝数偏低、稳定性下降的情况,导致"细菌长得好但抽不出足量质粒",这会被误判为合成失败。处理方式有三条:换用低拷贝兼容的宿主菌株、在培养阶段降低温度并延长培养时间、以及把超大构件拆分为两个互补质粒分装表达。若构件包含对宿主有负担的元件,应在设计阶段就改用具诱导型启动子的表达框架,把"毒性"问题从合成环节转移到可调控的表达环节。

另外,长片段项目建议在合同里明确"分段交付"的可能性:先拿到已测序合格的中间片段,用于并行的功能验证或亚克隆准备,不必等全长完成才开始工作。这一步能把项目的关键路径缩短一到两周。

载体与亚克隆:默认载体只是起点

合成服务默认把基因克隆进通用载体(多见于 pUC57 一类),这只解决"保存"问题,不解决"能不能用"。下单时必须把下游用途说清楚,否则多花一次亚克隆的时间和费用。

需要在下单时明确的五件事

  1. 目标载体与位点:给出明确的载体名称、插入位置与酶切位点组合,并确认这些位点在基因序列内确实不存在。
  2. 读码框与标签:若与 N 端标签(如 His、GST、FLAG)融合,必须核对插入片段与标签之间没有终止密码子、没有移码。这是"测序完全正确但蛋白表达不出来"的第一大原因。
  3. 插入方向:多数服务不默认保证方向,需要定向插入时应在订单中书面声明。
  4. 克隆方式:无缝克隆适合多片段拼接与位点受限的场景,但要求同源臂长度与序列洁净度更高;经典酶切连接更稳妥但受位点限制。两者对序列设计的要求不同,应在设计阶段而非交付阶段决定。
  5. 两端接头:酶切位点旁建议保留必要的保护碱基,否则切割效率低下会表现为"克隆失败",而问题其实出在设计。

省钱做法

如果后续还要做多种载体切换,可以让服务方一次性交付两端带通用接头的线性片段,自己在实验室用无缝克隆接到不同载体上。省下的是多次亚克隆的费用,付出的是几次自行克隆的时间,通常更划算。

交付与质检:对着清单逐项验收

合成订单的交付物不只是"一管质粒"。缺少任何一项,返工成本都会在后续实验中放大。标准验收清单如下。

表3:基因合成交付物验收清单
交付项 验收要点 缺失后果
质粒 冻干粉或溶液形式、总量、低拷贝质粒单独标注 无法满足后续大体积转化需求
甘油菌 含重组质粒,可自行复苏扩增 质粒丢失后需全部重做
测序图谱 电子版原始图谱,含两端覆盖 无法自查序列正确性
序列比对文件 实际序列与设计序列的逐位比对 无法发现单碱基差异
COA 文件 批次质量证明 投稿或合规审查时补不回来

自己动手复核的三个动作

  • 比对而不是只看"测序成功":把交付的序列文件与自己的设计序列做一次本地比对,重点看两端 50 bp 与所有连接位点。
  • 核对载体骨架:确认骨架内的筛选标记、启动子、复制子与预期一致,尤其是使用自己提供的载体时。
  • 留样与备份:收到质粒后立即转化保菌并做一次冻存备份,避免唯一来源被污染后无法恢复。

关于测序深度:常规 Sanger 双向测序足以覆盖单基因;涉及简并位点、混合序列或长片段时,建议要求 NGS 或长读长测序,后者能一次读通整个构建体,避免拼接歧义。对于 10 kb 以上的构件,这一条几乎应当作为硬性要求。

突变体文库与定点突变合成

当需求从"合成一个基因"变成"合成一批变体",评价标准就完全不同了:重点不再是序列正确率,而是库的可用性——位点覆盖是否完整、是否引入了不想要的密码子、各变体的比例是否可控。

设计侧的四条纪律

  • 控制终止密码子:简并密码子设计不当会大量产生提前终止的变体。按阵列化方式逐位点设计(每个位点 19 种氨基酸替换分别定义),可把无效变体比例压到很低。
  • 决定是混合池还是独立管:用于筛选的混合文库追求复杂度,用于后续逐点验证的则更适合独立分装阵列。两种形式的价格与交期差别显著,下单前必须定下来。
  • 明确交付形式:双链片段可直接用于组装,质粒则便于直接转化。选错形式会导致额外的克隆步骤。
  • 预留验证通道:设计时保留一段唯一序列作为分子条形码,配合 NGS 就能定量每个变体在筛选前后的丰度变化,这比逐个克隆测序效率高得多。

实操中最有价值的做法是把文库拆成"独立位点池":每个突变位点单独成池,筛选阳性后可直接判断是哪个位点起作用;如果全部混成一池,阳性变体的归因会变得十分困难,往往需要整片重筛。

序列保密、合规与知识产权

序列本身就是数据资产,把序列交给外部机构前,需要处理三件事。

  1. 保密条款:明确序列不得用于任何与项目无关的用途、不得保留超出必要期限的副本、交付完成后按约定期限销毁中间材料。项目结束后如需继续留存质粒,应通过单独约定处理。
  2. 知识产权归属:合成所得序列与构建体的权利归属应书面确认归委托方,服务方不得基于委托信息申请专利或对外传播。涉及拟申请专利的序列,建议先完成申请再大规模外委,或在合同中明确公开时间节点。
  3. 合规边界:涉及病原体、毒素相关基因或受管控元件时,需先确认所在地区的生物安全与出口管制要求,并在订单中如实申报来源与用途。合规问题一旦出现,整个项目的周期损失远大于合成费用本身。

别忽略这两条

①不要用公开邮箱传递完整序列文件,改用加密渠道或平台内提交;②在预印本、会议摘要或基金申报材料中提前披露序列,会让保密条款的实际保护力度大幅下降。发表的时机与保密协议的有效期要协调安排。

对需要长期复用的序列,还有一条工程化建议:建立自己的序列版本库。每个构建体记录设计序列、实测序列、载体骨架、标签配置与验证日期,并保留测序原始文件。这份记录在未来改元件、换宿主、补实验时能省下大量重复确认工作。

合成"失败"了:先排查客户侧的设计问题

项目中反复出现的所谓"合成失败",多数不是工艺问题,而是设计阶段埋下的隐患。按下面顺序排查,通常能定位到症结。

表4:合成结果异常的排查顺序
现象 优先排查 典型原因
交付序列与设计不符的单碱基差异 设计序列本身的来源 参考序列本身有误,或含简并符号未确认
测序正确但表达无信号 读码框与起始密码子周边 移码、隐藏终止密码子、起始区二级结构
多次重做仍失败 序列难度判定 重复序列或高 GC 未被提前识别
克隆接不上 酶切位点与接头 位点被序列内部占用、保护碱基不足、同源臂过短
质粒转化效率异常低 骨架与背景 毒性元件未做诱导表达设计、拷贝数过高

把返工成本前置到设计阶段

三条动作的投入产出比最高:设计完成后做一次自检(移码、终止子、位点、GC 极值、重复长度);把"保留位点 / 禁用位点 / 目标宿主"三项信息一次性写进订单;对超过 6 kb 或含重复的构件,主动要求服务方给出可行性结论与替代方案建议。做完这三步,绝大多数项目可以在预定周期内交付,而不是在第二轮、第三轮中消耗预算。

最后回到成本视角:合成费用的绝对值在整个项目预算里通常占比不高,真正昂贵的是时间与结论的确定性。宁可多花两天做序列层面的评估,也不要在错误的设计上反复返工——这条经验在长期项目里的复利效应,比任何折扣都明显。




X