基因合成:说清报价、难度、组装与返工的真实边界
同一个基因,两家公司的报价能差三倍,交期能差两周,背后是分段方式、复杂度判定与质检深度的差别。本文按 9 组高频搜索关键词展开,讲的是怎么报价、怎么判定难度、怎么不被返工,不重复原理。
先给一条判断原则:基因合成的价格差异,九成来自"难度判定",而不是来自"每 bp 单价"。
单价表只对标准序列有意义。一旦序列里出现高 GC 区、重复片段、发夹结构或单体超过 3 kb,报价逻辑立刻从"按长度计价"切换到"按可行性与工艺成本计价"。所以比价时真正要比的,是两件事:对方如何判定你的序列难度,以及报价里是否已经包含返工与重做的责任边界。
基因合成多少钱:把报价拆成五项再比
一份完整的报价通常由五个部分构成,只看总价容易踩坑。
| 报价项 | 计价方式 | 影响幅度 | 谈判要点 |
|---|---|---|---|
| 基础合成费 | 按长度分段计价,短片段按条计价 | 占总价 50%–70% | 确认分段边界是否含两端接头 |
| 复杂度加价 | 按重复长度、GC 极值、二级结构判定 | 可上浮 30%–100% | 要求给出判定标准,而非"看情况" |
| 亚克隆费 | 克隆到客户指定载体、指定位点 | 常见按次计费 | 确认是否含读码框与方向确认 |
| 附加服务 | 密码子优化、突变引入、标签添加 | 多数免费,高级设计另计 | 把"免费优化"的范围写进合同 |
| 加急费 | 压缩交期至标准周期的 60%–70% | 上浮 30%–50% | 加急前先确认酶切与测序是否同步加急 |
一个广被忽略的事实:短序列的单条计价往往比按 bp 计价更贵。400 bp 以下的片段常按"条"报价,折算到每 bp 反而是长基因的两三倍。因此做小片段时,把多个片段合并到一条订单里,或者延长两端同源臂并入一个载体,往往比分别下单更省。
比价必问
①交付质粒的量与形式(冻干粉还是溶液、低拷贝质粒是否单独说明);②返工条款——若测序发现合成错误,重做是否收费、周期是否顺延;③紧急中止时已产生费用的结算方式。这三条写清楚,比单价便宜 5% 更有价值。
密码子优化:不要只盯 CAI
把密码子优化等同于"把稀有密码子换成高频密码子",是导致表达失败的高频原因。真正影响成败的,是优化过程不能破坏什么。
- 隐性剪接位点:真核表达时,优化后新产生的剪接供体/受体序列可能导致 mRNA 被截短。必须在优化后重新扫描剪接位点,而不只是检查 GC。
- 顺式调控元件:无意中引入的 poly(A) 信号、内部终止样结构、重复基序,都会影响转录与翻译效率。长度超过 6 个连续同碱基的结构建议主动打断。
- 限制性酶切位点:既要避免引入后续克隆要用的位点,也不能顺手删掉研究者有意保留的位点。优化前把"保留位点清单"和"禁用位点清单"同时交给服务方。
- N 端与 C 端结构:起始密码子周边序列影响翻译起始效率;N 端若带标签,第二密码子的选择会显著影响切除效率。这些位置的密码子不应被自由优化。
- 结构域边界的同义突变风险:做结构生物学或需要精细调控的项目,优化后应核对 mRNA 二级结构是否改变,尤其是 5′ 端 30–60 nt 区域。
还有一条实践边界:宿主适配不是唯一的优化目标。同一基因要在大肠杆菌筛库、在真核细胞做功能实验时,两端需求并不一致,此时更理性的做法是保留一版"野生型密码子版本"作为对照,而不是反复优化到无法解释表型差异。
困难序列:判定标准要写清楚
所谓"困难",行业内并没有统一阈值,但有几条相对通行的判定线,谈判时可以直接引用。
≥ 70%整体或局部 GC 含量,普遍触发复杂度加价
≥ 10 bp重复序列单体长度,常被列为高难判定项
≥ 8 bp连续同一碱基(poly 结构),影响合成与测序
≥ 3 kb单次组装长度,超过后进入分级组装策略
三条可用的解决方案,按代价从低到高
- 沉默改写:在功能允许的位置做同义替换,打断重复与二级结构,不改变氨基酸序列。这是代价最低、成功率最高的一步,优先尝试。
- 分段合成 + 体外组装:把困难区切成多段,各自独立合成后拼接。适合重复序列与超长片段。
- 功能重设计:当重复序列本身就是功能要求(例如弹性蛋白样结构域、柔性 linker 阵列)时,只能接受加价与更长交期,或改用基因拆分表达、蛋白连接等实验方案绕开。
风险提示
被接受订单后又被取消,是行业内真实存在的失败模式。判定困难序列时,务必在开工前要求书面可行性结论("可合成 / 需加价 / 需改序列 / 不可合成"),并确认报价在开工后不再追加费用。这两条能避免项目周期被单方面消耗掉。
长片段基因合成:先定组装策略,再定测序策略
长度进入 3 kb 以上,实验的核心矛盾从"能不能合成"变成"错误怎么找出来"。错误来源包括寡核苷酸本身的合成错误、PCR 扩增引入的突变、组装接头的错配以及克隆环节的丢失,长度越长,累积概率越高。
| 构建体长度 | 组装方式 | 中间验证 | 全长验证 |
|---|---|---|---|
| 1–3 kb | 单段合成或一次组装 | 菌落 PCR 确认接入 | Sanger 双向 |
| 3–6 kb | 分 2–3 段组装 | 各段 Sanger 确认 | Sanger 拼接 + 接头区重点复核 |
| 6–15 kb | 分级组装,先段后全长 | 逐段测序,合格段才进组装池 | NGS 或长读长测序 |
| > 15 kb | 多级模块化组装 | 模块级验证 + 定点复核 | 长读长测序整读,避免拼接歧义 |
三条提升一次通过率的做法
- 模块化设计:把大构件拆成互相独立的模块,每个模块留唯一酶切位点或唯一接头序列。后续改一个元件不必整条重做,这是长期项目最省钱的决定。
- 降低 PCR 轮数:组装环节尽量使用高保真酶,并把循环数压到最低。若同一模板扩增后用于组装,扩增前务必先测序确认模板正确。
- 在两端预留验证锚点:设计时把一段唯一序列放在构建体边界,便于后续用一对引物快速验证全长是否完整,而不必每次都上全测序。
还有一个容易被忽视的设计原则:为可制造性而设计。主动减少直接重复与反向重复、避免极端的局部 GC 峰、避免发夹结构与回文序列,往往比事后与服务方沟通加价更有效。序列层面的十分钟调整,可能换来一周交期。
长片段项目里的宿主与载体匹配
构件变长以后,宿主本身也会成为变量。大质粒在常规大肠杆菌宿主中常出现拷贝数偏低、稳定性下降的情况,导致"细菌长得好但抽不出足量质粒",这会被误判为合成失败。处理方式有三条:换用低拷贝兼容的宿主菌株、在培养阶段降低温度并延长培养时间、以及把超大构件拆分为两个互补质粒分装表达。若构件包含对宿主有负担的元件,应在设计阶段就改用具诱导型启动子的表达框架,把"毒性"问题从合成环节转移到可调控的表达环节。
另外,长片段项目建议在合同里明确"分段交付"的可能性:先拿到已测序合格的中间片段,用于并行的功能验证或亚克隆准备,不必等全长完成才开始工作。这一步能把项目的关键路径缩短一到两周。
载体与亚克隆:默认载体只是起点
合成服务默认把基因克隆进通用载体(多见于 pUC57 一类),这只解决"保存"问题,不解决"能不能用"。下单时必须把下游用途说清楚,否则多花一次亚克隆的时间和费用。
需要在下单时明确的五件事
- 目标载体与位点:给出明确的载体名称、插入位置与酶切位点组合,并确认这些位点在基因序列内确实不存在。
- 读码框与标签:若与 N 端标签(如 His、GST、FLAG)融合,必须核对插入片段与标签之间没有终止密码子、没有移码。这是"测序完全正确但蛋白表达不出来"的第一大原因。
- 插入方向:多数服务不默认保证方向,需要定向插入时应在订单中书面声明。
- 克隆方式:无缝克隆适合多片段拼接与位点受限的场景,但要求同源臂长度与序列洁净度更高;经典酶切连接更稳妥但受位点限制。两者对序列设计的要求不同,应在设计阶段而非交付阶段决定。
- 两端接头:酶切位点旁建议保留必要的保护碱基,否则切割效率低下会表现为"克隆失败",而问题其实出在设计。
省钱做法
如果后续还要做多种载体切换,可以让服务方一次性交付两端带通用接头的线性片段,自己在实验室用无缝克隆接到不同载体上。省下的是多次亚克隆的费用,付出的是几次自行克隆的时间,通常更划算。
交付与质检:对着清单逐项验收
合成订单的交付物不只是"一管质粒"。缺少任何一项,返工成本都会在后续实验中放大。标准验收清单如下。
| 交付项 | 验收要点 | 缺失后果 |
|---|---|---|
| 质粒 | 冻干粉或溶液形式、总量、低拷贝质粒单独标注 | 无法满足后续大体积转化需求 |
| 甘油菌 | 含重组质粒,可自行复苏扩增 | 质粒丢失后需全部重做 |
| 测序图谱 | 电子版原始图谱,含两端覆盖 | 无法自查序列正确性 |
| 序列比对文件 | 实际序列与设计序列的逐位比对 | 无法发现单碱基差异 |
| COA 文件 | 批次质量证明 | 投稿或合规审查时补不回来 |
自己动手复核的三个动作
- 比对而不是只看"测序成功":把交付的序列文件与自己的设计序列做一次本地比对,重点看两端 50 bp 与所有连接位点。
- 核对载体骨架:确认骨架内的筛选标记、启动子、复制子与预期一致,尤其是使用自己提供的载体时。
- 留样与备份:收到质粒后立即转化保菌并做一次冻存备份,避免唯一来源被污染后无法恢复。
关于测序深度:常规 Sanger 双向测序足以覆盖单基因;涉及简并位点、混合序列或长片段时,建议要求 NGS 或长读长测序,后者能一次读通整个构建体,避免拼接歧义。对于 10 kb 以上的构件,这一条几乎应当作为硬性要求。
突变体文库与定点突变合成
当需求从"合成一个基因"变成"合成一批变体",评价标准就完全不同了:重点不再是序列正确率,而是库的可用性——位点覆盖是否完整、是否引入了不想要的密码子、各变体的比例是否可控。
设计侧的四条纪律
- 控制终止密码子:简并密码子设计不当会大量产生提前终止的变体。按阵列化方式逐位点设计(每个位点 19 种氨基酸替换分别定义),可把无效变体比例压到很低。
- 决定是混合池还是独立管:用于筛选的混合文库追求复杂度,用于后续逐点验证的则更适合独立分装阵列。两种形式的价格与交期差别显著,下单前必须定下来。
- 明确交付形式:双链片段可直接用于组装,质粒则便于直接转化。选错形式会导致额外的克隆步骤。
- 预留验证通道:设计时保留一段唯一序列作为分子条形码,配合 NGS 就能定量每个变体在筛选前后的丰度变化,这比逐个克隆测序效率高得多。
实操中最有价值的做法是把文库拆成"独立位点池":每个突变位点单独成池,筛选阳性后可直接判断是哪个位点起作用;如果全部混成一池,阳性变体的归因会变得十分困难,往往需要整片重筛。
序列保密、合规与知识产权
序列本身就是数据资产,把序列交给外部机构前,需要处理三件事。
- 保密条款:明确序列不得用于任何与项目无关的用途、不得保留超出必要期限的副本、交付完成后按约定期限销毁中间材料。项目结束后如需继续留存质粒,应通过单独约定处理。
- 知识产权归属:合成所得序列与构建体的权利归属应书面确认归委托方,服务方不得基于委托信息申请专利或对外传播。涉及拟申请专利的序列,建议先完成申请再大规模外委,或在合同中明确公开时间节点。
- 合规边界:涉及病原体、毒素相关基因或受管控元件时,需先确认所在地区的生物安全与出口管制要求,并在订单中如实申报来源与用途。合规问题一旦出现,整个项目的周期损失远大于合成费用本身。
别忽略这两条
①不要用公开邮箱传递完整序列文件,改用加密渠道或平台内提交;②在预印本、会议摘要或基金申报材料中提前披露序列,会让保密条款的实际保护力度大幅下降。发表的时机与保密协议的有效期要协调安排。
对需要长期复用的序列,还有一条工程化建议:建立自己的序列版本库。每个构建体记录设计序列、实测序列、载体骨架、标签配置与验证日期,并保留测序原始文件。这份记录在未来改元件、换宿主、补实验时能省下大量重复确认工作。
合成"失败"了:先排查客户侧的设计问题
项目中反复出现的所谓"合成失败",多数不是工艺问题,而是设计阶段埋下的隐患。按下面顺序排查,通常能定位到症结。
| 现象 | 优先排查 | 典型原因 |
|---|---|---|
| 交付序列与设计不符的单碱基差异 | 设计序列本身的来源 | 参考序列本身有误,或含简并符号未确认 |
| 测序正确但表达无信号 | 读码框与起始密码子周边 | 移码、隐藏终止密码子、起始区二级结构 |
| 多次重做仍失败 | 序列难度判定 | 重复序列或高 GC 未被提前识别 |
| 克隆接不上 | 酶切位点与接头 | 位点被序列内部占用、保护碱基不足、同源臂过短 |
| 质粒转化效率异常低 | 骨架与背景 | 毒性元件未做诱导表达设计、拷贝数过高 |
把返工成本前置到设计阶段
三条动作的投入产出比最高:设计完成后做一次自检(移码、终止子、位点、GC 极值、重复长度);把"保留位点 / 禁用位点 / 目标宿主"三项信息一次性写进订单;对超过 6 kb 或含重复的构件,主动要求服务方给出可行性结论与替代方案建议。做完这三步,绝大多数项目可以在预定周期内交付,而不是在第二轮、第三轮中消耗预算。
最后回到成本视角:合成费用的绝对值在整个项目预算里通常占比不高,真正昂贵的是时间与结论的确定性。宁可多花两天做序列层面的评估,也不要在错误的设计上反复返工——这条经验在长期项目里的复利效应,比任何折扣都明显。
最新动态
-
10.10
点对点验证试剂盒:读懂蛋白互作一对一验证的体系选择与证据链闭环
-
10.10
基因合成:说清报价、难度、组装与返工的真实边界
-
10.10
酵母单杂交实验:拆开自激活陷阱、文库转化与假阳性剔除
-
10.10
噬菌体展示:讲透文库选型、淘选严格度与富集判读
-
09.29
酵母单杂交的自激活治理与假阳性闭环验证
-
09.29
噬菌体库筛选的设计:严谨度梯度、非特异扣除与富集监控
-
09.29
双荧光素酶报告系统的数据:从实验设计、对照体系、信号窗口到统计解读
-
09.29
荧光定量检测的信号链治理:从取样到Ct可信度
-
09.28
表面等离子共振(SPR)实验避坑指南:从缓冲液优化到伪影辨别
-
09.28
酵母单杂交(Y1H)筛选:诱饵设计、假阳性治理与阳性结果验证体系


