噬菌体库筛选的设计:严谨度梯度、非特异扣除与富集监控​

信息来源:金开瑞 作者:genecreate_cn 发布时间:2026-09-29 15:26:39

    三轮淘选结束,单克隆 ELISA 阳性率做到八成以上,测序也拿到了干净的收敛基序。可把序列转到表达载体、纯化出重组片段之后,结合信号却掉回背景附近;换一批文库、换一天做,同样的流程又给出另一套命中清单。落差通常不出在某一轮操作,而在于整条链路只有起点与终点两个观测点:入库时看了一眼库容,收尾时拿到几十个克隆的读数,中间三轮发生过什么、偏差从哪一轮开始累积、参数该往哪推、何时该停,全都没有记录。

    淘选本质上是一次多参数的条件优化实验。参数可以设计,趋势可以观测,停止点可以判定;把这三件事写进方案,重复性才有依托。

一、先把"命中"定义清楚:不同目标类型的输出标准不同

    淘选收尾时说"筛到了",这句话本身没有信息量。克隆算不算命中,取决于下游要用它做什么,所以验收标准必须在投入文库之前写进方案,而不是拿到测序结果之后再补。

    抗体片段看两组指标。第一组是结合能力:亲和力目标通常写成 KD 区间,例如先定在 10-8 M 量级作为入门线,需要阻断或体内应用的项目再往 10-9 M 量级压;同时写清交叉反应上限与无关蛋白背景上限。第二组是可开发性:表位约束(是否必须落在配体—受体界面、是否需要非竞争表位)、可溶表达量底线、单体比例、热稳定性下限。纳米抗体 VHH 噬菌体库淘选尤其要把稳定性放在前面——单域骨架小,容易富集到依赖二硫键或极端缓冲条件的克隆,脱离淘选缓冲液就散架。

    多肽项目的验收标准不在亲和力上,而在化学与结构的可实现性。噬菌体展示多肽库筛选靶点时,写进方案的是四条:合成可行性(避免连续半胱氨酸、避免长疏水簇、避免 N 端谷氨酰胺自发环化)、结构约束(是否需要头尾环化、二硫键几对)、溶解性下限、在血清等目标介质中的稳定性。多肽亲和力做到微摩尔量级往往就够用,但一条无法合成或无法溶解的序列没有价值。

    酶或配体这类以功能为终点的项目,唯一硬指标是活性。变构激活剂看 EC50 与最大激活倍数,底物模拟型抑制剂看 IC50 与竞争性证据,共价探针看时间依赖性与透析后的不可逆性。验收卡上要留一栏"机制证据",否则会把结合了但不影响活性的克隆当成命中。

验收卡(淘选前必须写定)

    四行内容:亲和力目标(KD 区间或替代指标)、特异性目标(交叉反应上限)、表位约束(竞争型或非竞争型、必需覆盖的界面)、稳定性与表达底线(可溶表达量、单体比例、热稳定性)。写不出数值的那一行,补一条可测量的替代指标——暂时测不到 KD,可以先用固定浓度下的结合信号比值加竞争抑制率代替。这些标准同时决定加严方向:要阻断型抗体,游离配体竞争从第一轮就该介入。

二、文库端的质量门槛

    文库质量常被简化成一个库容数字,但库容只说明上限。真正决定筛选成败的是有效多样性:能正常展示、序列互不相同,且不因扩增而迅速丢失的那部分克隆。

    库容与有效多样性要分开看。109 的报数里可能包含大量重复序列、框架偏好带来的家族聚集,以及读通错误产生的假序列。评估动作并不复杂:随机挑 30–50 个克隆测序,去重后统计独立序列数与长度分布;独立序列数与报数库容的比值过低,说明实际可用空间远小于宣传值。噬菌体文库库容量与多样性评估常被简化成一个总数,把抽样测序统计写进交付要求,比反复讨论数字大小更有意义。

    展示价与拷贝数决定筛选的物理起点。高拷贝展示是多价呈递,二价或五价结合带来的亲合力效应会掩盖单价亲和力很低的克隆,筛出的序列换成单价形式后往往消失;低拷贝展示更接近真实亲和力,但信号弱,容易在洗涤中被冲掉。项目要先定"筛什么价":要高亲和力克隆,低拷贝配合严格洗涤更可靠;只需能结合,高拷贝能更快看到富集。

    移码、缺失与提前终止是另一类隐性污染。扩增过程中融合基因会出现读框偏移或片段缺失,宿主内重组也会产生截短体。这些克隆仍能被扩增和测序,但展示的片段已经变短,容易制造"太容易结合"的假象,因此每轮扩增后要抽样测序,检查读框完整性与展示区长度。

    扩增过程中的多样性丢失最常被忽略。不同克隆在宿主中的生长速度与展示效率不同,扩增等于给它们排了一次序,轮次越多,起跑线不利的克隆越难回到池子里。这也是"入库前评估一次"远远不够的原因——每轮扩增之后都要回检多样性。

    保存与再生同样影响重复性。原始文库应按单次用量分装冻存,每次开工从原始分装重新扩增。噬菌体展示文库构建服务价格差异很大,报价通常绑定库容报数,却很少写清有效多样性、污染控制方式与交付分装规格,谈价时补上这三项能省掉大量返工。若把淘选交给噬菌体抗体库筛选外包公司,交付清单应包含每轮的输入输出滴度、富集倍数与单克隆命中率,而不只是一串序列。

三、淘选模式选型

    同一个文库,换一种淘选模式,筛出来的克隆几乎不重叠。原因在于每种模式都在改变同一件事:靶标以什么形态、在什么环境里展示给噬菌体。

    固相淘选把靶蛋白直接吸附在塑料表面,操作省事、通量最高。偏差集中在三处:包被可能让蛋白构象改变,多结构域蛋白与膜蛋白胞外域尤其敏感;塑料表面会富集疏水性强、带正电的克隆,产生大量"塑料结合体";靶蛋白多价密集排列,容易富集低亲和力但亲合力强的克隆。固相淘选与液相淘选区别的核心就在这里——固相胜在通量与成本,输在构象保真度。

    液相磁珠淘选把靶蛋白通过生物素化捕获到链霉亲和素磁珠上,靶标处于溶液状态,构象更接近生理;磁珠可用磁力架快速分离,洗涤换液方便,也更容易做消减扣除。偏差来自捕获环节:生物素化位点会占用表位,位点选择(N 端还是 C 端)直接决定哪些表位被遮住;链霉亲和素磁珠自身也会富集一批结合体,需要用裸磁珠预吸附。

    细胞淘选是膜蛋白与受体类靶点的首选,也是背景最难控的一种。靶标以天然构象、天然修饰、天然密度呈现在活细胞表面,这是它不可替代的地方;代价是细胞表面存在大量高丰度蛋白,非特异黏附无法靠单纯洗涤解决。一套完整的细胞淘选全流程方案必须写进三件事:用不表达靶标的同源细胞做 2–3 轮负筛;用空载体细胞做全程平行对照;把传代次数、汇合度与消化方式统一。背景克隆占比压不下去,通常不是洗涤不够,而是负筛缺位。

    组织切片或体内淘选是只能原位回答的问题的唯一入口,比如归巢肽、组织特异性标志物。靶标处在完整微环境中,偏差也最极端:回收率常低到需要合并多只动物,个体差异远大于技术重复。

    固定方式对表位可及性的影响值得单独看。直接包被会随机遮蔽一部分表位;生物素化捕获方向可控,但需要先验证生物素化是否影响靶标活性;标签捕获把结合位点留在标签远端,对表位最友好,代价是引入标签抗体或金属离子这层干扰。

    判断该换模式的信号有五条:同一模式连续两轮富集倍数低于 2;固相淘选中塑料结合体占比超过三成;靶标是多次跨膜蛋白却仍在用固相包被;细胞淘选背景克隆长期高于一半且负筛无效;抗原用量已降到极限,富集仍不启动。

图1:一轮淘选的闭环流程。四种模式共用同一个循环,差异集中在"孵育结合"这一环;环外为每轮严谨度的推进方向,环内为每轮必须回检的过程指标。

 

    如图 1 所示,孵育结合、洗涤去除未结合、洗脱、侵染宿主扩增、回检五个环节构成闭环,差别全部落在"孵育结合"这一环的物理条件上。模式选型就是把这一环的参数换成与靶标形态匹配的那一套。

四、严谨度梯度怎么做

    加严不是把条件整体调紧,而是一次只动一个旋钮。可调的量有六个:靶量、洗涤次数、洗涤缓冲液的严格度、洗脱方式、竞争配体、消减扣除的强度。每轮的改动项都要记录,出问题才知道是哪个参数引起的。

    靶量递减是最常用的一档,常见做法是从百纳摩尔级起步,逐轮降到十纳摩尔、再降到低纳摩尔甚至亚纳摩尔。边界在于:靶量降到远低于解离常数时,低丰度的高亲和力克隆会因为找不到靶标而丢失,数量占优的中等亲和力克隆反而占据优势。递减节奏要跟富集趋势挂钩,而不是按固定比例一路砍。

    洗涤次数与缓冲液严格度是同时可调的两层。次数从每轮 3 次加到 6 次、8 次、12 次;去垢剂从 0.05% 的吐温类表面活性剂提到 0.3%–0.5%;盐浓度从 150 mM 氯化钠提到 300–500 mM,再在末次洗涤补一道高盐冲击。噬菌体库筛选非特异性结合怎么降低,答案往往就在这两层里,而不是换文库。

    竞争洗脱把"结合得牢"变成"结合在正确的位置上"。加入游离靶蛋白、已知配体或可溶性受体胞外域作竞争物,可以在洗脱前把弱结合与错位结合的克隆挤掉。竞争物浓度要设梯度,从 10 倍摩尔过量到 1000 倍,观察洗脱滴度是否随竞争物升高而下降。

    预吸附与消减扣除解决的是"不该富集的被富集了"。常规动作包括:用未包被的孔或裸磁珠做预吸附;用无关蛋白、宿主细胞裂解物封闭;用同源蛋白或亲缘细胞做负筛。负筛要计入输入滴度,被吸走的噬菌体同样是投入量的一部分。

    下面这张表给出一套可用的四轮参数梯度骨架。它描述的是趋势,不是可以照抄的配方;每轮的实际输入滴度都要记录,因为预期输出区间只有在输入滴度稳定时才有解释力。

表1:四轮淘选参数梯度骨架
轮次 靶量 洗涤次数 洗脱方式 预期输出滴度区间
R1 摸底 50–100 nM 3 次,去垢剂 0.05% 碱性直接洗脱 106–107 pfu/mL
R2 初压 10–20 nM 5 次,盐提至 300 mM 碱性洗脱 107–108 pfu/mL
R3 加严 2–5 nM,加裸珠预吸附 8 次,去垢剂 0.3% 竞争洗脱,100 倍游离靶标 107–108 pfu/mL
R4 收口 1 nM 以下,加同源负筛 10–12 次,末次高盐冲击 竞争洗脱,1000 倍游离靶标 106–108 pfu/mL

    读表有三点。输入滴度决定输出的天花板,所以每轮都要在侵染前后各测一次滴度;输出绝对值只做安全边际判断,真正说明问题的是比值。轮次末端的滴度下降不必慌张。

    噬菌体淘选几轮合适没有统一答案,判断依据是富集趋势而不是轮次数。富集倍数在 R2 到 R3 已经跨越一个数量级、独立序列数开始收敛,三轮就够;连续两轮富集倍数低于 2,加轮次没有用,该换的是模式或扣除策略。

五、富集监控:判断该停还是该再来一轮

    富集监控的目的只有一个:让"该停还是该再来一轮"变成可以被数据回答的问题。需要记录的指标有五个——输出与输入噬菌体滴度比、富集倍数趋势、去重后的独立克隆数、单克隆 ELISA 命中率、序列基序收敛度。

    输出与输入滴度比是最基础的一档。每轮在侵染前测输入滴度,扩增后再测输出滴度,两者相除得到归一化的富集倍数。只看输出绝对值会误导:扩增效率与宿主状态波动会整体抬高或压低读数,与筛选是否有效无关。

    富集倍数趋势看的是斜率而不是数值。健康的筛选里,前两轮快速上升,第三轮起增幅收窄;如果每轮都涨相同幅度,说明体系还在解决非特异结合,尚未进入特异性富集阶段。淘选富集不明显是什么原因,多数能从趋势形状找到线索:全程平缓通常指向靶标固定方式有问题或输入滴度过低;先升后平但平得早,通常是洗涤严格度不足,非特异克隆同步富集。

    克隆多样性用去重后的独立序列数表示。每轮取 20–30 个克隆测序,去掉重复序列后统计独立序列数与基序分布。多样性下降是富集正在发生的证据,也是预警:下降过快时,特异性克隆可能已被生长更快的非特异克隆挤出去。

    单克隆 ELISA 命中率是主要的停止依据。挑 48–96 个克隆,在包被靶标的板上测定,同时设未包被孔、无关蛋白孔与宿主细胞对照孔。命中率定义要事先写清——通常要求靶标孔信号是背景的若干倍,且无关蛋白孔不过线。

    序列基序收敛度在多肽库里是强指标,抗体库则看 CDR3 长度分布、家族偏好与关键位点保守性。收敛度高是好事,但要分辨是"同一表位被多个独立克隆反复认出",还是"同一个克隆被反复扩增",看核酸序列是否完全相同即可判断。

停止判定规则

    三条并行条件:富集倍数增幅连续两轮低于 20%;独立克隆数降到两位数以下且基序收敛明显;单克隆命中率稳定在可接受水平且不再上升。三条同时成立就该停下来做单克隆挑取。任何一条不成立,优先做的都不是加一轮洗涤,而是检查扣除策略与靶标固定方式。

    继续加严的收益递减与风险要一起看。当富集已由特异性结合驱动时,再加一轮洗涤带来的额外纯度很有限,却会丢掉弱结合但仍有价值的克隆,并把表位多样性压缩成单一基序。

富集监控双轴趋势图:输出输入滴度比逐轮上升,独立克隆数逐轮下降,两条曲线交叉处标注收益递减点与建议停止窗口

图 2:两类过程指标的同步走势。左轴为归一化后的输出/输入滴度比,右轴为去重后的独立克隆数;两条曲线交叉点即收益递减的起点。

 

    如图 2 所示,滴度比逐轮上升、独立序列数逐轮下降,两条曲线交叉的位置正是收益开始递减的地方。停止窗口常落在交叉点之后的一轮之内。

六、从淘选池到功能分子

    淘选池里是几千到几十万条序列的混合物,功能分子必须先被"挑出来"。这一步的损耗常常和淘选本身一样大。

    先做亚库与基序分析,再动手挑单克隆。对输出池做一次轻度测序或亚克隆测序,得到几百到几千条序列,按基序分组、按丰度排序,然后从每个主要分组里各挑几个代表克隆。这样挑出的单克隆覆盖的是序列空间,而不是扩增偏好;跳过这一步,结果往往是挑到十几个完全相同的序列。

    初筛顺序值得固定成流程:序列去重与分组 → 噬菌体 ELISA(靶标孔、未包被孔、无关蛋白孔三个对照齐全)→ 可溶性片段 ELISA(用竞争法或单价形式排除多价效应)→ 表达与纯化 → 亲和力与功能验证。先序列后功能,能省掉大量湿实验。

    重组表达是最容易丢克隆的一环。表达量问题通常出在信号肽与宿主株的匹配、分泌路径的氧化还原环境以及培养温度上,低温诱导能显著提高可溶比例。二硫键问题集中在 scFv 与 VHH:周质空间提供氧化环境,但表达量高时折叠跟不上,容易出现错配二硫键。聚集多与浓度和标签有关,纯化后立刻稀释、去掉促聚集标签、换用略带盐和温和去垢剂的缓冲液,往往比重做表达更有效。

    亲和力测定要按用途分级使用。ELISA 半定量只能排序,不能给 KD。生物膜干涉法适合粗样品与中等通量,能给出动力学参数,但对弱亲和力与小分子配体灵敏度有限。表面等离子体共振是定量主力,固定策略与再生条件需单独优化,靶标固定后构象是否变化要验证。可行顺序是:ELISA 排序 → 生物膜干涉复核 → 表面等离子体共振定量。

    功能验证要与应用场景对齐。细胞结合实验要区分真实结合与 Fc 受体介导的非特异吸附,常用做法是比较表达与不表达靶标的同源细胞;中和实验用活病毒或假病毒体系,给出 IC50 与细胞毒性窗口,避免把细胞毒误读为中和;内化实验用 pH 敏感荧光染料标记或共聚焦观察,并比较单价与二价形式。顺序建议反过来——先做最接近应用场景的那个实验,早期就能筛掉形式上漂亮但功能无效的克隆。

    功能验证整体失败时,最快的诊断动作不是重做表达,而是回到淘选模式复盘。图 3 把四种模式在五个维度上的相对强弱摆在一起,此时就是一张对照表:膜蛋白靶点却用了固相包被,构象失真几乎可以预先判定。

淘选模式选型矩阵:固相、液相磁珠、细胞、组织体内四种模式在靶标保真度、背景控制、通量、操作复杂度、适用靶标类型五个维度上的评分对比

图3:四种淘选模式的选型矩阵。模式没有优劣,只有与靶标形态是否匹配;它同时是功能验证失败时的回溯工具。

七、典型失败模式速查表

    下表按"现象—根因假设—验证动作—修正方向"四栏排列,覆盖出现频率最高的十二类问题。原则是先做一次成本最低的验证,再决定改哪一环。

表2:淘选失败模式速查
现象 最常见根因假设 一次验证动作 修正方向
富集倍数不升 输入滴度过低,或靶标固定失效 检测包被效率,复核输入输出滴度 输入提到 1011 pfu 以上,改生物素化液相捕获
输出滴度骤降 洗涤过严,在洗涤中丢失特异克隆 分段收集洗涤液,分别侵染计数 改分档洗涤,去掉末段尿素冲击
阳性率高但重组后不结合 多价亲合力效应,或阳性阈值过松 同批克隆改做单价可溶片段 ELISA 阈值提到背景 5 倍,换低拷贝展示重筛
序列高度重复指向同一克隆 扩增偏好,或挑取前未去重 比对核酸序列是否完全一致 挑取前分组去重,按分组配额挑取
命中靶标同源蛋白 缺同源蛋白负筛 ELISA 加同源蛋白孔,看交叉信号 从 R2 起加同源蛋白预吸附与负筛
细胞淘选背景极高 负筛缺位,或细胞状态不一致 空载体细胞平行板,比较信号差 补 2–3 轮同源负筛,统一传代与汇合度
体内或组织淘选回收率低 投入量不足,或循环时间不当 分时间点回收,逐组织测滴度 合并多只个体,缩短循环时间,提高投入
多轮后多样性崩塌 加严过快,或扩增偏好累积 逐轮抽样测序,统计独立序列数 停止加严,回到上一轮输出重新挑取
洗脱不彻底 洗脱条件不足,或结合过强 首次洗脱后再洗一次,分别测滴度 改竞争或酶切洗脱,并提高洗脱体积
扩增后滴度异常 宿主状态差,或辅助噬菌体比例失衡 同步测宿主生长曲线与超感染对照 锁定对数生长期与辅助噬菌体比例
加严后命中率反降 加严过度,丢掉中等亲和力克隆 对比加严前后的结合与解离速率 回退一档,只在竞争洗脱上继续加严
换批次文库结果不可重复 扩增批次差异,或多样性已丢失 两批文库平行做同一轮淘选 固定从原始分装扩增,建批次放行指标

        淘选的可重复性来自可追溯性。把每一轮的输入滴度、输出滴度、独立序列数与命中率记录下来,出了问题就能定位到具体某轮、某个参数;反过来,即使筛到了好克隆,也说不清它是怎么来的。




    X