立即注册找回密码

QQ登录

只需一步,快速开始

微信登录

微信扫一扫,快速登录

手机动态码快速登录

手机号快速注册登录

搜索
小桔灯网 门户 资讯中心 技术杂谈 查看内容

宏基因组里的宿主污染,到底该怎么去

2026-7-24 09:33| 发布者: 沙糖桔| 查看: 333| 评论: 0|来源: 生信黑白熊

摘要: 没有一种“放之四海而皆准”的单一方案。
做宏基因组的人,几乎都绕不过“去宿主污染”这一步。

有人把它当成质控后的固定动作,跑一下就往后走;也有人盯着宿主比对率,觉得删得越多越放心。结果是,这一步明明发生在流程前端,却经常要等到后面的物种分析、功能注释、组装甚至分箱出了问题,才被重新翻出来复盘。


什么叫“宿主污染”

宏基因组本来想看的,是样本里的微生物、病毒、真菌这些非宿主成分。

但真实样本不是教科书。只要样本本身和宿主组织挨得近,或者提取过程中本来就带着大量宿主背景,最后测回来的数据里,就很容易混进宿主 DNA 片段。

最常见的几类场景其实都很好理解:

  • 肠道、口腔、皮肤、呼吸道样本,常常混有人源序列
  • 动植物组织相关样本,本身就带着很高比例的宿主背景
  • 环境样本虽然不一定有“宿主”这个概念,也经常会混入非目标的大分子背景

这里有个很容易被误解的点。

“污染”这个词听起来像实验出了错,但很多时候它并不代表操作失败,而是样本类型天然就会这样。尤其是宿主相关样本,混入宿主序列几乎是默认情况,不是少数情况。

为什么必须去宿主污染

去宿主最直接的作用,是把无效数据先拿掉。

如果一批 reads 里有很大一部分都属于宿主,那这些数据对微生物分析几乎没有帮助,却会实打实占掉你的测序量、存储空间和计算资源。看起来测了很多,真正能用于后续分析的有效深度却没那么多。

它带来的影响通常体现在四个地方。

第一,微生物信号会被压住。尤其是低丰度物种,本来就不容易被看到,如果再被高比例宿主序列盖过去,后面做分类和定量时很容易失真。

第二,后续分析负担会明显加重。宿主 reads 不会因为你“不想分析它”就自动消失,它们一样会进入比对、组装、注释等步骤,算力和时间都照样要花。

第三,分类注释和功能注释可能被误导。你以为看到的是群落结构差异,结果里面混着宿主来源的噪音;你以为某类功能富集很有生物学意义,最后发现只是输入没有清干净。

第四,人源样本还牵涉隐私和合规。只要项目里包含明显的人源序列,后面无论是共享数据、提交数据库,还是给合作方交付结果,都需要多考虑一层风险。

去宿主污染通常在流程里的什么位置

从流程顺序看,这一步一般发生在原始数据下机之后、正式进入下游分析之前。

比较常见的顺序是这样:

  1. 先拿到原始 FASTQ 数据
  2. 做基础质控,检查接头、质量值、重复和低复杂度问题
  3. 去接头、去低质量、去低复杂度等预处理
  4. 用宿主参考基因组做比对,筛除匹配到宿主的 reads
  5. 把保留下来的 clean reads 再送去做物种分类、拼装、功能分析甚至后续 MAG 重建

这条顺序看上去很简单,但具体怎么做?

比如宿主参考库选什么版本,线粒体和叶绿体要不要一起纳入,双端 reads 怎么保配对关系,过滤阈值是保守一点还是激进一点,这些细节都会直接影响最后留下来的数据质量。

主流思路到底是什么

去宿主的核心逻辑其实不复杂:把测序 reads 和宿主参考基因组做匹配,命中的去掉,没命中的保留。

真正的区别,主要在实现方式上。

一类是通用比对工具思路。也就是把 reads 直接往宿主参考基因组上比,谁稳定命中就判成宿主。这类方法直观、成熟、解释性强,很多项目都在用。

另一类是更偏流程化的去污染方案。它可能把比对、过滤、统计汇总打包在一起,让你更容易批量处理样本,也更方便做统一报告。

这里没必要堆太多工具名,真正该看的判断依据主要就几个:

  • 速度够不够,尤其是样本多的时候
  • 灵敏度够不够,能不能把明显宿主背景清掉
  • 误删风险高不高,会不会把微生物信号一起带走
  • 和你的样本类型、测序策略是不是匹配

真正难的是“删得准

去宿主最难的地方,是在降低宿主背景的同时,尽量保住真正有价值的微生物信号。

去得不够,宿主背景会残留很多,这样后面的微生物信号还是会被噪音干扰。

去得太狠,问题就反过来了。那些本来就弱、就少、就不容易被捕捉到的微生物序列,可能会跟着一起被清掉。最后看起来宿主比对率很漂亮,实际上是把有价值的信息也一起削薄了。

所以去宿主本质上是道平衡题。目标不是“宿主百分之百清零”,而是:在可解释、可复现的过滤规则下,尽可能压低明确的宿主背景,同时保留足够的有效微生物信息支撑后续分类、组装、功能分析和 MAG 重建。

怎么判断去宿主做得好不好

判断去宿主效果,不能只盯着一个比对率。

更实用的看法,是把几个维度一起看。

先看宿主 reads 去除比例是否合理。如果本来就是高宿主背景样本,去掉很多并不奇怪;如果是宿主占比本该没那么夸张的样本,却被清掉了大半,就要多留个心眼。

再看保留 reads 的数量,还够不够支持后续分析。宿主降下去了,但剩下的数据如果薄得撑不起分类、组装和功能分析,那这一步未必算做得好。

然后看微生物分类结果是不是更集中、更可信。去宿主前后如果结果变化杂乱无章,或者依旧充满解释不通的高等生物信号,那就说明这一步还需要复查。

还要看重复样本、同批次样本之间是不是更一致。一个稳的流程,不应该让相近样本之间的差异被人为放大。

如果条件允许,再结合阴性对照和流程复盘一起判断。因为很多问题不是单看结果表能发现的,只有把前后各步串起来看,才知道到底是参考库、参数,还是样本本身出了问题。

小结:不同场景,重点不同

去宿主这件事,没有一个统一答案可以套所有样本。

人体来源样本,最该优先考虑的是隐私、宿主占比和参考基因组完整性。你不只是要去噪,还要考虑结果交付时的人源信息风险。

动植物样本,重点往往是宿主背景本来就高,参考库又未必总是像人源那样完整,所以“怎么保留有效微生物信号”会变得更关键。

环境样本稍微特殊一些。很多时候它做的是非目标背景清除,不一定能完全等同于“去宿主”,但底层逻辑仍然相通,都是为了减少无关信号对后续分析的干扰。

临床相关场景对灵敏度和误删的平衡要求会更高。因为你关心的对象往往可能本来就低丰度,删轻了有噪音,删重了又可能把真正重要的信号一起抹掉。

所以没有一种“放之四海而皆准”的单一方案。流程可以借鉴,判断不能偷懒。

声明:
1、凡本网注明“来源:小桔灯网”的所有作品,均为本网合法拥有版权或有权使用的作品,转载需联系授权。
2、凡本网注明“来源:XXX(非小桔灯网)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。其版权归原作者所有,如有侵权请联系删除。
3、所有再转载者需自行获得原作者授权并注明来源。

最新评论

关闭

官方推荐 上一条 /3 下一条

客服中心 搜索 洽谈合作
返回顶部