简介
nf-core/mag 是一个用于宏基因组组装、分箱和注释的生物信息学最佳实践分析流程。
流水线概述
默认情况下,该流水线目前执行以下操作:它同时支持短读长和长读长,使用 fastp、AdapterRemoval 或 trimmomatic 以及 Porechop 对读长和接头进行质量修剪,使用 FastQC 执行基本质量控制,并合并多个测序运行。
随后,该流水线:
- 使用 MEGAHIT 和 SPAdes 进行组装,并使用 Quast 和 ALE 检查其质量(如果使用短读长数据)
- (可选)使用 pypolca 以短读长对长读长组装进行抛光
- (可选)使用 PyDamage 进行古 DNA 组装验证,并使用 Freebayes 和 BCFtools 进行 contig 共识序列召回
- 使用 Prodigal 预测组装中的蛋白质编码基因,并使用 Prokka 以及可选的 MetaEuk 进行分箱
- 使用 MetaBAT2、MaxBin2、CONCOCT、COMEBin、MetaBinner 和/或 SemiBin2 进行宏基因组分箱
- 使用 Busco、CheckM 或 CheckM2 以及可选的 GUNC 检查基因组分箱的质量
- 使用 pyDamage 和 freebayes 进行古 DNA 验证和修复
- 可选地使用 DAS Tool 优化分箱
- 使用 GTDB-Tk 和/或 CAT 为分箱分配分类学信息,并可选地使用 geNomad 识别组装中的病毒,或使用 Tiara 识别真核生物
此外,该流水线会在指定的结果目录中创建各种报告,包括一份 MultiQC 报告,用于总结部分发现结果和软件版本。
用法
[!NOTE] 如果您是 Nextflow 和 nf-core 的新手,请参阅 此页面 了解如何设置 Nextflow。在针对实际数据运行工作流之前,请确保使用
-profile test测试您的设置。
nextflow run nf-core/mag -profile <docker/singularity/podman/shifter/charliecloud/conda/institute> --input samplesheet.csv --outdir <OUTDIR>
[!WARNING] 请通过 CLI 或 Nextflow
-params-file选项提供流水线参数。包括通过-cNextflow 选项提供的自定义配置文件在内的配置文件可用于提供任何配置 (参数除外);请参阅 docs。
有关更多详细信息和进一步的功能,请参阅 usage documentation 和 parameter documentation。
Pipeline output
要查看使用完整规模数据集运行的示例测试运行的结果,请参阅 nf-core 网站流水线页面上的 results 选项卡。 有关输出文件和报告的更多详细信息,请参阅 output documentation。
Group-wise co-assembly and co-abundance computation
每个样本都有一个关联的组 ID(参见 input specifications)。此组信息可用于使用 MEGAHIT 或 SPAdes 进行基于组的共组装,和/或使用 MetaBAT2 为分箱步骤计算共丰度。默认情况下,基于组的共组装是禁用的,而基于组的共丰度计算是启用的。有关如何使用此组信息的更多信息,请参阅参数 --coassemble_group 和 --binning_map_mode 的文档。
当启用基于组的共组装时,SPAdes 将在相应合并的 reads 文件上运行,因为 metaSPAdes 尚不允许输入多个样本或文库。相比之下,MEGAHIT 为每个组运行,同时提供各个 readfiles 的列表。
Credits
nf-core/mag 由 Hadrien Gourlé 在 SLU、Daniel Straub 和 Sabrina Krakau 在 Quantitative Biology Center (QBiC) 编写。James A. Fellows Yates 和 Maxime Borry 在 Max Planck Institute for Evolutionary Anthropology 于 2.2.0 版本加入。
其他代码贡献者包括:
- Antonia Schuster
- Alexander Ramos
- Carson Miller
- Daniel Lundin
- Danielle Callan
- Gregory Sprenger
- Jim Downie
- Phil Palmer
- William Rosenbaum
- Adam Rosenbaum
- Diego Alvarez
- Nikolaos Vergoulidis
- Greg Fedewa
- Vini Salazar
- Alex Caswell
- Jeferyd Yepes
长读长处理受 caspargross/HybridAssembly 启发,由 Caspar Gross @caspargross 编写
我们感谢以下人士在开发此流程过程中提供的广泛协助:
- Alexander Peltzer
- Phil Ewels
- Gisela Gabernet
- Harshil Patel
- Johannes Alneberg
- Maxime Garcia
- Michael L Heuer
- Alex Hübner
Contributions and Support
如果您希望为此流程做出贡献,请参阅 contributing guidelines。
如需更多信息或帮助,请随时通过 Slack #mag 频道 与我们联系(您可以使用 this invite 加入)。
Citations
如果您在分析中使用 nf-core/mag,请引用预印本如下:
nf-core/mag:用于宏基因组混合组装和分箱的最佳实践流程
Sabrina Krakau, Daniel Straub, Hadrien Gourlé, Gisela Gabernet, Sven Nahnsen.
NAR Genom Bioinform. 2022 Feb 2;4(1):lqac007. doi: 10.1093/nargab/lqac007.
此外,您可以使用以下 doi 直接引用该流程:10.5281/zenodo.3589527
该流程所用工具的详细参考文献列表可在 CITATIONS.md 文件中找到。
您可以按以下方式引用 nf-core 出版物:
用于社区维护生物信息学流程的 nf-core 框架。
Philip Ewels, Alexander Peltzer, Sven Fillinger, Harshil Patel, Johannes Alneberg, Andreas Wilm, Maxime Ulysse Garcia, Paolo Di Tommaso & Sven Nahnsen.
Nat Biotechnol. 2020 Feb 13. doi: 10.1038/s41587-020-0439-x.