简介
nf-core/denovotranscript 是一个用于从 bulk RNA-seq 的配对末端短读段进行 de novo 转录组组装的生物信息学流程。它以 samplesheet 和 FASTQ 文件作为输入,执行质量控制(QC)、修剪、组装、冗余度降低、伪比对和定量分析。它输出转录组组装 FASTA 文件、转录本丰度 TSV 文件,以及包含组装质量和读段 QC 指标的 MultiQC 报告。
-
原始读段的质量控制(
FastQC) -
接头和质量修剪(
fastp) -
修剪后读段的质量控制(
FastQC) -
去除 rRNA 或线粒体 DNA(可选)(
SortMeRNA) -
使用以下任意组合进行转录组组装:
-
使用
Evidential Gene tr2aacds进行冗余度降低。使用gawk从 Evidential Gene 的输出中生成转录本到基因的映射。 -
组装完整性质量控制(
BUSCO) -
其他组装质量指标(
rnaQUAST) -
使用
TransRate进行转录组质量评估,包括使用读段进行组装评估。如果 profile 设置为conda或mamba,则不执行此步骤。 -
伪比对和定量(
Salmon) -
原始读段、修剪后读段、BUSCO 和 Salmon 的 HTML 报告(
MultiQC)
用法
[!NOTE] 如果您是 Nextflow 和 nf-core 的新手,请参阅 此页面 了解如何设置 Nextflow。在运行实际数据的工作流之前,请确保使用
-profile test测试您的设置。
首先,准备一个包含输入数据的样本表,格式如下:
samplesheet.csv:
sample,fastq_1,fastq_2
CONTROL_REP1,AEG588A1_S1_L002_R1_001.fastq.gz,AEG588A1_S1_L002_R2_001.fastq.gz
每一行代表一对 fastq 文件(双端)。
现在,您可以使用以下命令运行流程:
nextflow run nf-core/denovotranscript \
-profile <docker/singularity/.../institute> \
--input samplesheet.csv \
--outdir <OUTDIR>
[!WARNING] 请通过 CLI 或 Nextflow
-params-file选项提供流水线参数。包括通过-cNextflow 选项提供的自定义配置文件在内的配置文件可用于提供除 参数 之外的任何配置;请参阅 docs。
有关更多详细信息和进一步的功能,请参阅 usage documentation 和 parameter documentation。
Pipeline output
要查看使用完整规模数据集的示例测试运行结果,请参阅 nf-core 网站流水线页面上的 results 选项卡。 有关输出文件和报告的更多详细信息,请参阅 output documentation。
Credits
nf-core/denovotranscript 由 Avani Bhojwani (@avani-bhojwani) 和 Timothy Little (@timslittle) 编写。
Contributions and Support
如果您想为此流水线做出贡献,请参阅 contributing guidelines。
如需更多信息或帮助,请随时通过 Slack #denovotranscript channel 联系我们(您可以使用 this invite 加入)。
Citations
如果您在分析中使用 nf-core/denovotranscript,请使用以下 doi 引用它:10.5281/zenodo.13324371
流水线所用工具的广泛参考文献列表可在 CITATIONS.md 文件中找到。
您可以按以下方式引用 nf-core 出版物:
nf-core 框架:社区精选的生物信息学流程。
Philip Ewels, Alexander Peltzer, Sven Fillinger, Harshil Patel, Johannes Alneberg, Andreas Wilm, Maxime Ulysse Garcia, Paolo Di Tommaso & Sven Nahnsen.
Nat Biotechnol. 2020 Feb 13. doi: 10.1038/s41587-020-0439-x.