nanoporetech/dorado

Oxford Nanopore's Basecaller

解决的问题

Dorado 是一款专为处理 Oxford Nanopore 读取设计的高性能分析引擎。它通过碱基识别、比对和错误修正,将原始测序数据简化转换为可用的遗传信息,同时在 GPU 和 Apple Silicon 上最大化硬件加速。

运作方式

Dorado 构建于 libtorch(PyTorch 的 C++ API)之上,使用深度学习模型来执行碱基识别——将来自纳米孔测序的原始信号数据转译为核苷酸序列。它采用定制的 CUDA 和 Metal 优化,以确保在 Nvidia GPU 和 Apple M 系列芯片上实现高速推理。该引擎支持多种模式,包含 simplex 和 duplex 碱基识别,以及修饰碱基(表观遗传标记)检测和 poly(A) 尾长估算。

适用对象

适用于处理 Oxford Nanopore 测序数据的生物信息学家和研究人员,他们需要用于碱基识别、读取比对和组装抛光的快速且可扩展的分析流程。

亮点

  • 硬件加速:针对 Nvidia A100/H100 GPU 和 Apple Silicon 进行优化,具备多 GPU 线性扩展能力。
  • 高级碱基识别:支持修饰碱基识别(例如 5mC、6mA)和 duplex 碱基识别以获得更高的准确度。
  • 集成工具:包含内置的读取比对(通过 minimap2)、条形码分类和单读取错误修正(通过 HERRO)支持。
  • 组装抛光:提供高准确度的抛光工具,以精炼来自其他工具(如 Flye 或 Hifiasm)的草图组装。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch