ショートリードとは、次世代シーケンシング技術において、DNAやRNAなどの塩基配列を一度に解読した、長さ約50〜300塩基対の短い断片データです。高精度かつ低コストで大量に取得できるため、バイオインフォマティクスやディープラーニングを用いたゲノム解析、変異検出などの機械学習モデルの入力データとして広く利用されています。
ショートリードとは
ショートリードは、次世代シーケンシング(NGS)技術によって生成される、長さが数十から数百塩基対(主に50〜300bp)の短いDNA/RNA配列データのことです。現在のゲノム解析において最も標準的なデータソースであり、バイオインフォマティクスや機械学習を用いたゲノムデータ処理の基礎を支えています。
詳しく解説
ショートリードは、Illumina(イルミナ)社に代表される第二世代シーケンサーから主に生成されます。ゲノム全体を一度に解読するのではなく、ランダムに断片化した膨大な数の短い配列(リード)を同時に並列で読み取るため、高いスループット(データ処理能力)と極めて高い読み取り精度(99.9%以上)を低コストで実現できる点が最大の特徴です。バイオインフォマティクスの分野では、これらのショートリードを既知の参照ゲノム(リファレンスゲノム)にマッピング(アライメント)することで、個人の遺伝子変異や発現量を推定します。近年では、膨大なショートリードデータから高精度に変異を特定するために、ディープラーニングを用いたバリアントコール(変異検出)アルゴリズムなどの機械学習技術が実用化されています。
具体例・使われ方
例えば、がんゲノム医療において、患者のがん組織から抽出したDNAからショートリードを生成し、参照ゲノムと比較してがんの原因となる遺伝子変異をディープラーニングモデルで検出する事例があります。また、シングルセル解析技術と組み合わせることで、細胞1個ずつの遺伝子発現パターンをショートリードとして出力し、機械学習アルゴリズムを用いて細胞のクラスタリングや状態変化の予測を行う研究も盛んに行われています。
似た用語との違い
ショートリードと対比される概念に「ロングリード」があります。ショートリードが50〜300塩基対と短いのに対し、ロングリードは数千から数万塩基対以上の長い配列を一度に読み取ることができます。ショートリードは、読み取り精度が非常に高く低コストですが、繰り返し配列の多い領域の解析や、大規模な構造変異(ゲノムの並び替えなど)の検出が困難であるという弱点があります。一方、ロングリードは複雑な構造の特定に適していますが、読み取り精度がやや低く、コストが高いという特徴があります。バイオインフォマティクスではこれらを相補的に組み合わせてゲノム解析を行います。
注意点
ショートリードは、長さが短いため、ゲノム内に繰り返し登場するリピート配列などのアセンブリ(ゲノムの再構築)において、どの領域に由来する配列なのかを特定するのが難しいという限界があります(マッピングの曖昧性)。このため、機械学習モデルのトレーニングデータとしてショートリードを使用する際は、アライメントエラーやシーケンシングバイアスによる偽陽性の発生に注意を払う必要があります。