データ科学バイオインフォマティクス統計解析

ゲノムワイド関連解析

げのむわいどかんれんかいせき · Genome-Wide Association Study
18 views

ゲノムワイド関連解析(GWAS)は、ヒトの全ゲノムにわたる遺伝子変異と、病気の発症リスクや身体的特徴などの表現型との関連性を統計的に調べる手法です。膨大な遺伝子情報から疾患に関わる特定の遺伝子変異を検出でき、疾患の原因究明や個別化医療の進展、さらにAIによる疾患予測モデルの構築に欠かせないデータ分析手法です。

ゲノムワイド関連解析とは

ゲノムワイド関連解析(GWAS)とは、ヒトのゲノム全体に散らばる数十万から数百万箇所の一塩基多型(SNP)と呼ばれる遺伝子のばらつきを網羅的に調べ、特定の病気の罹りやすさや体質などの特徴と結びついている遺伝子変異を特定するための統計的データ解析手法です。

詳しく解説

ヒトのゲノム塩基配列は個人間で99.9%以上共通していますが、ごく一部に「一塩基多型」と呼ばれる1塩基単位の配列の違いが存在します。ゲノムワイド関連解析では、特定の疾患を持つ患者グループ(症例群)と健康なグループ(対照群)の間で、これらの一塩基多型の頻度に統計的有意差があるかどうかを網羅的に検証します。これにより、特定の疾患の発症リスクを高める遺伝的要因をピンポイントで特定することが可能です。近年では、大規模なバイオバンクのデータ蓄積と計算能力の向上、さらに機械学習技術の統合により、単一の遺伝子変異だけでなく、複数の微細な変異が複雑に絡み合う影響を解析する多変量解析の精度も飛躍的に向上しています。

具体例・使われ方

具体的な利用例として、糖尿病や高血圧、アルツハイマー病などの多因子遺伝疾患の遺伝的要因の特定が挙げられます。例えば、特定の病気を持つ数万人と持たない数万人の一塩基多型データを比較解析し、発症確率を大きく変動させている遺伝子変異の箇所を明らかにします。この解析によって得られた知見は、個人の遺伝的背景に基づいた「個別化医療(プレシジョン・メディシン)」の実現や、将来の病気のリスクを算出する機械学習を用いた予測アルゴリズムの構築に役立てられています。

似た用語との違い

ゲノムワイド関連解析がゲノム全体を網羅的に探索するのに対し、「候補遺伝子アプローチ」はあらかじめ機能が予測されている特定の遺伝子領域のみに絞って関連性を調べます。候補遺伝子アプローチは探索範囲が狭いため未知の遺伝的要因を見落とすリスクがありますが、ゲノムワイド関連解析は仮説を持たずに全ゲノムから探索できるため、未知の関連遺伝子を網羅的に発見できます。また、単純な因果関係を直接証明するものではなく、統計的有意差に基づく相関関係を示す点において、個別の生物学的機能を解明する機能ゲノミクスとも異なります。

注意点

注意点として、ゲノムワイド関連解析で検出されるのはあくまで「相関関係」であり、直接的な「因因関係」を示すわけではない点があります。見つかった一塩基多型が直接病気を引き起こしているとは限らず、近くにある真の原因遺伝子と連鎖しているだけの場合もあります。また、多数の遺伝子変異を同時に検証するため多重比較の補正が必要となり、統計的有意差の基準が非常に厳しく設定されるため、偽陽性を防ぐ一方で、影響が極めて小さい有用な変異を見落とす偽陰性のリスクも存在します。さらに、環境要因(生活習慣やストレスなど)の影響を十分に排除した多変量解析を行わなければ、誤った結論を導く原因になります。

更新日時: 2026年9月25日 11:15