バイオインフォマティクス機械学習

遺伝子発現

いでんしはつげん · gene expression
17 views

遺伝子発現とは、DNAの遺伝情報に基づいてタンパク質などが合成され、細胞内で機能を持つ分子が作られるプロセスです。AIや機械学習の分野では、この発現データを特徴量として用いることで、病気の診断や新薬の開発を支援するバイオインフォマティクス研究が盛んに行われており、複雑な生体内システムの理解に不可欠なデータソースとなっています。

遺伝子発現とは

遺伝子発現(いでんしはつげん)とは、細胞が持つゲノム(DNA)の遺伝情報が読み取られ、RNAの転写やタンパク質の合成を経て、実際に生体内で機能する分子へと変換される一連のプロセス、またはその活性度合い(発現量)のことです。AI分野では、この発現量を数値化したデータを、機械学習やディープラーニングなどのモデルに入力して、疾患予測や薬効評価に利用します。

詳しく解説

遺伝子発現は、生物のすべての細胞が同じDNA(設計図)を持ちながら、なぜ皮膚や心臓などの異なる組織として機能できるのかを説明する鍵となります。必要な時に必要な遺伝子だけが発現し、適切な量のタンパク質が作られます。近年のバイオテクノロジーの進歩により、数万種類の遺伝子の発現量を一度に測定する「RNAシーケンシング」などの技術が登場しました。これにより得られる膨大な遺伝子発現データは、きわめて高次元で複雑です。そこで、機械学習やディープラーニングを用いて、疾患の有無を分類するモデルの構築や、特定の病気に関連する重要遺伝子の同定、がんのサブタイプ分類などを行うバイオインフォマティクス(生命情報科学)研究が急速に進展しています。

具体例・使われ方

具体的には、がん患者の腫瘍組織から得られた遺伝子発現データを機械学習モデルへの入力データ(特徴量)として与えることで、そのがんが特定の抗がん剤に対して効果を示すかどうかを予測するシステムが開発されています。また、シングルセル(単一細胞)解析によって得られるシングルセル遺伝子発現データをディープラーニングモデルで次元削減し、これまで未知だった新しい細胞種を発見する研究などにも利用されています。

似た用語との違い

「ゲノムデータ」が生物が生まれ持つ不変の設計図(DNA配列)を指すのに対し、「遺伝子発現データ」は環境や時間、疾患の状態によって動的に変化する生体内の「活動状況」を示します。ゲノムデータが「可能性」を示すのに対し、遺伝子発現データは「現在の状態」を表すという違いがあります。AIモデルにこれらのデータを統合して学習させる「マルチオミクス解析」も注目されています。

注意点

遺伝子発現データは、一般に「サンプル数が少なく、特徴量の次元数が極めて多い」という課題を抱えています。このため、機械学習モデルが過学習(オーバーフィッティング)を起こしやすく、適切な次元削減や正則化といった前処理が不可欠です。また、測定環境やノイズによる影響を受けやすいため、AIによる予測結果の解釈には慎重な検証が求められます。

更新日時: 2026年9月25日 18:15