FlashAttention
FlashAttentionとは、大規模言語モデルなどのトランスフォーマー構造において、アテンション計算の高速化と省メモリ化を実現するアルゴリズムです。GPUの高速なSRAMを活用し、メモリ読み書きのボトルネックを解消することで、より長いコンテキストウィンドウの処理を可能にします。
計算効率化に関するAI用語を1件掲載しています。意味や使い方、関連用語を一覧から確認できます。
FlashAttentionとは、大規模言語モデルなどのトランスフォーマー構造において、アテンション計算の高速化と省メモリ化を実現するアルゴリズムです。GPUの高速なSRAMを活用し、メモリ読み書きのボトルネックを解消することで、より長いコンテキストウィンドウの処理を可能にします。