AIインフラハードウェア性能評価

レイテンシ

れいてんし · Latency
29 views

レイテンシとは、AIシステムにおいてデータ入力から処理結果が出力されるまでに要する遅延時間を指します。リアルタイム処理や音声認識、自動運転などの分野においてユーザー体験や安全性に直結する極めて重要な性能指標です。

レイテンシとは

一言でいうとレイテンシとは、AIへリクエストを送ってから応答が返ってくるまでの「待ち時間」のことです。

詳しく解説

AIの運用において、レイテンシの短縮は重要な課題です。大規模言語モデルや画像生成AIなどの複雑なニューラルネットワークでは、膨大な数のパラメータを計算するため、推論処理に時間がかかりやすくなります。この処理遅延を抑えるため、GPUなどの高性能なハードウェアの活用や、モデルの軽量化、エッジデバイスでの分散処理など、さまざまな最適化技術が導入されています。

具体例・使われ方

音声アシスタントに話しかけてから返答が返ってくるまでの時間や、自動運転車が前方の障害物をカメラで認識してからブレーキを作動させるまでの遅延時間がレイテンシの具体例です。これらが大きすぎると、利用者の不快感や重大な事故につながる恐れがあります。

似た用語との違い

スループットという用語と混同されやすいです。レイテンシが「一つの処理にかかる時間」であるのに対し、スループットは「単位時間あたりに処理できるデータ量」を意味します。

注意点

レイテンシを削減しようとしてモデルのサイズを過度に小さくすると、推論の精度が低下するトレードオフが発生します。用途に応じた適切なバランスの設計が必要です。

更新日時: 2026年9月6日 08:11