GPT-2で追うprefill・decodeとKVキャッシュ

2026.09.30 9:33
Classmethod.jp

LLMの推論処理を「prefill」と「decode」に分け、Attentionの計算を追いながらKVキャッシュの仕組みを詳しく解説します。GPT-2の小さなモデルを例に、なぜKVキャッシュが必要なのか、そしてハードウェアのメモリ構成がLLMの速度にどう影響するかについてまとめました。

検索

人気記事

2026.05.05 11:04
2026.09.28 19:25
2026.09.30 3:09
2026.09.23 13:45
2026.09.29 10:00

コメント一覧

まだコメントはありません。

コメント