エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
記事へのコメント1件
- 注目コメント
- 新着コメント
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
TransformerのKVキャッシュを用いたDecode処理を理解する - Qiita
こんにちは、DeNAでデータサイエンティストをやっているまつけんです。 今回は、TransformerのKVキャッ... こんにちは、DeNAでデータサイエンティストをやっているまつけんです。 今回は、TransformerのKVキャッシュを用いたDecode処理について解説していきたいと思います。 Transformerの推論処理には以下のように2段階あります。 Prefill: 入力トークン全体(プロンプト)を並列処理する。またその際、K,V を作成してキャッシュとして保存 Decode: プロンプトの入力から、1トークンずつ処理して文章を生成。過去作成したK,Vをキャッシュから読み出して再利用し、新しい1行(1トークン)を追加 1段階目のPrefillは初回処理として以前の記事↓を参照してもらえればと思います。 この処理を行い出来上がったKとVを保存しておき、これをKVキャッシュと呼びます。 この計算、 $X$を入力として次のレイヤーへの出力$Y$を作る処理になります。 図で表すと以下のようになります。



2026/08/19 リンク