🤖 AI Summary
タイトル:AIの大規模言語モデル(LLM)アーキテクチャにおける新技法「KV共有」「mHC」「圧縮アテンション」
この記事は、2026年4月から5月にリリースされた大規模言語モデル(LLM)の新しいアーキテクチャに関する情報を取り上げています。LLM開発者たちがリソースコストを削減するために導入した新しい技法を紹介しています。
1. **KV共有**:Gemma 4では、後続のレイヤーが先行レイヤーで使用したキー・バリュー(KV)状態を再利用し、KVキャッシュサイズと計算量を削減することで長文コンテキストの効率化を行っています。これにより、128Kの長文コンテキストにおいてE2Bモデルでは約2.7GB、E4Bモデルでは約6GBのKVキャッシュサイズが削減されました。
2. **mHC(多様体制約付きハイパーコネクション)**:DeepSeek V4では、トランスフォーマーブロック内の残差接続を近代化するための手法として導入されています。これは複数の並列な残差ストリームと学習済みマッピングを使用して行われます。
3. **圧縮アテンション**:ZAYA1-8Bでは、圧縮畳み込みアテンション(CCA)を用いて、アテンションブロックに圧縮された潜在表現を導入し、KVキャッシュサイズと計算量の両方を削減しています。
これらはリソース効率を向上させるための工夫で、それぞれが特定のモデルに適用され、その特長を生かしています。これらの技法により、LLMはより多くのトークンを長時間保持し、自律的かつ高精度な課題解決を行うことが可能となっています。
オープンウェイトの大規模言語モデル(LLM)がプロンプト入力による質疑応答の枠を超え自律的かつ高精度な課題解決を行う方向に進化する上で、推論モデルやエージェントワークフローは欠かすことのできない手法となっていますが、より多くのトークンを長時間保持する必要があることからKey-Valueキャッシュ(KVキャッシュ)のサイズ・メモリ帯域幅・アテンションコストといったリソースが実行上の主要な制約となります。LLM開発者はリソースのコストを削減する目的でLLMアーキテクチャに様々な工夫を取り入れてきましたが、2026年4月から5月にかけてリリースされたLLMについて注目すると長文コンテキストの効率化に非常に重点を置いている傾向にある、とLLMリサーチエンジニアの Sebastian Raschka氏は指摘しています。
続きを読む...