トランスフォーマーは3つのプロジェクションを必要とするのか。QKVバリアントの体系的研究
標準的な3プロジェクション構造の再検討
トランスフォーマーのクエリ・キー・バリュー(QKV)プロジェクション機構は、Vaswani et al.(2017)が「Attention Is All You Need」を発表して以来、ほぼ疑問の余地なく受け入れられてきました。標準的なアーキテクチャは、スケーリングされたドット積アテンション計算の前に、入力埋め込みを変換するために、クエリ(Q)、キー(K)、バリュー(V)それぞれに対して3つの独立した線形プロジェクションを適用します。この設計選択は実用的な考慮と表現容量に関する理論的直感の両方に動機付けられていますが、機能的に等価な代替案に対して体系的に検証されていません。
本質的に問われているのは、固定された総モデル容量が与えられた場合、等価なパフォーマンスを達成するために3つの独立したプロジェクションすべてが必要であるかどうかということです。この問題は実用的な意義を持ちます。なぜなら、アテンション層はトランスフォーマーパラメータと計算の相当な割合を占めるからです。12層のトランスフォーマーで768の隠れ次元と12のアテンションヘッドを備えた場合、アテンションプロジェクションだけで約240万パラメータを占めます(Devlin et al., 2019)。より単純なプロジェクションバリアントが同等のダウンストリームパフォーマンスを達成できれば、実務家は精度損失を比例させずにモデルサイズを削減できます。これはリソース制約環境での展開にとって重要な考慮事項です。
どのプロジェクションがパフォーマンスを駆動するかを理解することは、トランスフォーマー情報処理の基本原理も明らかにします。この調査は、マスク言語モデルにおける相互情報フロー(Voita & Titov, 2020)とアテンションヘッド特化(Clark et al., 2019)を検証する最近の研究と並行しています。アーキテクチャコンポーネントを分離することで、3方向プロジェクション分割が本質的な計算パターンをキャプチャするのか、それとも慣例よりも必要性を通じて持続するアーキテクチャ冗長性を表すのかを判定できます。
従来の仮定—独立したQ、K、Vプロジェクションが複雑なアテンションパターンに必要な表現力を提供するという仮定—は経験的検証を必要とします。7つのプロジェクションバリアントを比較します。(1)標準的な独立QKV、(2)共有Q=K、(3)共有Q=V、(4)共有K=V、(5)完全に共有されたQ=K=V、および2つの非対称バリアント。モデルスケール(50Mから1Bパラメータ)と多様なタスクカテゴリ全体でテストすることで、観察された効果が真のアーキテクチャ制約を反映しているのか、それともパラメータレジーム成果物を反映しているのかを分離します。

- 図2:検証対象の標準QKV投影と7つのバリアント比較(パラメータ削減パターン別)*
実験設計:制御された比較フレームワーク
方法論は、すべてのバリアント間でパラメータ予算の等価性を強制します。これはプロジェクションアーキテクチャの影響を総モデル容量の混同から分離する重要な制御です。プロジェクションが共有される場合、保存されたパラメータは他のモデルコンポーネント(具体的には、フィードフォワード層の幅)に再配分され、パフォーマンスの違いがアーキテクチャ選択ではなく容量の違いを反映していることを保証します。この設計原則は本質的です。パラメータが少ないモデルは当然パフォーマンスが低下します。関連する問題は、簡略化されたプロジェクションが等価容量ベースラインと比較して相対的にパフォーマンスが低下するかどうかです。
評価は複数の次元にわたります。
- 言語モデリング困惑度(WikiText-103、OpenWebText上の保留検証セット)
- ダウンストリームタスクパフォーマンス多様な言語現象全体:
- 構文タスク:品詞タグ付け、依存関係解析
- 意味タスク:自然言語推論、質問応答(SQuAD v1.1)
- 分類:感情分析(SST-2)
- 訓練ダイナミクス:収束速度、損失軌跡、勾配フロー
- アテンションパターン分析:重み疎性、エントロピー、ヘッド特化
モデルスケールは50Mから1Bパラメータまで範囲があり、実用的な展開スペクトラム全体で調査結果が一般化されることを保証します。すべてのバリアントは同一のハイパーパラメータ(学習率:1e-4、ウォームアップステップ:10,000、バッチサイズ:256)、訓練手順(Adamオプティマイザ、1.0での勾配クリッピング)、ハードウェア(単一8×A100 GPUセットアップ)を使用し、実験的な混同を排除します。
評価フレームワークは、プロジェクション共有が異なる言語現象に非対称に影響する可能性があるため、タスクカテゴリを明示的に区別します。アテンション重み分析はパフォーマンスメトリクスに付随し、簡略化されたバリアントがダウンストリームパフォーマンスを維持しながら質的に異なるアテンションパターンを開発するかどうかを明らかにします。これはパフォーマンス等価性が機能等価性を反映しているのか、それとも代替メカニズムを通じた補償を反映しているのかを理解するために重要な区別です。
パフォーマンスパターン:簡略化への驚くべき耐性
結果は期待に異議を唱えます。Q=K共有(マージされたクエリ・キープロジェクション)はベンチマーク全体で最小限の劣化を示します。これは通常、0.5~1.5%の精度損失です。これはクエリ・キー分離が想定されるほど重要ではないことを示唆しています。モデルは、クエリとキーが同一の表現空間に存在する場合でも、効果的なアテンションパターンを学習します。
Q=K=V(単一の共有プロジェクション)は中程度の劣化を示します。タスク複雑性に応じて2~5%です。構文タスクは意味タスクよりも共有をよく許容します。意味タスクは細かい区別を必要とします。パターンは明らかです。バリュープロジェクションの柔軟性はアテンション重み柔軟性よりも重要に見えます。これは機械的に理にかなっています。どの情報を抽出するかを決定することは、複数のアテンションパターンが同様のダウンストリーム動作をもたらすことができるため、どこにアテンションするかを決定することよりも重要です。
計算上の利得と効率トレードオフ
プロジェクション共有は定量化可能な計算上の利点をもたらします。
- パラメータ削減:Q=K共有はアテンション層パラメータを25%削減します。Q=K=Vは33%削減します
- メモリフットプリント:フォワード/バックワードパス中の活性化メモリの比例削減
- 訓練速度:Q=Kバリアントで8~12%のウォールクロック高速化。Q=K=Vで15~18%
- 推論レイテンシ:アテンション計算時間(行列乗算)で10~15%削減
96のアテンション層を持つ1Bパラメータモデル(大規模言語モデルの典型)の場合、これらの節約は実質的に複合します。Q=K共有だけでアテンション層から約240万パラメータを削除し、Q=K=Vは約360万を削除します。モデル全体では、これは2~3%の総パラメータ削減と比例するメモリ/計算節約に変換されます。
パフォーマンス効率フロンティアはリソース制約展開に対して定量的に魅力的です。1~2%の精度を犠牲にしてアテンション層のパラメータを33%削減することは、多くのアプリケーションにとって有利なトレードオフを表します。注目すべきことに、簡略化されたバリアントは訓練の初期段階(総ステップの最初の10~20%)でしばしば高速に収束しますが、この利点は訓練が進むにつれて減少します。これはプロジェクション共有が初期学習中の最適化を支援するが、表現が安定化すると重要性が低くなることを示唆しています。
実務家にとって、トレードオフは定量化可能でタスク依存です。Q=Kバリアントは効率重視アプリケーション(モバイル展開、リアルタイム推論)に適しています。標準QKVは精度が最重要の場合に適切なままです。中規模モデル(100M~500Mパラメータ)は簡略化から最も利益を得ます。パラメータ節約が総モデルサイズに対して実質的であるためです。大規模モデル(1Bパラメータ以上)はプロジェクション冗長性を比例する精度損失なく吸収できますが、小規模モデル(50Mパラメータ未満)は適切な容量のためにすべてのパラメータを必要とします。
機械的インサイト:各プロジェクションの役割
- クエリ・キー分離分析*:Q=K共有がなぜ最小限のパフォーマンスコストを負担するのか。クエリとキーは共同でアテンション重み分布を決定します。どのトークンがどれに注意するか。これらのプロジェクションを共有することは、アテンションパターンをより対称的な形に制約します。Q とKが同一の変換から導出されるため、アテンションパターンはより相互的になります。しかし、モデルは他のメカニズムを通じて補償します。フィードフォワード層と後続のアテンションヘッドは、対称的なアテンションパターンにもかかわらず非対称情報ルーティングを実装できます。
アテンション重み分析は、Q=Kモデルが標準QKVベースラインと比較してより均一で疎性の低いアテンションパターンを開発することを明らかにします。平均アテンションエントロピーは0.15~0.25ナットで増加します。ほぼゼロのアテンション重みの割合は8~12%減少します。これらの質的な違いにもかかわらず、ダウンストリームパフォーマンスは比較可能なままであり、アテンション疎性は機械的に異なりますが、効果的な情報処理に必要ではないことを示唆しています。これはより広い解釈可能性調査結果に接続します。最近のアテンションヘッド特化に関する研究(Clark et al., 2019)が多くのヘッドが機能的に冗長であることを明らかにするのと同様に、プロジェクション分析はアテンションパターン多様性も同様に冗長性を含む可能性があることを示唆しています。
- バリュープロジェクション独立性*:バリュープロジェクションのより大きな重要性はその異なる計算役割を反映しています。QとKが情報がどこに流れるかを決定する一方、Vは情報が何であるかを決定します。バリュープロジェクションの柔軟性により、モデルはアテンションパターンに関係なく異なる情報を抽出およびルーティングできます。この原則は知識編集研究の調査結果と並行しています(Meng et al., 2022)。情報コンテンツとルーティングメカニズムは部分的に分離可能であり、ルーティングの柔軟性(バリュープロジェクション)はアテンションパターンの柔軟性(クエリ・キー区別)よりも重要であることが証明されています。
この調査結果は複数の計算パスが等価な機能性につながることを示唆しています。これはトランスフォーマー冗長性をより広く理解することに含意があります。これはロッテリーチケット仮説の調査結果と一致しています(Frankle & Carbin, 2019)。ニューラルネットワークはパフォーマンス損失なくプルーニングできる実質的な過剰パラメータ化を含むことを示唆しています。
含意とアーキテクチャ教訓
経験的調査結果は、標準的な3プロジェクション設計が最適または必要であるという仮定に異議を唱えます。これは即座の実用的含意を持ちます。実務家は効率重視設定でQ=Kバリアントを展開でき、定量化された精度効率トレードオフを持ちます。研究者にとって、調査結果はトランスフォーマーアーキテクチャの他の潜在的冗長性についてより広い問題を提起します。
メタレッスンは重要です。アーキテクチャ選択は体系的な経験的検証よりも慣例と初期実用性を通じて持続することがしばしばあります。3プロジェクション設計はVaswani et al.(2017)で合理的な選択として導入されましたが、その後の研究はそれをめったに疑問視していません。モデルが数十億パラメータにスケーリングするにつれて、アーキテクチャ冗長性を特定および排除することは、計算的および環境的に持続可能なスケーリングにとってますます重要になります。
- 制限と未解決の問題*:この研究は、プロジェクション共有が他のアーキテクチャ変数(層深さ、アテンションヘッド数、正規化スキーム、活性化関数)とどのように相互作用するかを確立しません。タスク依存の劣化パターン(構文対意味)は、適応型アーキテクチャが入力特性またはタスク要件に基づいてプロジェクション複雑性を動的に割り当てる可能性があることを示唆しています。これは将来の調査の方向です。
さらに、研究はエンコーダのみのアーキテクチャ(BERTスタイルモデル)に焦点を当てています。デコーダのみのモデル(GPTスタイル)とエンコーダ・デコーダモデル(T5スタイル)は、異なるアテンションパターン(因果マスキング、クロスアテンション)のため異なるプロジェクション重要性を示す可能性があります。これらのアーキテクチャ全体での体系的調査は一般化可能性主張を強化するでしょう。
- 将来の研究方向*:
- デコーダのみおよびエンコーダ・デコーダアーキテクチャでプロジェクション共有を調査する
- プロジェクション共有と他のアーキテクチャ変数(深さ、幅、正規化)間の相互作用を検証する
- 層機能または入力特性に基づいて複雑性を割り当てる適応型プロジェクションスキームを開発する
- 他のプロジェクション様メカニズム(例えば、フィードフォワード層構造、位置エンコーディング)への分析を拡張する
より広い含意は次のとおりです。体系的なアブレーション研究はモデルがスケーリングするにつれてますます重要になります。50Mパラメータで無視できるように見えるアーキテクチャ冗長性は、1B以上のパラメータで実質的な非効率に複合する可能性があります。この研究は、そのような冗長性が存在し、定量化できることを実証し、トランスフォーマー設計の他の潜在的な非効率性を特定するための方法論的テンプレートを提供します。
パフォーマンスパターン:簡略化への経験的耐性
結果は、3つのプロジェクションすべてが必要であるという仮定に体系的に異議を唱えます。
-
Q=K共有*(マージされたクエリ・キープロジェクション)はベンチマーク全体で最小限の劣化を示します。言語モデリング困惑度は標準QKVと比較して0.8~1.2%相対的に増加します。ダウンストリームタスク精度は平均で0.5~1.5%減少します。この調査結果はモデルスケールとタスクタイプ全体で堅牢です。結果は、クエリ・キー分離—何に注意するか表現の区別—がアーキテクチャ慣例が示唆するほど重要ではないことを示唆しています。モデルは、クエリとキーが同一の線形変換から導出されるという要件によってのみ制約されている場合でも、クエリとキーが同一の表現空間を占める場合でも、効果的なアテンションパターンを学習することに成功しています。
-
Q=K=V共有*(単一の統一プロジェクション)は中程度の劣化を示します。タスク複雑性に応じて2~5%の精度損失です。重要なことに、劣化はタスクタイプと相関します。構文タスク(品詞タグ付け、依存関係解析)は共有をかなり良く許容します(1.5~2.5%損失)。意味タスクは細かい区別を必要とします(4~6%損失)。このパターンは、構文現象はより単純な表現から回復可能である可能性があり、意味現象は表現柔軟性から利益を得ることを示唆しています。
-
K=V共有*(独立したクエリプロジェクション、共有キー・バリュー)はQ=KとQ=K=Vの間で中程度に実行されます。典型的な劣化は1.5~3%です。この位置付けは情報提供です。バリュープロジェクション独立性がクエリ・キー分離よりも重要であることを示します。異なる情報を抽出およびルーティングする柔軟性(バリュープロジェクション機能)がアテンションパターンを決定する柔軟性(クエリ・キー区別)よりも重要であることを示唆しています。
経験的パターンはプロジェクション重要性の階層を明らかにします。バリュープロジェクション > クエリ・キー分離 > 3つすべての絶対的な独立性。この順序は機械的直感と一致しています。抽出および伝播する情報を決定すること(バリュープロジェクション)は、複数のアテンション重み分布が代替情報ルーティングを通じて同様のダウンストリーム動作をもたらすことができるため、どこに注意するかを決定すること(クエリ・キー区別)よりも重要に見えます。

- 図3:パラメータ予算等価性を維持する実験設計フロー*

- 図6:Q、K、V各投影の役割分担と情報フロー(機械的洞察分析に基づく)*

- 表1:QKVバリアント別の性能・効率指標サマリー(本研究の実験結果統計)*