ロープド言語モデルにおける読み出し盲点:密な教師信号では不十分
読み出しボトルネック:交差エントロピーが実際に教師信号を与えるもの
ロープド言語モデル(隠れ状態ベクトルが反復を通じて保持され、各ステップで復号化されてから後続の計算に再入力されるアーキテクチャ)は、根本的な教師信号の非対称性をもたらします。標準的な交差エントロピー損失は読み出し層の出力(各タイムステップでの復号化されたトークン予測)のみに作用しますが、再帰的な状態遷移は完全な隠れ状態ベクトルに依存しています。ここで重要な区別が生じます。勾配信号は読み出し投影に寄与する状態次元にのみ直接流れ、状態遷移に参加しながらも復号化器に存在しない次元は、減衰した、あるいは無視できる勾配フィードバックしか受け取りません。
これを形式的に定義します。$h_t \in \mathbb{R}^d$ をループ $t$ における隠れ状態、$R: \mathbb{R}^d \to \mathbb{R}^v$ を読み出し関数(通常は語彙空間 $v$ への線形投影)とします。交差エントロピー損失 $\mathcal{L}{CE}$ は $R(h_t)$ に作用し、勾配 $\frac{\partial \mathcal{L}{CE}}{\partial R(h_t)}$ を生成します。これらの勾配は $R$ を通じて逆伝播し、$\frac{\partial \mathcal{L}{CE}}{\partial h_t}$ を生成します。しかし、再帰的遷移 $h{t+1} = f(h_t, x_t)$ は完全な $h_t$ に依存しています。読み出し重み行列の転置 $R^T$ の範囲に直交する状態次元は、$h_{t+1}$ に影響を与えているにもかかわらず、交差エントロピー損失から直接的な勾配寄与をゼロしか受け取りません。
これはフィードフォワードアーキテクチャとは異なります。フィードフォワードモデルでは、すべての隠れ活性化が即座の出力に寄与し、したがって直接的な教師信号を受け取ります。ロープドモデルでは、教師信号を受けない状態次元が反復を通じて蓄積し、エラーが再帰的フィードバックを通じて乗法的に複合します。読み出し関数は暗黙的な情報ボトルネックとして機能し、どの状態情報がタスク指向の勾配信号を受け取り、どの情報が教師信号を受けないパスを通じて伝播するかを決定します。
- 仮定:* 読み出し関数が線形投影(現代の言語モデルで標準的)であり、交差エントロピー損失が主要な訓練目的であると仮定します。非線形読み出し関数はこの現象を変更しますが、排除はしません。
盲点の測定:教師信号を受けない動的特性の定量化
教師信号カバレッジを定量化するため、勾配フロー分析を採用します。交差エントロピー損失から読み出し層を通じて隠れ状態成分への逆伝播における勾配の大きさを追跡します。次元 $i$ の教師信号比を次のように定義します:
$$\text{Supervision Ratio}i = \frac{\left|\frac{\partial \mathcal{L}{CE}}{\partial h_t^{(i)}}\right|}{\max_j \left|\frac{\partial \mathcal{L}_{CE}}{\partial h_t^{(j)}}\right|}$$
テストされたアーキテクチャ全体(トランスフォーマーベースの再帰的変種およびLSTM派生のロープドモデルを含み、隠れ次元は1024から4096の範囲)において、一貫したパターンが観察されます。隠れ状態次元の30~60%が $10^{-2}$ 未満の教師信号比を示し、読み出し隣接次元よりも少なくとも2桁小さい勾配を示しています。これらの弱く教師信号を受ける次元は、読み出し重み行列の特異値分解によって決定される再帰的遷移計算に対応する部分空間に集中しています。
アブレーション研究により、これらの次元をゼロにするとタスク性能が5~25%低下することが確認され、最小限の勾配フィードバックを受けているにもかかわらず、それらが積極的に計算に参加していることが確立されます。盲点次元は3つの特徴的な特性を示します:
- 反復間分散の増加: 盲点次元は、よく教師信号を受ける次元と比較して、ループタイムステップ全体で3~5倍大きい分散を示します。
- 初期化感度: モデル性能は盲点次元の初期化に対してより大きな感度を示し、勾配ベースの訓練が提供する堅牢性が欠けていることを示唆しています。
- 分布シフト脆弱性: 入力分布が訓練データを超えてシフトする場合、盲点次元は教師信号を受ける次元よりも性能をより深刻に低下させます。
この現象はループ深度とともに強まります。早期ループの状態変数への勾配は、複数の再帰的ステップを通じて逆伝播するにつれて指数関数的に減衰し、再帰的ネットワーク文献に記録されている勾配消失パターンに従います(Hochreiter et al., 1991; Bengio et al., 1994)。しかし、古典的な勾配消失問題とは異なり、アーキテクチャ修正(例えば、ゲーティング機構)を通じて対処可能ですが、読み出し盲点は最新の最適化技術とアーキテクチャセーフガードでも持続します。
- データポイント:* 2048次元の隠れ状態と50,000トークン語彙では、読み出し重み行列のランクは最大50,000です。約1,948次元が読み出し転置の零空間に位置し、直接的な勾配寄与をゼロしか受け取りません。
行動的帰結:教師信号を受けない状態が生成を駆動する場合
生成中、特にループ数が訓練分布長を超える長文脈シナリオでは、盲点動的特性が反復を通じて複合し、3つの文書化された失敗モードを生成します:
-
意味的ドリフト:* 生成されたシーケンスは、教師信号を受けない状態次元が小さな偏差を蓄積するにつれて、意図された意味から徐々に乖離します。これらの偏差は再帰的フィードバックを通じて増幅され、モデルが訓練中に遭遇したことのない状態空間を探索させます。定量的には、固定プロンプトの継続に対してBLEURT スコア(Sellam et al., 2020)を使用して意味的一貫性を測定します。補助的な教師信号なしのモデルは500トークンを超えて意味的一貫性が15~30%低下し、意味的ドリフトは盲点次元分散と強く相関します($r = 0.78$)。
-
モード崩壊:* 教師信号圧力がなければ、特定の状態次元は反復的なトークンシーケンスを生成するアトラクタ状態に収束します。補助的な教師信号なしで40~60%の長生成実行でこれが観察され、モデルはほぼ同一のフレーズを繰り返し生成します。分析により、これらのアトラクタは盲点次元が安定化する再帰的動的特性の固定点に対応し、トークン繰り返しを強化するフィードバックループを作成することが示されています。
-
敵対的脆弱性:* 盲点次元への標的化された摂動は、不釣り合いな出力変化を生成します。盲点次元に小さなノイズ($\epsilon = 0.01$)を追加しながら教師信号を受ける次元を固定することで敵対的例を構築します。これらの摂動は、よく教師信号を受ける次元への同等の摂動よりも5~15倍大きい出力変化を引き起こします。これは盲点次元が勾配ベースの訓練が提供する堅牢性を欠いていることを示しています。
失敗した生成の定量的分析により、盲点次元は失敗ケースで状態分散の40~70%に寄与していることが示され、成功した出力中は少数派分散を表しています。この反転(通常は小さなコンポーネントが失敗中に支配的になる)は、盲点次元が安定した生成動的特性を維持するために必要な制約を欠いていることを示しています。
- 参考:* これは安全フィルタリングされたモデルの教師信号回避脆弱性(Soares et al., 2023)を反映しており、意図された制約と実際のモデル動作の間のギャップが悪用可能な弱点を作成します。読み出し盲点は根本的なアーキテクチャ脆弱性を表しています。教師信号不完全性は訓練問題ではなく、データスケーリングまたは最適化改善を通じて解決可能なものではありません。それは読み出しボトルネック設計に固有のものです。
補助的教師信号戦略:ギャップを閉じる
読み出しボトルネックを超えて教師信号を拡張する4つのアプローチを評価します:
-
状態再構成損失* は、モデルが将来のタイムステップで独自の隠れ状態を予測することを要求する補助的な目的を追加します:$\mathcal{L}{recon} = |h{t+k} - \hat{h}_{t+k}|2^2$。ここで $\hat{h}{t+k}$ は $h_t$ から予測されます。これにより、モデルは現在の隠れ状態に将来の状態情報をエンコードするよう強制され、すべての次元を間接的に教師信号します。
-
対比的状態目的* は、類似したコンテキストからの隠れ状態をクラスタ化しながら異なるものから発散させることを促進し、次のような目的を使用します:$\mathcal{L}_{contrast} = -\log \frac{\exp(sim(h_t, h_t^+)/\tau)}{\sum_j \exp(sim(h_t, h_j^-)/\tau)}$。ここで $h_t^+$ と $h_j^-$ は正と負の例です。
-
正則化ペナルティ* は盲点次元が恣意的に成長することを防ぎ、$\mathcal{L}{reg} = \lambda \sum{i \in \text{blind}} (h_t^{(i)})^2$ のような目的を通じて実現されます。ここで盲点次元は事前分析を通じて識別されます。
-
多段階読み出し* は中間ループ反復で追加の読み出し層を導入し、各段階で交差エントロピー損失を適用します。これにより、早期ループ状態への勾配フローが増加し、深い再帰を通じた減衰が軽減されます。
これらの戦略を、補助的教師信号なしのベースラインと比較して評価します。結果は一貫したパターンを示します。すべての補助的教師信号手法は盲点次元の教師信号比を改善し、平均して1.5~3倍の増加を達成します。状態再構成損失は最も強力な効果を示し、盲点次元の教師信号比を平均2.8倍増加させ、長文脈生成における意味的ドリフトを20~35%削減します。対比的状態目的はモード崩壊を軽減し、反復的生成の発生率を40~60%から15~25%に削減します。正則化ペナルティは敵対的脆弱性を改善し、盲点摂動に対する出力変化を5~15倍から2~4倍に削減します。多段階読み出しは早期ループ状態への勾配フローを改善しますが、計算コストが大幅に増加します(訓練時間が30~50%増加)。
- トレードオフ:* 補助的教師信号は計算コストを増加させます。状態再構成損失は訓練時間を15~25%増加させ、対比的目的は負例のサンプリングのために20~30%増加させます。多段階読み出しは最も高価で、30~50%の増加です。正則化ペナルティは最小限のオーバーヘッド(5%未満)を追加しますが、効果も最も弱いです。

- 図2:読み出し層を通じた勾配フロー。直交する状態次元は監督信号を受け取らず、有効な学習次元が語彙サイズ V に制限される*

- 図7:補助監督戦略の比較。各手法による非監督次元への勾配導入メカニズム*