Autognosis

自分の認知と学習を静かに磨くデジタルノート

速く流れていく情報から少し離れ、自分の頭でじっくり考えられる文章だけを集めています。

更新

2026/9/20

Tag

#表現学習

AI・機械学習
2026年9月17日 14:38
Abstract visualization of interconnected graph neural networks with misaligned structures, showing fragmented connections between nodes in blue and purple tones against a dark gradient background, representing challenges in multi-task graph pre-training

タスク固有プロンプトとグローバルコンテキストを用いたマルチタスクグラフ事前学習

タスク固有プロンプトとグローバルコンテキストを用いたマルチタスクグラフ事前学習 マルチタスクグラフ事前学習における不整合問題 マルチタスクグラフ事前学習フレームワークは、根本的な構造的不整合に直面しています。ランダムに初期化されたプロンプトは、事前学習された知識を下流タスクに効果的に転移させるために必要な帰納的バイアスを欠いています。この不整合は、それぞれが文書化された結果をもたらす3つの異なる失敗モードを通じて現れます。 第一に、弱いタスク関連性*...

-- いいね数
続きを読む
AI・機械学習
2026年8月27日 10:31
Abstract visualization of transformer neural network layers showing colorful token embedding clusters evolving and organizing across multiple transparent geometric planes from chaotic to structured patterns

トランスフォーマーを幾何学として捉える:層別表現進化がなぜ重要か

トランスフォーマーを幾何学として捉える:層別表現進化がなぜ重要か トランスフォーマーは言語タスクとビジョンタスク全般で最先端の性能を達成していますが、その学習メカニズムは依然として完全には特性化されていません。解釈可能性研究の大多数は二つの異なるスケールで動作しています。微視的スケール(個別の注意ヘッド、特定のニューロン)と巨視的スケール(最終出力ロジット、集約損失関数)です。ここに重要な欠落が生じています。中視的スケール、つまり層スタック全体にわたる表現幾何学の...

-- いいね数
続きを読む
AI・機械学習
2026年6月12日 09:37
Abstract visualization of a neural network with a highlighted modified connection, suggesting the concept of knowledge editing in AI models and the distinction between behavioral changes and internal representations

すべてを支配する一つのマスク:編集後の隠れた事実と、それを見つける方法について

すべてを支配する一つのマスク:編集後の隠れた事実と、それを見つける方法について 外科的精密性の幻想 知識編集手法、特にROME(Rank-One Model Editing)とMEMIT(Mass-Editing Memory in a Transformer)は、トランスフォーマーモデルにおける標的化された事実更新のメカニズムとして提示されています。理論的な約束は単純明快です。特定のMLP(多層パーセプトロン)の重みを修正することで、実践者は新しい事実主張...

-- いいね数
続きを読む
AI・機械学習
2026年3月14日 20:28
Cross-section visualization of an AI neural network showing two layers: a clean surface layer with organized blue pathways and a deeper layer with fading red geometric patterns representing harmful representations being erased from the model's latent space

表現消去ベースの選好最適化によるLLMの有害性除去

表現消去ベースの選好最適化によるLLMの有害性除去 現在のLLM安全性における表面性の問題 既存の選好最適化技術—Direct Preference Optimization(DPO)、Negative Preference Optimization(NPO)、および関連手法を含む—は主に出力確率分布を修正することで行動レベルで機能します。しかし、機械的解釈可能性研究からの経験的証拠は、そのような訓練後も潜在空間に有害な表現構造が残存することを示唆していま...

-- いいね数
続きを読む
TOPへ