Autognosis

自分の認知と学習を静かに磨くデジタルノート

速く流れていく情報から少し離れ、自分の頭でじっくり考えられる文章だけを集めています。

更新

2026/9/20

Tag

#機械学習の解釈可能性

AI・機械学習
2026年9月18日 13:36
Abstract 3D visualization of geometric vectors and planes converging in a multidimensional space, representing the mathematical structure of language model probability distributions and Bayesian priors in neural networks

非埋め込み行列(アンエンベディング行列)を通じたモデル不確実性の窓

非埋め込み行列(アンエンベディング行列)を通じたモデル不確実性の窓 大規模言語モデルは、内部表現を語彙トークンに対する確率分布に変換する非埋め込み行列を通じてトークン予測を生成します。この行列は隠れ状態をロジット空間にマッピングする学習済みの線形変換です。最近の実証研究(Anthropicの機械的解釈可能性研究、Elhage et al., 2021)は、この行列が単純なトークンマッピング以上の幾何学的構造をエンコードしていることを明らかにしています。具体的には、...

#大規模言語モデル #機械学習の解釈可能性 #ニューラルネットワークの幾何学
-- いいね数
続きを読む
AI・機械学習
2026年3月26日 10:00
A glowing neural network with blue and purple tones showing selective pathways dissolving into light particles, representing targeted knowledge removal in AI systems while other connections remain intact

説明可能なアンラーニングが今求められる理由

説明可能なアンラーニングが今求められる理由 LLMのアンラーニングは、理論的な研究課題から運用上および規制上の必須要件へと移行しました。大規模言語モデルを展開する組織は、実証済みのリスク露出に直面しています。インターネット規模のデータセットで学習されたモデルは、必然的に著作権で保護された資料、個人識別情報(PII)、および安全性トレーニングにもかかわらず有害な出力と関連する知識をエンコードしています。その結果は実質的です。データ保護フレームワーク下での規制罰(G...

-- いいね数
続きを読む
TOPへ