Autognosis

自分の認知と学習を静かに磨くデジタルノート

速く流れていく情報から少し離れ、自分の頭でじっくり考えられる文章だけを集めています。

更新

2026/9/20

Tag

#トランスフォーマーアーキテクチャ

AI・機械学習
2026年8月28日 11:08
Technical visualization of a neural network architecture showing locality-aware attention patterns with dense local connections in the foreground and a separate organized knowledge memory structure in the background, rendered in blue and purple tones with glowing cyan accents

現代的言語モデルアーキテクチャにおける効率性のパラドックス

現代的言語モデルアーキテクチャにおける効率性のパラドックス 標準的なトランスフォーマーアーキテクチャは、局所性構造を明示的にエンコードせず、知識表現と計算ルーティングを混同することで、計算上の非効率性を招いています。 大規模言語モデルは実質的な能力向上を示していますが、その基礎的な設計は、モデルがトークン列を大規模に処理して言語能力を発展させるプリトレーニング段階において、体系的な非効率性を示しています。この非効率性は、能力向上の単位あたりの計算コストを...

-- いいね数
続きを読む
AI・機械学習
2026年8月15日 10:32
Split visualization comparing traditional semiconductor thermal simulation taking 8 hours on the left with AI transformer-based surrogate model completing the same analysis in milliseconds on the right, connected by flowing data streams

前置き

前置き トランスフォーマー代理モデルがエンジニアリング設計に進出—しかしスケール不整合がそれらを破壊します トランスフォーマーベースの代理モデルは、半導体設計ワークフローにおいて高コストの第一原理シミュレーションを置き換えています。かつて有限要素法の計算に8時間を要した熱解析が、学習済みモデルを通じてミリ秒単位で実行されます。このスピード向上は実質的なものですが、モデルが訓練データを超えて一般化する場合に限られます。 採用パターンは一貫しています。チーム...

-- いいね数
続きを読む
AI・機械学習
2026年4月3日 15:07
Abstract 3D visualization of rotating geometric structures and spiral patterns in blue and purple, representing rotational positional embeddings in high-dimensional space

フレイドRoPEと長入力:幾何学的視点

フレイドRoPEと長入力:幾何学的視点 回転の幾何学:RoPEが位置をエンコードする仕組み 回転位置埋め込み(RoPE)は、高次元空間のトークン表現に回転行列を適用することで動作します。回転角は位置インデックスに比例します(Su et al., 2021)。形式的には、位置mにあるトークンについて、次元ペア(2i, 2i+1)は角度θi·mだけ回転します。ここでθi = 10,000^(-2i/d)であり、dはモデルの次元です。この構成により、トークン...

-- いいね数
続きを読む
TOPへ