Autognosis

自分の認知と学習を静かに磨くデジタルノート

速く流れていく情報から少し離れ、自分の頭でじっくり考えられる文章だけを集めています。

更新

2026/9/20

Tag

#量子化

AI・機械学習
2026年9月3日 17:33
Technical illustration showing a continuous mathematical curve transforming into probabilistic discrete blocks, representing the concept of adaptive stochastic quantization

適応的確率量子化:現代的MLのための不偏圧縮

適応的確率量子化:現代的MLのための不偏圧縮 適応的確率量子化(ASQ)は、量子化操作の扱い方において決定論的量子化手法と根本的に異なる確率的圧縮技術です。決定論的手法が浮動小数点値を固定された離散レベルにマッピングするのに対し、ASQは隣接する量子化レベル上の確率分布を割り当てます。その結果、量子化出力の期待値が元の入力値と等しくなります。これは形式的には期待値における不偏性(Bengio et al., 2013; Zhou et al., 2016)として定...

-- いいね数
続きを読む
Abstract visualization of a ternary quantization network showing interconnected nodes in three distinct states, representing the compression mechanism of the Ternlight embedding model with geometric vectors in three-dimensional space

Ternlight – ブラウザで動作する7 MBの埋め込みモデル(WASM)

Ternlight – ブラウザで動作する7 MBの埋め込みモデル(WASM) 極限圧縮のアーキテクチャ Ternlightは三値量子化という手法を通じて7 MBのフットプリントを実現しています。この手法はモデルの重みを3つの離散値(−1、0、+1)に制限するものです。このアプローチは確立された知識蒸留の原理に基づいており、より小さなモデルが大規模な埋め込みモデルの出力動作を近似することを学習しながら、意味情報をエンコードする幾何学的関係を保持します。 *...

-- いいね数
続きを読む
Technical illustration of a unified memory chip architecture showing processor cores connected to shared memory through glowing data pathways on a dark background

M4の24GBメモリでローカルモデルを実行する

M4の24GBメモリでローカルモデルを実行する M4のユニファイドメモリアーキテクチャ:ローカル推論の新しい閾値 24GBのユニファイドメモリを搭載したM4チップは、ローカルモデル推論において明確なアーキテクチャ上の優位性をもたらします。従来のCPU-GPUシステムでは、分離されたメモリプールが計算ユニット間の明示的なデータ転送を必要とするのに対し、M4のユニファイドメモリアーキテクチャは、ニューラルエンジン、GPU、CPUが中間的なコピーオーバーヘッドなし...

-- いいね数
続きを読む
AI・機械学習
2026年1月15日 22:03
A technical visualization depicting neural network compression, showing a dense network of glowing blue nodes transforming into a sparse, efficient structure with fewer green nodes, illustrating the concept of hierarchical sparse plus low-rank compression in large language models

LLMの階層的スパース+低ランク圧縮

LLMの階層的スパース+低ランク圧縮 現代のLLMにおけるメモリ危機 主張: 大規模言語モデルは現在、法外な量のメモリと計算資源を消費しており、実用的な展開と継続的な訓練のために圧縮は交渉の余地のない要件となっている。 前提条件と仮定: - モデルは事前量子化なしで完全精度(FP32)または半精度(FP16)で保存されている。 - 展開対象には、リソース制約のある環境(エッジデバイス、小規模クラスタ)またはコスト重視の推論シナリオが含まれる...

-- いいね数
続きを読む
TOPへ