評価の盲点:大規模言語モデルのベンチマークカバレッジに関する立体幾何学的理論
評価の盲点:大規模言語モデルのベンチマークカバレッジに関する立体幾何学的理論 テーゼ:ベンチマークスコアは隠すものが明かすものより多い 現在のLLM評価は、真の能力プロファイルに関する根本的な不確実性を曖昧にする集約ベンチマークスコアに依存しています。立体幾何学的フレームワークは、競争的なリーダーボード上で、同一の観測スコアと一致する構造的に異なる複数の能力マップが存在することを明らかにします。この盲点—測定されていない妥当な能力構成の集合—は測定ノイズの...