アテンションとは?Transformerが文脈を捉える仕組み
アテンションが実際に何を計算しているのかを、Q・K・V とマルチヘッドの役割から整理しました。並列化が効く理由と、長い文脈でコストが跳ね上がる理由が、同じ構造から出てくる話です。
AIアテンションが実際に何を計算しているのかを、Q・K・V とマルチヘッドの役割から整理しました。並列化が効く理由と、長い文脈でコストが跳ね上がる理由が、同じ構造から出てくる話です。
AIプロンプトキャッシュの仕組みと料金の考え方を整理しました。先頭一致で効く性質、読み出し0.1倍と書き込み割増の損益分岐、最低トークン数の落とし穴までまとめています。
AIAIの蒸留(ディスティレーション)を整理しました。教師モデルの確率分布を手本に小さな生徒モデルを訓練する仕組み、ファインチューニングや量子化との違い、モデル選びで気をつけたい点まで一次資料つきでまとめます。
AI生成AIで必ず出てくる「トークン」という単位を整理します。1トークンの目安、料金とコンテキスト上限に効く理由、日本語が英語より重くなる仕組みまで、順番に解説します。