アテンションとは?Transformerが文脈を捉える仕組み
アテンションが実際に何を計算しているのかを、Q・K・V とマルチヘッドの役割から整理しました。並列化が効く理由と、長い文脈でコストが跳ね上がる理由が、同じ構造から出てくる話です。
AIアテンションが実際に何を計算しているのかを、Q・K・V とマルチヘッドの役割から整理しました。並列化が効く理由と、長い文脈でコストが跳ね上がる理由が、同じ構造から出てくる話です。
AILLMの生成が遅いのはメモリ帯域が原因。小さなドラフトモデルに数トークン先読みさせ、本命モデルがまとめて検証する投機的デコーディングの仕組みと、出力分布が変わらない理由、効かない場面を整理しました。
AIMoE(Mixture of Experts)が何を節約しているのかを、Mixtral 8x7Bの総47B・活性13Bという数字を手がかりに整理しました。速くなるのは計算で、メモリは減りません。
AIRLHFは人間の評価を報酬に変えてAIの答え方を寄せる学習方法です。3段階の流れ、なぜ模範解答ではなく順位を集めるのか、DPOのような後継手法までを一次論文つきで整理しました。
AIAIを自社仕様に寄せる代表的な手段、ファインチューニング。何が得意で、RAGやプロンプトとどう役割を分けるのかを、追加学習の仕組みから整理します。
Life2025年の歩みを参画した3つのAI関連案件(画像識別、要件定義のAI化、CursorAI開発)をベースに振り返ります。「AIをいかに実務で使い倒すか」を模索し続けた1年。点が線で繋がった感覚と、これからのAI活用に関する知見を凝縮してお伝えします。
AIアンケートで初めて見かけた「NPU」という単語。AI専用のプロセッサとは何なのか、CPUやGPUと何が違うのかを2024年末に調べた記録に、2026年6月の追記を添えています。