LoRAとは?AIモデルを少ないパラメータで微調整する仕組み
LoRAは事前学習済みの重みを凍結したまま、小さな行列のペアだけを学習する手法です。学習パラメータを1万分の1に減らしても精度が保てる理由と、実際に触る設定を整理しました。
AILoRAは事前学習済みの重みを凍結したまま、小さな行列のペアだけを学習する手法です。学習パラメータを1万分の1に減らしても精度が保てる理由と、実際に触る設定を整理しました。
AIMoE(Mixture of Experts)が何を節約しているのかを、Mixtral 8x7Bの総47B・活性13Bという数字を手がかりに整理しました。速くなるのは計算で、メモリは減りません。
AIRLHFは人間の評価を報酬に変えてAIの答え方を寄せる学習方法です。3段階の流れ、なぜ模範解答ではなく順位を集めるのか、DPOのような後継手法までを一次論文つきで整理しました。
AI会話が長くなるとAIの応答が重くなるのはなぜか。KVキャッシュが何を保存しているのか、文脈が伸びるとメモリがどれだけ増えるのか、削るための3つの方向までを順番に整理します。
AIChain of Thought(思考の連鎖)の基本を整理しました。途中の推論を書かせるとなぜ精度が上がるのか、Few-shotとZero-shotの書き分け、推論モデル時代の位置づけとコスト面の落とし穴までをまとめます。
AI生成AIのパラメータ top_k と top_p は、次の1語の候補をどこまで残すかを決めるつまみです。個数で切るか確率の総量で切るかの違いと、同じしきい値でも残る候補数が変わる理由を、実際に計算した数値で整理しました。
AIAIの蒸留(ディスティレーション)を整理しました。教師モデルの確率分布を手本に小さな生徒モデルを訓練する仕組み、ファインチューニングや量子化との違い、モデル選びで気をつけたい点まで一次資料つきでまとめます。
AIAIの回答が毎回ぶれるのは temperature という設定のせい。回答のランダムさを決めるこのつまみの仕組みと、正確さ重視は低め・発想重視は高めという使い分けを整理しました。
AIAIが「意味の近さ」を扱えるのは、言葉を数値ベクトルに変換するエンベディングのおかげです。仕組みと使いどころ、コサイン類似度やRAGとの関係までコード例つきで整理しました。
AIAIを自社仕様に寄せる代表的な手段、ファインチューニング。何が得意で、RAGやプロンプトとどう役割を分けるのかを、追加学習の仕組みから整理します。