LLM-as-a-Judgeとは?AIがAIを採点する仕組み
AIの出力をAIに採点させるLLM-as-a-Judgeの仕組みと、位置・冗長性・自己強化という3つのバイアス、実務での置き方を論文をもとに整理しました。
AIAIの出力をAIに採点させるLLM-as-a-Judgeの仕組みと、位置・冗長性・自己強化という3つのバイアス、実務での置き方を論文をもとに整理しました。
AIRAGの精度を「なんとなく」で判断していませんか。検索側のコンテキストリコール/プレシジョンと、生成側の忠実性/応答関連性に分けて測る、RAG評価の基本を整理しました。
AIハイブリッド検索は、キーワード検索とベクトル検索を並列に走らせて結果を統合する手法です。定番の統合手法RRFがスコアではなく順位を足す理由と、効く場面・効かない場面を整理しました。
AIベクトル検索で拾った候補をクロスエンコーダで採点し直すリランキングの仕組みを、一次検索との役割分担・100件だけ並べ替える理由・Cohere Rerankの使い方から整理しました。
AIRAGの説明に必ず出てくるベクトルデータベースを、pgvectorの実例で整理しました。厳密検索と近似索引の違い、専用サービスとPostgreSQL拡張の使い分け、入れる前に決まる落とし穴まで。
AIRAGの答えがずれる原因は、モデルより先に「文書の切り方」にあります。チャンクの大きさが検索の解像度を決める理由、オーバーラップが効く場面、固定長・区切り文字・構造という3つの分け方の違いを整理しました。
AIAIが最近の出来事を知らない理由、知識カットオフを整理しました。公式ドキュメントが併記する「信頼できるカットオフ」と「学習データのカットオフ」の違いから、足りない知識を外から渡す考え方まで。
AIAIが「意味の近さ」を扱えるのは、言葉を数値ベクトルに変換するエンベディングのおかげです。仕組みと使いどころ、コサイン類似度やRAGとの関係までコード例つきで整理しました。
AIAIを自社仕様に寄せる代表的な手段、ファインチューニング。何が得意で、RAGやプロンプトとどう役割を分けるのかを、追加学習の仕組みから整理します。
AIRAG(検索拡張生成)は、質問に関係する文書を検索してプロンプトへ足し、AIに最新・非公開の知識を踏まえて答えさせる仕組み。必要な理由・基本の流れ・ファインチューニングとの違いまで整理しました。