RAG評価とは?検索と生成を分けて測る指標の基本
RAGの精度を「なんとなく」で判断していませんか。検索側のコンテキストリコール/プレシジョンと、生成側の忠実性/応答関連性に分けて測る、RAG評価の基本を整理しました。
AIRAGの精度を「なんとなく」で判断していませんか。検索側のコンテキストリコール/プレシジョンと、生成側の忠実性/応答関連性に分けて測る、RAG評価の基本を整理しました。
AIAIエージェントの「ハーネス」とは何か。同じモデルを9種のハーネスで走らせたら1タスクのコストが17倍開いた公開評価と、Anthropicの設計指針をもとに、結果とコストが変わる理由を整理しました。
AIAIエージェントの「メモリ」とは何か。コンテキストウィンドウとの違い、スレッド内で完結する短期記憶とスレッドをまたぐ長期記憶の線引き、意味記憶・エピソード記憶・手続き記憶の使い分けを整理しました。
AIシステムプロンプトは、毎回の質問より先に効く「変わらない前提」を置く枠です。userメッセージとの優先順位の違い、書くべき内容、キャッシュや漏えいの落とし穴まで整理しました。
AIAIエージェントが外部ツールを使う土台となるファンクションコーリングを整理しました。モデルが返すのは実行結果ではなく呼び出しの申告であり、実際に動かすのは自分のコードだという分担を、一次情報をもとに解説します。
AI8月31日〜9月6日の生成AIの動き。Claude Fable 5.1 の登場とキャッシュ4分の1、GPT-6 Astra の公開と枠、OpenAI が自社エージェントの「wiki事件」を認めた件まで出典つきでまとめます。
AIハイブリッド検索は、キーワード検索とベクトル検索を並列に走らせて結果を統合する手法です。定番の統合手法RRFがスコアではなく順位を足す理由と、効く場面・効かない場面を整理しました。
AIベクトル検索で拾った候補をクロスエンコーダで採点し直すリランキングの仕組みを、一次検索との役割分担・100件だけ並べ替える理由・Cohere Rerankの使い方から整理しました。
AIRAGの説明に必ず出てくるベクトルデータベースを、pgvectorの実例で整理しました。厳密検索と近似索引の違い、専用サービスとPostgreSQL拡張の使い分け、入れる前に決まる落とし穴まで。
AIプロンプトキャッシュの仕組みと料金の考え方を整理しました。先頭一致で効く性質、読み出し0.1倍と書き込み割増の損益分岐、最低トークン数の落とし穴までまとめています。