LLMルーティングとは?質問ごとにモデルを選ぶ仕組み
簡単な質問は軽いモデルへ、難しい質問は高性能なモデルへ。LLMルーティングの考え方と、先に分類する方式・カスケード方式の違い、導入時のつまずきどころをまとめました。
AI簡単な質問は軽いモデルへ、難しい質問は高性能なモデルへ。LLMルーティングの考え方と、先に分類する方式・カスケード方式の違い、導入時のつまずきどころをまとめました。
AIAIの出力をAIに採点させるLLM-as-a-Judgeの仕組みと、位置・冗長性・自己強化という3つのバイアス、実務での置き方を論文をもとに整理しました。
AIAgent Skillsは、手順やスクリプトをフォルダにまとめてAIエージェントに持たせる仕組みです。SKILL.mdの書き方と、必要な分だけ読み込む段階的な開示の考え方、使う前の注意点をまとめました。
AIReActは推論と行動を交互に繰り返させるプロンプトの型です。ICLR2023の論文が示した仕組みと効果、いまのエージェント実装に残っているループと落とし穴を整理しました。
AILLMアプリのガードレールを整理しました。モデルの外側に検査を置く発想、入力から出力までの5段階、ルール判定と判定用モデルの違い、そして防げない領域までを一次情報つきでまとめています。
AI構造化出力(Structured Outputs)は、JSONスキーマでAIの応答形式を保証する機能です。制約付きデコーディングの仕組み、ファンクションコーリングとの違い、スキーマで守れない範囲まで整理しました。
AIアテンションが実際に何を計算しているのかを、Q・K・V とマルチヘッドの役割から整理しました。並列化が効く理由と、長い文脈でコストが跳ね上がる理由が、同じ構造から出てくる話です。
AILLMの生成が遅いのはメモリ帯域が原因。小さなドラフトモデルに数トークン先読みさせ、本命モデルがまとめて検証する投機的デコーディングの仕組みと、出力分布が変わらない理由、効かない場面を整理しました。
AIRAGの精度を「なんとなく」で判断していませんか。検索側のコンテキストリコール/プレシジョンと、生成側の忠実性/応答関連性に分けて測る、RAG評価の基本を整理しました。
AIAIエージェントの「ハーネス」とは何か。同じモデルを9種のハーネスで走らせたら1タスクのコストが17倍開いた公開評価と、Anthropicの設計指針をもとに、結果とコストが変わる理由を整理しました。