LLMルーティングとは?質問ごとにモデルを選ぶ仕組み
簡単な質問は軽いモデルへ、難しい質問は高性能なモデルへ。LLMルーティングの考え方と、先に分類する方式・カスケード方式の違い、導入時のつまずきどころをまとめました。
AI簡単な質問は軽いモデルへ、難しい質問は高性能なモデルへ。LLMルーティングの考え方と、先に分類する方式・カスケード方式の違い、導入時のつまずきどころをまとめました。
AI構造化出力(Structured Outputs)は、JSONスキーマでAIの応答形式を保証する機能です。制約付きデコーディングの仕組み、ファンクションコーリングとの違い、スキーマで守れない範囲まで整理しました。
AIプロンプトキャッシュの仕組みと料金の考え方を整理しました。先頭一致で効く性質、読み出し0.1倍と書き込み割増の損益分岐、最低トークン数の落とし穴までまとめています。
TechHTTPステータスコードは先頭1桁で5つに分類できます。2xxは成功、4xxはこちら側のリクエストの誤り、5xxはサーバー側の問題。実務でよく出る番号と、4xx/5xxの切り分け方をエンジニア目線で整理しました。
AIOllamaで動かしたローカルLLMを、自作スクリプトから呼び出す手順をまとめました。curlでの疎通確認、Python公式ライブラリでの実装、ブラウザから叩くときのOLLAMA_ORIGINSの注意点まで。
Tech外部APIの一時的な失敗に雑なリトライで応じると、かえって障害を広げかねません。指数バックオフとジッターの仕組み、よくある落とし穴、運用のコツを整理します。