モデル 🇷🇺 27.07.2026 09:03

RAG:ベンチマークはコードより重要。「適切な」改善が結果を悪化させたボットの物語

ある開発者が暗号通貨チャットをモデレートするRAGボットを構築したが、標準的な改善(BM25とリランカー)はメトリクスを悪化させるだけだった。唯一効果があったのはカットオフ閾値の調整だった。この記事は、自分のデータでの徹底的なベンチマークの重要性を強調している。
ある開発者が、暗号通貨チャットユーザーへのターゲットサポートを目的としたRAGボットの構築に着手した。このボットは類似のクエリを見つけ、既存の管理者の応答を表示することを目的としている。390万件のメッセージからなるコーパスと51の質問からなる評価セットを用いて、純粋なベクター検索のベースラインのhit@3は74%と測定された。システム改善の試みとして、BM25によるハイブリッド検索とクロスエンコーダーを用いたリランカーを追加した。両方の変更により指標は低下し、ハイブリッドでは55%、リランカーでは64%、ハイブリッドとリランカーの組み合わせでは57%となった。分析の結果、BM25はサンプル質問コーパスに正確なトークンが存在しないために効果がなく、リランカーはすでに良好なランキングを損なわせていたことが判明した。唯一有益だった変更は、カットオフしきい値をボットの役割(最終的な回答者ではなく、フォールバックとして)に合わせて調整したことであり、これにより追加のコードを必要とせずに有用な出力が改善された。主な教訓は、RAGにおいて重要なのは業界のデフォルトではなく、正直な測定とデータクリーニングであるということだ。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース