AIペルソナによるRAG評価システム 03
Work 03 — AI / RAG

AIペルソナによるRAG評価システム

個人開発

RAG(検索拡張生成)システムの回答品質を、多様なAIペルソナとの模擬対話で自動評価するパイプラインです。年齢・職業・関心などの属性を持つ人物像をプロンプトに変換し、質問応答をシミュレーションします。

1.7GB規模のペルソナデータセットは、全件ダウンロードせずストリーミングで必要な分だけ取得し、評価コストを抑制。結果はCSVに自動集計し、回答品質の傾向分析にそのまま使える形で出力します。

  • 大規模データセットのストリーミングサンプリング
  • ペルソナ属性のプロンプト自動生成
  • 模擬インタビュー・質問応答シミュレーション
  • LLM APIを用いた回答品質の自動評価
  • 評価結果の自動集計・CSV出力
Python RAG LLM API pandas データセットストリーミング
← Prev All Works Next →