Azure AI Evaluation SDK で RAG の回答品質を数値で評価する

「なんとなく良さそう」で終わらせず、根拠性・関連性・一貫性・流暢さを LLM 評価器で採点し、プロンプト変更の前後を比較します。生成 AI 案件で顧客に品質を説明するための評価パイプラインの最小形です。

中級約 60 分Azure 実環境

ラボ概要

このラボでは、社内ヘルプデスク ボットの回答を「評価データ」で採点し、システム メッセージを変えたときに品質が上がったか下がったかを数値で示します。生成 AI の導入では「どれくらい正しいのか」を顧客に説明できることが受注と継続の分かれ目になります。

学習目標:

  • Azure OpenAI に小型モデルのデプロイ chat を用意し、評価器(judge)としても使う
  • 評価データ(質問・根拠・期待回答)を JSONL で用意する
  • Azure AI Evaluation SDK の組み込み評価器(Groundedness / Relevance / Coherence / Fluency)で 1 件を採点し、点数と理由を読む
  • ボットの回答を一括生成して評価し、平均点を出す
  • システム メッセージを変えて再評価し、前後の差を比較する
  • 数値の限界(LLM 評価器のぶれ・観点の偏り)を理解する
前提知識:
  • Python の基本(辞書・ファイル入出力)
  • 「Cloud Shell の Python から Azure OpenAI を呼び出す」ラボ相当の経験
完了条件:
  • デプロイ chat が存在すること
  • 評価スクリプトが 5 件以上の回答に対して 4 つの観点の点数を出力し、プロンプト変更の前後で比較できていること
> 評価器も LLM を呼ぶため、1 回の一括評価で数千トークンを消費します。10K TPM の範囲で動くよう件数を絞っています。

ラボの構成

  1. 1Azure Portal にサインインしてラボ環境を確認する
  2. 2Azure OpenAI リソースとデプロイを用意する
  3. 3SDK と環境変数を準備する
  4. 4評価データを用意する
  5. 5評価器で 1 件を採点してみる
  6. 6ボットの回答を一括生成して評価する
  7. 7システム メッセージを変えて再評価し、前後を比較する
  8. 8評価器のぶれを確認する
  9. 9結果を考察する

詳細な手順は、ラボ開始後に画面内のガイドとして表示されます。

手順のプレビュー(最初のステップ)

1. Azure Portal にサインインしてラボ環境を確認する

  • 学習者ポータルに表示されている URL / Username / Password で https://portal.azure.com にサインインする
  • 「サインインの状態を維持しますか?」と表示されたら いいえ を選択する
  • 本ラボ用のリソース グループ(名前が lab- で始まる)を開いて名前を控える
> 注: シークレット(InPrivate)ウィンドウでの操作を推奨します。
残り 8 セクションの手順は、ラボを開始すると画面内に表示されます

構成図

構成図

参考リソース

このラボが対応する試験の模擬問題集

本番形式の問題で理解度を確認できます。各試験とも先頭 15 問は無料です。

AI-103Azure AI Engineer練習テスト 2 回・全 160 問