このラボでは、社内ヘルプデスク ボットの回答を「評価データ」で採点し、システム メッセージを変えたときに品質が上がったか下がったかを数値で示します。生成 AI の導入では「どれくらい正しいのか」を顧客に説明できることが受注と継続の分かれ目になります。
学習目標:
- Azure OpenAI に小型モデルのデプロイ
chat を用意し、評価器(judge)としても使う
- 評価データ(質問・根拠・期待回答)を JSONL で用意する
- Azure AI Evaluation SDK の組み込み評価器(Groundedness / Relevance / Coherence / Fluency)で 1 件を採点し、点数と理由を読む
- ボットの回答を一括生成して評価し、平均点を出す
- システム メッセージを変えて再評価し、前後の差を比較する
- 数値の限界(LLM 評価器のぶれ・観点の偏り)を理解する
前提知識:
- Python の基本(辞書・ファイル入出力)
- 「Cloud Shell の Python から Azure OpenAI を呼び出す」ラボ相当の経験
完了条件:
- デプロイ
chat が存在すること
- 評価スクリプトが 5 件以上の回答に対して 4 つの観点の点数を出力し、プロンプト変更の前後で比較できていること
> 評価器も LLM を呼ぶため、1 回の一括評価で数千トークンを消費します。10K TPM の範囲で動くよう件数を絞っています。