【正解】C
【0からの解説】
Amazon Bedrock のモデル評価(model evaluation)は、複数の基盤モデルの出力品質を比較・評価するための組み込み機能です。評価方式には次の 2 種類があります。
・自動評価:定義済みメトリクスでアルゴリズム的に採点。
・人間による評価(human evaluation):自社の作業チーム(本問では科学者のチーム)に、複数モデルの出力を提示して評価(好ましさの比較・採点など)してもらうワークフローを構築できます。
「複数の生成 AI モデルのテスト」と「人間のチームによる評価」という 2 つの要件を、Bedrock のモデル評価がそのまま満たします。
【誤りの選択肢】
A:Amazon Personalize はレコメンデーションのサービスであり、生成 AI モデルの出力評価の機能はありません。
B:Amazon Rekognition のコンテンツモデレーションは、画像・動画内の不適切なコンテンツを検出する機能であり、研究論文(テキスト)の品質評価とは無関係です。
D:Amazon Comprehend の感情分析は、テキストのポジティブ/ネガティブを判定する機能であり、生成された論文の品質を科学者が評価するワークフローを提供しません。
【参考】
Amazon Bedrock のモデル評価