模擬問題集一覧

MLA-C01 模擬問題集(練習問題)

AWS Machine Learning Engineer – Associate 合格に向けた本番形式の模擬問題集。すべての問題に詳しい解説と、ドメイン別の弱点分析つき。

4 練習テスト 200 問 合格ライン 70% 各 120 分

この模擬問題集で身につくこと

  • 本番と同じ形式・難易度の問題で実力を確認
  • 制限時間つきの試験モードで時間配分を体得
  • 演習モードで1問ずつ解説を読みながら学習
  • すべての問題に正解の根拠つきの詳しい解説
  • ドメイン別スコアで弱点分野をひと目で把握
  • 完了後も何度でも復習して本番前に仕上げ

練習テストの内容

4 テスト · 全 200 問
1
模擬問題集①先頭 15 問 無料
50 問 120 分 合格 70%
2
模擬問題集② プラン限定
50 問 120 分 合格 70%
3
模擬問題集③ プラン限定
50 問 120 分 合格 70%
4
模擬問題集④ プラン限定
50 問 120 分 合格 70%

説明

MLA-C01(AWS Machine Learning Engineer – Associate)の合格に向けた、本番形式の模擬問題集です。全 200 問を4 回の練習テストに分割し、 試験モード/演習モードで受験できます。各問題には正解の根拠と誤答の理由を記した詳しい解説が付き、受験後はドメイン別のスコアで弱点を把握できます。 各試験は先頭の問題から無料でお試しいただけます。

月額 ¥980 で全 200 問+全解説が受け放題

模試プラン(¥980/月)なら、ロックされた練習テストと詳しい解説、ドメイン別の弱点分析がすべて使い放題。本番に向けて実力を仕上げましょう。

MLA-C01 の出題範囲(カバーしている分野)

全 200 問を、本番の試験ガイドに沿った次の分野から出題しています。 受験後はドメイン別の正答率が表示され、弱点が特定できます。 難易度・学習時間・合格までの進め方はMLA-C01 の学習ガイドにまとめています。

MLA-C01 の無料練習問題(15 問・解説つき)

会員登録なしで、全 200 問のうち 15 問を正解と解説つきでご覧いただけます。 問題をクリックすると選択肢と解説が開きます。

問題 1最も少ない運用負荷でこれらの要件を満たすソリューションはどれですか?MLソリューションの監視・保守・セキュリティ
問題
ある ML エンジニアは、A/B テストを使用してレコメンデーションモデルを動的に選択しています。モデルは Amazon SageMaker AI エンドポイントにデプロイされています。ML エンジニアは、エンドポイントが呼び出されたときのレイテンシ、呼び出し量、HTTP ステータスコードなどのシステムメトリクスを監視する必要があります。 最も少ない運用負荷でこれらの要件を満たすソリューションはどれですか?

選択肢と解説

  • 1
    AWS X-Ray トレーシングを使用して SageMaker AI エンドポイントを監視する。
  • ✓
    AWS Lambda ログプロセッサを備えた Amazon CloudWatch ダッシュボードを構成する。
  • 3
    AWS Identity and Access Management(IAM)Access Analyzer を有効にして、SageMaker AI エンドポイントのメトリクスを追跡する。
  • 4
    SageMaker AI エンドポイントインスタンスに AWS Trusted Advisor のチェックをデプロイする。

解説

【正解】B

【0からの解説】
Amazon SageMaker AI のエンドポイントは、呼び出しに関するメトリクスを Amazon CloudWatch に自動的に発行します。具体的には、Invocations(呼び出し量)、ModelLatency/OverheadLatency(レイテンシ)、Invocation4XXErrors/Invocation5XXErrors(HTTP ステータスコード系のエラー)などが組み込みで提供されます。つまり、本問で求められている「レイテンシ・呼び出し量・HTTP ステータスコード」は、まさに CloudWatch が標準で収集しているメトリクスそのものです。

CloudWatch ダッシュボードを構成すれば、これらのメトリクスを一画面で可視化でき、A/B テスト中の複数モデル(プロダクションバリアント別のメトリクスも提供される)の比較監視ができます。ログの詳細な加工が必要な場合には Lambda によるログ処理を補助的に追加できますが、基盤は CloudWatch のネイティブ統合であり、選択肢の中で最も運用負荷が小さい構成です。

【誤りの選択肢】
A:AWS X-Ray は分散トレーシング(リクエストがサービス間をどう流れたかの追跡)のためのサービスです。利用するには呼び出し側アプリケーションへの SDK 計装が必要で、エンドポイントのシステムメトリクスの監視には CloudWatch のネイティブメトリクスを使うほうがはるかに簡単です。
C:IAM Access Analyzer は、リソースが外部と共有されていないかなどアクセス権限を分析するセキュリティサービスであり、パフォーマンスメトリクスの追跡機能はありません。
D:AWS Trusted Advisor は、コスト最適化やセキュリティのベストプラクティスをチェックするサービスであり、エンドポイントのリアルタイムなシステムメトリクス監視には使えません。

【参考】
CloudWatch による Amazon SageMaker AI のモニタリング
Amazon CloudWatch ダッシュボード
この問題のページを開く →
問題 2これらの要件を満たすソリューションはどれですか?MLソリューションの監視・保守・セキュリティ
問題
ある企業は、顧客行動を予測する ML モデルを構築するために Amazon SageMaker AI を使用しています。同社は、モデルにおけるバイアスを監査人に説明する必要があります。説明は、顧客の人口統計(デモグラフィック)データに焦点を当てなければなりません。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • ✓
    SageMaker Clarify を使用してバイアスレポートを生成する。レポートを監査人に送付する。
  • 2
    AWS Glue DataBrew を使用してモデルのデータ品質のドリフトを検出するジョブを作成する。ジョブの出力を監査人に送付する。
  • 3
    Amazon Quick Suite(旧 Amazon QuickSight)と SageMaker AI の統合を使用して、Quick Suite からバイアスレポートを生成する。レポートを監査人に送付する。
  • 4
    SageMaker AI 名前空間の Amazon CloudWatch メトリクスを使用してバイアスダッシュボードを作成する。ダッシュボードを監査人と共有する。

解説

【正解】A

【0からの解説】
「バイアス」とは、モデルの予測やデータが、性別・年齢・地域などの特定の属性グループに対して不公平な偏りを持つことです。AWS でバイアスの検出・説明を担う専用機能が Amazon SageMaker Clarify です。
・Clarify は、人口統計データなどの「ファセット(注目する属性列)」を指定して、学習前のデータバイアス(クラス不均衡など)と学習後のモデルバイアス(グループ間の予測の偏り)を多数の統計指標で計算し、バイアスレポートとして出力します。
・レポートには指標の意味や値が整理されて含まれるため、監査人への説明資料としてそのまま利用できます。これは規制対応・監査対応の典型的なユースケースです。

【誤りの選択肢】
B:AWS Glue DataBrew はデータの前処理・クレンジングを GUI で行うサービスであり、「モデルのバイアスの説明」を生成する機能はありません。データ品質のドリフト検出はバイアス分析とは別物です。
C:Quick Suite(QuickSight)は BI(可視化)サービスです。SageMaker との統合は予測結果の可視化などに使えますが、人口統計データに基づくバイアス指標を計算するバイアスレポート機能は提供しません。
D:CloudWatch の SageMaker 名前空間のメトリクスは、呼び出し数やレイテンシなどの運用メトリクスであり、バイアスに関する指標は含まれていません。

【参考】
SageMaker Clarify による公平性とモデル説明可能性
SageMaker Clarify のバイアス検出
この問題のページを開く →
問題 3これらの要件を満たすソリューションはどれですか?MLワークフローのデプロイとオーケストレーション
問題
あるレコメンデーションモデルは ML を使用しており、レコメンデーションを取得するために Amazon SageMaker AI エンドポイントを呼び出します。ML エンジニアは、予想されるユーザートラフィックの増加の間、モデルが利用可能であり続けることを保証しなければなりません。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • ✓
    SageMaker AI エンドポイントで自動スケーリング(オートスケーリング)を構成する。
  • 2
    新しい SageMaker AI エンドポイントを作成する。モデルを新しいエンドポイントにデプロイする。
  • 3
    SageMaker Neo を使用して、モデルを推論向けに最適化する。
  • 4
    SageMaker AI エンドポイントに Auto Scaling グループをアタッチする。

解説

【正解】A

【0からの解説】
Amazon SageMaker AI のリアルタイム推論エンドポイントは、Application Auto Scaling と統合されており、エンドポイント自体に自動スケーリングポリシーを構成できます。たとえば「インスタンスあたりの呼び出し数(SageMakerVariantInvocationsPerInstance)」をターゲットメトリクスに設定すると、トラフィックの増加に応じてエンドポイントを支えるインスタンス数が自動的に増減します。これにより、トラフィック増加時にも応答性と可用性が維持されます。

【誤りの選択肢】
B:新しいエンドポイントを追加で作成しても、トラフィックを振り分ける仕組みがなければ可用性は向上しません。スケーリングの自動化にもならず、手動管理の負担が増えるだけです。
C:SageMaker Neo はモデルを特定のハードウェア向けにコンパイル・最適化する機能です。1 リクエストあたりの推論は速くなる可能性がありますが、トラフィック増加に応じてキャパシティを増やす仕組みではないため、急増時の可用性は保証できません。
D:「Auto Scaling グループ」は Amazon EC2 のインスタンス群を管理する仕組みであり、SageMaker エンドポイントにアタッチすることはできません。SageMaker のスケーリングは Application Auto Scaling によるエンドポイントのスケーリングポリシーとして構成します(用語のひっかけです)。

【参考】
Amazon SageMaker AI モデルの自動スケーリング
この問題のページを開く →
問題 4これらの要件を満たすソリューションはどれですか?機械学習のためのデータ準備
問題
ある企業は、Amazon SageMaker AI で新しい ML モデルをトレーニングするためのデータを準備しています。このデータは、これまで ML トレーニングに使用されたことがありません。データには重複が含まれており、一部の値が欠損しています。 同社は、データ品質を高め、データ内の統計的バイアスを検出する必要があります。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • 1
    SageMaker Clarify を使用してデータ品質ルールを作成する。SageMaker Model Monitor を使用してバイアスを検出する。
  • ✓
    SageMaker Data Wrangler を使用してデータ品質ルールを作成する。SageMaker Clarify を使用してバイアスを検出する。
  • 3
    SageMaker Debugger を使用してデータ品質ルールを作成する。SageMaker Model Monitor を使用してバイアスを検出する。
  • 4
    SageMaker Model Monitor を使用してデータ品質ルールを作成する。SageMaker Clarify を使用してバイアスを検出する。

解説

【正解】B

【0からの解説】
SageMaker の類似ツールの役割の使い分けが本問のポイントです。
・SageMaker Data Wrangler:GUI ベースのデータ準備ツール。重複の削除、欠損値の補完などの変換を提供し、「データ品質と洞察レポート(Data Quality and Insights Report)」によってトレーニング前のデータの品質チェック(重複・欠損・外れ値など)ができます。本問の「重複と欠損があるデータの品質を高める」工程に最適です。
・SageMaker Clarify:トレーニング前のデータの統計的バイアス(クラス不均衡、属性グループ間の偏りなど)とトレーニング後のモデルバイアスを検出する専用機能です。
つまり「品質 → Data Wrangler、バイアス → Clarify」という組み合わせの B が正解です。

【誤りの選択肢】
A:役割が逆です。Clarify はバイアス検出・説明可能性のツールでありデータ品質ルールの作成機能はありません。また Model Monitor は本番環境にデプロイ済みのモデルのドリフト監視用で、トレーニング前のデータ分析には使いません。
C:SageMaker Debugger はトレーニングジョブの内部状態(勾配消失、過学習の兆候など)をデバッグする機能であり、データ品質ルールの作成ツールではありません。
D:Model Monitor のデータ品質監視は「本番エンドポイントへの入力データ」をベースラインと比較する機能で、初めて使うデータのトレーニング前の品質改善には適しません。バイアス検出の Clarify は正しいものの、前半が誤りです。

【参考】
SageMaker Data Wrangler によるデータの準備
SageMaker Clarify のバイアス検出
この問題のページを開く →
問題 5これらの要件を満たすソリューションはどれですか?MLソリューションの監視・保守・セキュリティ
問題
ある保険会社の ML エンジニアが、毎月の保険契約の販売数を予測する回帰モデルをトレーニングしています。モデルのトレーニング後、ML エンジニアは Amazon SageMaker AI を使用して推論用にモデルをデプロイしました。ML エンジニアは、顧客行動に変化があったときに、本番データの分布がトレーニングデータの分布と異なっていないかを検出するために、モデルの予測を監視したいと考えています。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • ✓
    データ品質(data quality)にドリフトがあるかどうかを判定する。
  • 2
    モデル品質(model quality)にドリフトがあるかどうかを判定する。
  • 3
    モデルバイアス(model bias)にドリフトがあるかどうかを判定する。
  • 4
    特徴量アトリビューション(feature attribution)にドリフトがあるかどうかを判定する。

解説

【正解】A

【0からの解説】
Amazon SageMaker Model Monitor には 4 種類の監視タイプがあり、それぞれ検出対象が異なります。
・データ品質(data quality):本番エンドポイントに入ってくるデータの統計的性質(平均・分布・欠損率など)を、トレーニングデータから作成したベースラインと比較し、データ分布の変化(データドリフト)を検出します。
・モデル品質(model quality):実際の正解ラベル(グラウンドトゥルース)と予測を突き合わせ、精度などモデル性能の劣化を検出します。
・バイアスドリフト:属性グループ間の偏りの変化を検出します(SageMaker Clarify と連携)。
・特徴量アトリビューションドリフト:各特徴量が予測に寄与する度合いの変化を検出します。

本問の要件は「本番データの分布がトレーニングデータの分布と異なっていないかの検出」であり、これはデータ品質ドリフトの監視そのものです。顧客行動の変化はまず入力データの分布変化として現れるため、A が正解です。

【誤りの選択肢】
B:モデル品質ドリフトの検出には実際の販売実績(正解ラベル)との比較が必要で、「データ分布の違いの検出」という要件とは対象が異なります。
C:バイアスドリフトは特定の属性グループに対する偏りの変化を見るものであり、全体のデータ分布の変化の検出が目的の本問には合いません。
D:特徴量アトリビューションドリフトは「どの特徴量が予測に効いているか」の変化を見るもので、入力データそのものの分布変化の検出とは別の監視タイプです。

【参考】
SageMaker Model Monitor によるデータ品質ドリフトの監視
Amazon SageMaker Model Monitor
この問題のページを開く →
問題 6ユーザーがレコメンデーションに基づいて行動したかどうかを評価するには、どのメトリクスを使用すべきですか?MLソリューションの監視・保守・セキュリティ
問題
ある企業は、商品レコメンデーションを提供するモデルの A/B テストを実施しています。同社はモデルの 2 つのバージョンをデプロイし、各バージョンをランダムに 50% のユーザーに表示しています。 ユーザーがレコメンデーションに基づいて行動したかどうかを評価するには、どのメトリクスを使用すべきですか?

選択肢と解説

  • ✓
    2 つのモデルバージョン間のコンバージョン率(conversion rate)
  • 2
    各ユーザーに提供されたレコメンデーションの数
  • 3
    ホールドアウトテストデータに対するモデルの精度
  • 4
    モデル推論のレイテンシ

解説

【正解】A

【0からの解説】
A/B テストとは、2 つのバージョンを実際のユーザーにランダムに割り当てて、どちらがビジネス目標に対して優れているかを実環境で比較する手法です。本問の評価したいことは「ユーザーがレコメンデーションに基づいて行動したか」、つまりレコメンデーションが実際の購入やクリックなどの行動につながったかです。

これを直接測る指標が「コンバージョン率」です。コンバージョン率は、レコメンデーションを提示されたユーザーのうち、目的の行動(商品の購入、カート追加など)を実際に行ったユーザーの割合を表します。バージョン A とバージョン B のコンバージョン率を比較すれば、どちらのモデルがユーザーの行動をより効果的に促せたかを定量的に判断できます。

【誤りの選択肢】
B:提供されたレコメンデーションの「数」は配信量を表すだけで、ユーザーがそれに基づいて行動したかどうかは分かりません。
C:ホールドアウトデータでの精度はオフライン評価の指標です。過去データへの当てはまりの良さを測るもので、実際のユーザーが推奨を受けて行動したかという A/B テストの目的(オンライン評価)には答えられません。
D:推論レイテンシは応答速度というシステム性能の指標であり、レコメンデーションの有効性(ユーザーの行動)とは無関係です。

【参考】
SageMaker での本番バリアントを使用した A/B テスト
この問題のページを開く →
問題 7新しい取引に対する不正検出を改善するために、ML エンジニアは何をすべきですか?MLモデルの開発
問題
ある ML エンジニアが、Amazon SageMaker の XGBoost アルゴリズムを使用して不正検出モデルを開発しています。このモデルは、取引を不正または正当のいずれかに分類します。 テストの間、モデルはトレーニングデータセット内の不正の特定には優れています。しかし、新しい未知の取引における不正の特定では効率が悪くなります。 新しい取引に対する不正検出を改善するために、ML エンジニアは何をすべきですか?

選択肢と解説

  • 1
    学習率(learning rate)を上げる。
  • 2
    トレーニングデータセットから無関係な特徴量をいくつか削除する。
  • 3
    max_depth ハイパーパラメータの値を増やす。
  • ✓
    max_depth ハイパーパラメータの値を減らす。

解説

【正解】D

【0からの解説】
「トレーニングデータでは優秀だが、新しい未知のデータでは性能が落ちる」という症状は、過学習(オーバーフィッティング)の典型です。過学習とは、モデルがトレーニングデータの細かいノイズまで暗記してしまい、一般化能力(未知データへの対応力)を失った状態です。

XGBoost は決定木を多数組み合わせるアルゴリズムで、max_depth は各決定木の深さの上限を決めるハイパーパラメータです。木が深いほどモデルは複雑になり、トレーニングデータの細部まで学習できてしまうため過学習しやすくなります。逆に max_depth を減らすと木が浅くなってモデルが単純化され、ノイズの暗記が抑えられて汎化性能が向上します。過学習への対処として最も直接的な選択肢が D です。

【誤りの選択肢】
A:学習率を上げると各ブースティングステップの更新幅が大きくなり、学習が不安定になります。過学習の解消にはならず、一般にはむしろ性能を悪化させる方向です。
B:無関係な特徴量の削除は一般論としては有効なことがありますが、「どの特徴量が無関係か」が特定されていない状況では効果が不確実です。過学習という明確な症状に対しては、モデルの複雑さを直接制御する max_depth の調整が定石です。
C:max_depth を増やすとモデルはさらに複雑になり、過学習が悪化します。症状に対して逆効果の選択肢です。

【参考】
SageMaker XGBoost アルゴリズム
XGBoost のハイパーパラメータ
この問題のページを開く →
問題 8これらの要件を満たすソリューションはどれですか?MLモデルの開発
問題
ある ML エンジニアは、テキスト要約のために大規模言語モデル(LLM)をファインチューニングする必要があり、Amazon SageMaker を使用しなければなりません。ML エンジニアは、ローコード・ノーコード(LCNC)のアプローチに従わなければなりません。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • 1
    SageMaker Studio を使用して、Amazon EC2 インスタンスにデプロイされた LLM をファインチューニングする。
  • 2
    SageMaker Autopilot を使用して、カスタム API エンドポイントによってデプロイされた LLM をファインチューニングする。
  • 3
    SageMaker Autopilot を使用して、Amazon EC2 インスタンスにデプロイされた LLM をファインチューニングする。
  • ✓
    SageMaker Autopilot を使用して、SageMaker JumpStart によってデプロイされた LLM をファインチューニングする。

解説

【正解】D

【0からの解説】
本問は SageMaker の LCNC(ローコード・ノーコード)系機能の組み合わせを問うています。
・SageMaker Autopilot:データを与えるだけでモデルの構築・チューニングを自動で行う AutoML 機能です。LLM のファインチューニングにも対応しており、コードをほとんど書かずにテキスト要約などのタスク向けにモデルを調整できます。
・SageMaker JumpStart:事前学習済みの基盤モデル(LLM を含む)をワンクリックでデプロイ・ファインチューニングできるモデルハブです。Autopilot の LLM ファインチューニングは、JumpStart が提供するモデルを基盤として動作します。
つまり「Autopilot(LCNC の自動ファインチューニング)+ JumpStart(事前学習済み LLM の提供・デプロイ)」という組み合わせが、SageMaker ネイティブの LCNC アプローチとして正しい構成です。

【誤りの選択肢】
A:SageMaker Studio は IDE(統合開発環境)であり、Studio で EC2 上の LLM をファインチューニングするのはコードの記述が前提となるため、LCNC アプローチに反します。
B:カスタム API エンドポイントによるデプロイは自前の API 開発が必要であり、ノーコードの趣旨に反します。Autopilot のファインチューニング対象は JumpStart モデルです。
C:Autopilot のファインチューニングは SageMaker のマネージドインフラで動作します。EC2 インスタンスに直接デプロイされた LLM を対象にすることはできず、EC2 の管理はノーコードでもありません。

【参考】
SageMaker Autopilot による LLM のファインチューニング
SageMaker JumpStart
この問題のページを開く →
問題 9(2つ選択してください。MLソリューションの監視・保守・セキュリティ
問題
ある企業が、ユーザープロンプトから動物の説明を読み取り、プロンプトの情報に基づいて画像を生成するアプリケーションを開発しています。このアプリケーションは、Amazon Simple Queue Service(Amazon SQS)キューからメッセージを読み取ります。次に、アプリケーションは Amazon Bedrock 上の Amazon Titan Image Generator を使用して、メッセージの情報に基づいて画像を生成します。最後に、アプリケーションは SQS キューからメッセージを削除します。 同社は、アプリケーションの IAM ロールにどの IAM 権限を割り当てるべきですか?(2つ選択してください。)

選択肢と解説

  • ✓
    Amazon Titan Image Generator リソースに対する bedrock:InvokeModel アクションを許可する。
  • 2
    Amazon Titan Image Generator リソースに対する bedrock:Get* アクションを許可する。
  • ✓
    SQS キューリソースに対する sqs:ReceiveMessage アクションと sqs:DeleteMessage アクションを許可する。
  • 4
    SQS キューリソースに対する sqs:GetQueueAttributes アクションと sqs:DeleteMessage アクションを許可する。
  • 5
    Amazon Titan Image Generator リソースに対する sagemaker:PutRecord* アクションを許可する。

解説

【正解】A、C

【0からの解説】
IAM の最小権限の原則では、アプリケーションが実際に行う操作に対応するアクションだけを許可します。本問のアプリケーションの動作を分解すると、必要な権限が見えてきます。
(1) SQS キューからメッセージを読み取る → sqs:ReceiveMessage
(2) Amazon Bedrock のモデル(Titan Image Generator)を呼び出して画像を生成する → bedrock:InvokeModel(リソースには該当の基盤モデル ARN を指定)
(3) SQS キューからメッセージを削除する → sqs:DeleteMessage

したがって、A(bedrock:InvokeModel)と C(sqs:ReceiveMessage + sqs:DeleteMessage)の組み合わせが、3 つの動作すべてをちょうどカバーします。

【誤りの選択肢】
B:bedrock:Get* はモデル情報の取得などの読み取り系アクションであり、モデルを呼び出して推論(画像生成)を実行する権限ではありません。推論の実行には InvokeModel が必要です。
D:sqs:GetQueueAttributes はキューの属性(メッセージ数など)を取得するアクションであり、メッセージの受信(ReceiveMessage)ができないため、アプリケーションはそもそもメッセージを読み取れません。
E:sagemaker:PutRecord* は SageMaker Feature Store などに関する別サービスのアクションであり、Bedrock のモデル呼び出しとは無関係です。

【参考】
Amazon Bedrock の IAM アクション
Amazon SQS の IAM アクション
この問題のページを開く →
問題 10これらの要件を満たすソリューションはどれですか?MLモデルの開発
問題
ある ML エンジニアが、Amazon Bedrock で検索拡張生成(RAG)を使用して AI アシスタントを開発する必要があります。同社は PDF テキストファイルのコレクションを Amazon S3 バケットに保存しています。ML エンジニアは、PDF ファイルを処理し、処理されたファイルをベクトルストアに保存するために、Amazon Bedrock ナレッジベースを作成しなければなりません。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • 1
    最新バージョンの Amazon Titan Text Premier を使用して、ドキュメントの埋め込み(エンベディング)を実行する。
  • 2
    最新バージョンの Mistral 7B Instruct を使用して、指示チューニング(インストラクションチューニング)を実行する。
  • 3
    最新バージョンの Anthropic Claude Sonnet を使用して、指示チューニングを実行する。
  • ✓
    Cohere Embed Multilingual を使用して、ドキュメントの埋め込み(エンベディング)を実行する。

解説

【正解】D

【0からの解説】
Amazon Bedrock ナレッジベースの仕組みを理解しましょう。ナレッジベースは、S3 などのデータソースから文書を取り込み、チャンクに分割し、「埋め込みモデル(エンベディングモデル)」で各チャンクを数値ベクトルに変換してベクトルストアに保存します。検索時はクエリも同じ埋め込みモデルでベクトル化し、意味の近い文書を取得します。

つまりナレッジベースの作成時に必要なのは「埋め込みモデル」の選択です。Bedrock のナレッジベースがサポートする埋め込みモデルには、Amazon Titan Text Embeddings 系と Cohere Embed 系(英語版・多言語版)があります。選択肢の中で実際に埋め込みモデルであるのは Cohere Embed Multilingual だけなので、D が正解です。

【誤りの選択肢】
A:Amazon Titan Text Premier はテキスト「生成」モデルであり、埋め込みモデルではありません。埋め込みを行うのは Amazon Titan Text Embeddings という別のモデルです(名前のひっかけに注意)。
B・C:Mistral 7B Instruct や Anthropic Claude Sonnet はテキスト生成モデルであり、また「指示チューニング」はモデルを指示に従うように追加学習する手法であって、文書をベクトル化してベクトルストアに保存するというナレッジベース構築の処理とは無関係です。

【参考】
Amazon Bedrock ナレッジベースの作成
Amazon Bedrock でサポートされている基盤モデル
この問題のページを開く →
問題 11この要件を満たすソリューションはどれですか?MLモデルの開発
問題
ある ML エンジニアが、予測時に 2 つのクラスのうち一方のクラスでパフォーマンスが低い画像分類モデルをチューニングしています。分析の結果、モデルのパフォーマンスが低かったクラスの画像は、トレーニングデータセット全体のごくわずかな割合しか占めていないことが判明しました。 ML エンジニアはモデルのパフォーマンスを改善しなければなりません。 この要件を満たすソリューションはどれですか?

選択肢と解説

  • 1
    精度(accuracy)に最適化する。あまり一般的でない画像に画像拡張(image augmentation)を使用して、新しいサンプルを生成する。
  • ✓
    F1 スコアに最適化する。あまり一般的でない画像に画像拡張(image augmentation)を使用して、新しいサンプルを生成する。
  • 3
    精度(accuracy)に最適化する。あまり一般的でない画像に SMOTE(Synthetic Minority Oversampling Technique)を使用して、新しいサンプルを生成する。
  • 4
    F1 スコアに最適化する。あまり一般的でない画像に SMOTE を使用して、新しいサンプルを生成する。

解説

【正解】B

【0からの解説】
本問はクラス不均衡な画像分類に対する「評価指標」と「データ増強手法」の正しい組み合わせを問うています。
(1) 評価指標:クラス不均衡があるとき、精度(accuracy)は不適切です。たとえば少数派クラスが全体の 2% なら、すべて多数派と予測するだけで精度 98% になってしまい、少数派の検出力を反映できません。適合率(precision)と再現率(recall)の調和平均である F1 スコアなら、少数派クラスの予測品質を適切に評価できます。
(2) データ増強:画像データの少数派クラスを増やすには、回転・反転・明るさ変更・切り抜きなどで元画像から新しいバリエーションを作る「画像拡張(image augmentation)」が標準手法です。

【誤りの選択肢】
A・C:精度(accuracy)への最適化は、上記のとおりクラス不均衡では多数派クラスに偏った評価となり、少数派クラスのパフォーマンス改善という目的を正しく測れません。
C・D:SMOTE は、特徴量空間内で少数派サンプル同士を補間して合成サンプルを作る手法で、主に数値(表形式)データ向けです。生の画像ピクセルに SMOTE を適用すると、画像同士をぼかし合成したような不自然なサンプルが生成され、画像分類の改善手法としては不適切です。画像には画像拡張を使うのが定石です。

【参考】
SageMaker Clarify によるクラス不均衡(CI)の測定
SageMaker のトレーニングメトリクス
この問題のページを開く →
問題 12これらの要件を満たすソリューションはどれですか?MLソリューションの監視・保守・セキュリティ
問題
ある e コマース企業は、過去の顧客アクティビティに基づくニアリアルタイムの在庫管理のために、需要を予測する ML モデルをトレーニングしています。同社は、トレーニング済みモデルを本番の Amazon SageMaker AI エンドポイントに正常にデプロイしました。しかし、モデルの予測パフォーマンスが時間の経過とともに劣化していることに気づきました。同社は、このパフォーマンス劣化を緩和する長期的かつ自動化されたソリューションを必要としています。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • 1
    Amazon SageMaker Debugger を使用して、モデルパフォーマンスの異常が検出されたときに自動的にアラートを送信する。
  • 2
    AWS X-Ray を使用して、SageMaker AI エンドポイントのパフォーマンスと受信リクエストを監視し、モデルの再トレーニングの判断材料にする。
  • ✓
    Amazon SageMaker Ground Truth を使用して高品質なデータセットをキュレーションする。そのデータセットを使用してモデルを再トレーニングする。
  • 4
    Amazon SageMaker Clarify を使用してモデルと特徴量アトリビューションのバイアスを監視し、モデルの再トレーニングの判断材料にする。

解説

【正解】C

【0からの解説】
時間の経過によるモデル性能の劣化は「モデルドリフト」と呼ばれます。顧客の行動パターンが変化すると、過去のデータで学習したモデルは徐々に現実と合わなくなります。この劣化への長期的な根本対策は、新しいデータでモデルを再トレーニングし続けることです。

Amazon SageMaker Ground Truth は、データのラベル付け(アノテーション)を行うマネージドサービスで、人間のワークフォースや自動ラベリングを組み合わせて高品質なラベル付きデータセットを継続的に作成(キュレーション)できます。最新の顧客アクティビティを反映した高品質なデータセットを Ground Truth で整備し、それでモデルを再トレーニングするサイクルを構築することが、性能劣化への長期的・持続的な解決策になります。

【誤りの選択肢】
A:SageMaker Debugger はトレーニングジョブ実行中の問題(勾配消失・過学習の兆候など)を検出するツールであり、本番エンドポイントの経時的なドリフト監視や再トレーニングの仕組みではありません。
B:AWS X-Ray は分散トレーシングのサービスで、リクエストの流れやレイテンシは追えますが、モデルの予測品質の劣化は検出できず、再トレーニングの解決策も提供しません。
D:SageMaker Clarify のバイアス監視は、属性グループ間の公平性の変化を検出するものです。本問の課題は公平性ではなく予測精度の劣化であり、バイアス監視だけでは「劣化を緩和する」ことはできません(再トレーニングのためのデータ整備が不可欠です)。

【参考】
Amazon SageMaker Ground Truth
Amazon SageMaker Model Monitor
この問題のページを開く →
問題 13これらの要件を満たすソリューションはどれですか?機械学習のためのデータ準備
問題
ある企業は、動画内の動き(モーション)を分類する ML モデルを使用しています。データは MP4 形式で Amazon S3 に保存されています。同社がモデルを作成した際、すべての動画フレームにラベルを付けるのに 4 か月を要しました。 同社は、Amazon SageMaker AI の既存のトレーニングワークフローを使用してモデルを再トレーニングする必要があります。ML エンジニアは、ラベル付けの時間を短縮するソリューションを実装しなければなりません。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • ✓
    SageMaker Ground Truth を使用して動画フレームにアノテーションを付ける。
  • 2
    SageMaker JumpStart を使用して、事前学習済みのコンピュータビジョンモデルでラベリングモデルを開発する。
  • 3
    SageMaker Data Wrangler を使用してデータワークフローを作成する。そのワークフローを使用してラベリングプロセスを最適化する。
  • 4
    Amazon Rekognition と組み合わせた Amazon Augmented AI(Amazon A2I)のラベリングインターフェイスを使用して、動画フレームにラベルを付ける。

解説

【正解】A

【0からの解説】
Amazon SageMaker Ground Truth は、ML トレーニング用のデータラベリング(アノテーション)に特化したマネージドサービスです。本問の要件に対して次の点が決め手になります。
・動画専用のラベリングタスク(動画フレームのオブジェクト検出・トラッキングなど)が組み込みで提供されており、MP4 動画のフレーム単位のアノテーションをそのまま実行できます。
・自動データラベリング(active learning)機能により、人間が付けたラベルから学習したモデルが残りのデータに自動でラベルを付け、確信度の低いものだけを人間に回します。これにより、4 か月かかっていたラベル付け時間を大幅に短縮できます。
・出力されたラベル付きデータ(拡張マニフェスト)は SageMaker のトレーニングワークフローにそのまま統合できます。

【誤りの選択肢】
B:JumpStart の事前学習済みモデルから独自のラベリングモデルを開発するのは、開発・検証の工数が大きく、専用のラベリングサービス(Ground Truth)がある中で車輪の再発明です。
C:SageMaker Data Wrangler はデータの変換・前処理のためのツールであり、ラベリング機能はありません。
D:Amazon A2I は、ML の推論結果のうち信頼度が低いものを人間がレビューするためのサービスであり、トレーニングデータセットを最初から大量にラベル付けするためのサービスではありません(その用途は Ground Truth の役割です)。

【参考】
Amazon SageMaker Ground Truth
Ground Truth の動画フレームラベリング
この問題のページを開く →
問題 14今後モデルドリフトを特定するために、同社が使用できるソリューションはどれですか?MLソリューションの監視・保守・セキュリティ
問題
ある企業は、ユーザーに動画を推奨する ML モデルを使用しています。このモデルは Amazon SageMaker AI にデプロイされています。モデルはデプロイ直後は良好なパフォーマンスを示しましたが、時間の経過とともにパフォーマンスが劣化しています。 今後モデルドリフトを特定するために、同社が使用できるソリューションはどれですか?

選択肢と解説

  • 1
    SageMaker Model Monitor で監視ジョブを作成する。その後、トレーニングデータセットからベースラインを作成する。
  • ✓
    トレーニングデータセットからベースラインを作成する。その後、SageMaker Model Monitor で監視ジョブを作成する。
  • 3
    SageMaker Clarify の組み込みルールを使用してベースラインを作成する。Amazon CloudWatch でドリフトを監視する。
  • 4
    新しいデータでモデルを再トレーニングする。再トレーニングしたモデルのパフォーマンスを元のモデルのパフォーマンスと比較する。

解説

【正解】B

【0からの解説】
Amazon SageMaker Model Monitor は、本番エンドポイントのデータやモデル品質のドリフト(変化)を継続的に監視するマネージド機能です。重要なのはセットアップの「順序」です。
(1) まずトレーニングデータセットからベースラインを作成します。ベースラインジョブが、トレーニングデータの統計情報(statistics.json)と制約条件(constraints.json)を生成します。これが「正常な状態」の基準になります。
(2) その後、監視ジョブ(監視スケジュール)を作成します。監視ジョブは、エンドポイントでキャプチャした本番データをベースラインと定期的に比較し、基準からの逸脱(=ドリフト)を検出して違反レポートを出力します。
比較の基準となるベースラインが先に存在しなければ監視ジョブはドリフトを判定できないため、「ベースライン作成 → 監視ジョブ作成」の順序である B が正解です。

【誤りの選択肢】
A:順序が逆です。ベースラインがない状態で監視ジョブを作成しても、比較対象がないためドリフトの判定ができません。
C:SageMaker Clarify の組み込みルールはバイアスや説明可能性の分析のためのものであり、一般的なモデルドリフト検出のベースライン作成手順として誤っています(ドリフト監視の中核は Model Monitor です)。
D:再トレーニングして比較するのは一度きりの確認にすぎず、「今後ドリフトを特定する」ための継続的・自動的な監視の仕組みになりません。

【参考】
Amazon SageMaker Model Monitor
Model Monitor のベースラインの作成
この問題のページを開く →
問題 15これらの要件を満たすソリューションはどれですか?MLモデルの開発
問題
ある ML エンジニアが、Amazon SageMaker Studio を使用してニューラルネットワークをトレーニングしました。このニューラルネットワークは情報を TensorBoard に記録し、オプティマイザとして確率的勾配降下法(SGD)を使用しています。 ML エンジニアがトレーニンググラフを確認したところ、精度が向上しておらず、損失(loss)の減少が非常に遅いことが分かりました。ML エンジニアは、合計トレーニング時間を増やすことなくモデルのパフォーマンスを改善する必要があります。 これらの要件を満たすソリューションはどれですか?

選択肢と解説

  • ✓
    初期学習率を上げる。
  • 2
    初期学習率を下げる。
  • 3
    合計エポック数を増やす。
  • 4
    合計エポック数を減らす。

解説

【正解】A

【0からの解説】
学習率(learning rate)は、確率的勾配降下法(SGD)が 1 回の更新でモデルの重みをどれだけ動かすかを決めるハイパーパラメータです。
・学習率が小さすぎる場合:1 ステップごとの前進がわずかになり、損失の減少が非常に遅くなります。限られたエポック数では最適解に到達できず、精度も上がりません。これが本問の症状(損失の減少が非常に遅い・精度が向上しない)です。
・学習率が大きすぎる場合:損失が振動・発散します(本問の症状とは異なります)。

症状の原因は「学習率が小さすぎること」なので、初期学習率を上げれば、同じトレーニング時間(同じエポック数)のままで損失の減少が速くなり、モデルのパフォーマンス改善が期待できます。トレーニング時間を増やさないという制約も満たします。

【誤りの選択肢】
B:学習率を下げると 1 ステップの前進がさらに小さくなり、「損失の減少が遅い」という症状が悪化します。
C:エポック数を増やせば最終的に損失は下がるかもしれませんが、合計トレーニング時間が増えるため、「トレーニング時間を増やさない」という制約に違反します。
D:エポック数を減らすと学習の機会そのものが減り、精度が向上しないという問題がさらに悪化します。

【参考】
SageMaker と TensorBoard の使用
ハイパーパラメータチューニングの仕組み
この問題のページを開く →

MLA-C01 模擬問題集についてよくある質問

MLA-C01 の練習問題は無料で試せますか?

はい。MLA-C01 は先頭 15 問を会員登録なしで、正解と全選択肢の解説つきでご覧いただけます。16 問目以降は模試プラン(月額 ¥980)または Pro プラン(月額 ¥4,980)でご利用ください。

問題は何問ありますか?

MLA-C01 は本番形式の練習テスト 4 回・全 200 問を収録しています。全問に解説が付いています。

解説は付いていますか?

全ての問題に、正解の理由と各選択肢がなぜ誤りなのかの解説を付けています。ドメイン(出題分野)別の正答率も受験後に確認できます。