【正解】B
【0からの解説】
セマンティック検索とは、キーワードの一致ではなく「意味の近さ」で検索する技術です。仕組みは、(1) テキストを埋め込みモデル(例:Amazon Titan Embeddings)で数値ベクトルに変換して保存し、(2) 検索時はクエリも同じモデルでベクトル化し、(3) k 近傍法(k-NN)でベクトル空間上の距離が近い=意味が似ている文書を探す、というものです。
【B が正解の理由】
Amazon OpenSearch Service は k-NN ベクトル検索をネイティブサポートする検索特化のマネージドサービスで、2 億件超の大規模データに対しても低レイテンシ(500 ミリ秒以内)の検索を実現できます。インデックスの増分更新により 1 時間ごとのデータ更新にも対応でき、クラスターのスケーリングでピーク時にも費用対効果よく対応できます。Bedrock の FM で埋め込みを生成し、検索基盤は OpenSearch のマネージド機能に任せる構成は、自前実装が最少で済みます。
【誤りの選択肢】
A:カスタムアナライザーを使ってもキーワードベースの検索であることに変わりはなく、「複雑な自然言語クエリ」を意味で理解するセマンティック検索の要件を満たせません。クエリを構造化パラメータに変換する API の開発も追加工数になります。
C:pgvector で PostgreSQL にベクトル検索を追加することは可能ですが、2 億件規模のベクトルに対して 95% のクエリを 500 ミリ秒以内で返すには、インデックス設計・パーティショニング・読み取りレプリカなどの大がかりなチューニングが必要です。既存の業務データベースに検索負荷が同居する点でもスケーラビリティに難があり、「最少の開発工数」になりません。
D:Bedrock ナレッジベースは RAG(モデルの回答の根拠として文書を取得する用途)向けの機能であり、月間 5,000 万ユーザー規模のアプリケーション検索基盤として使う設計ではありません。「カスタム取り込みパイプライン」の開発が必要な時点で開発工数も増え、1 時間ごとの更新へ即時追従する検索プラットフォームとしては不適です。
【参考】
Amazon OpenSearch Service の k-NN 検索Amazon Titan 埋め込みモデル