問題文
ある企業の生成 AI アプリケーションは、東京リージョンで Amazon Bedrock の基盤モデルを呼び出している。利用が伸びた結果、混雑する時間帯にスロットリングのエラーが返るようになった。データはリージョンをまたいで処理してよいという社内の承認は得ている。アプリケーションの改修を最小限にしつつ、混雑時の失敗を減らす方法として最も適切なものはどれか。
選択肢
- Amazon Bedrock のクロスリージョン推論を有効にし、混雑時のリクエストを設定されたリージョンの候補へ自動的に振り分ける
- スロットリングが出たときに同じリージョンへ即座に再試行する処理をアプリケーションに追加する
- 基盤モデルを呼び出す前に AWS Lambda 関数の同時実行数を引き上げ、呼び出し側で同時に投げられるリクエストの数を増やして混雑時の処理量を底上げする
- 利用の少ない時間帯にすべてのリクエストをまとめて処理するバッチ推論へ切り替える