問題文
ある企業の生成 AI 機能は、複数の業務システムから集めて加工したデータを根拠に回答する。監査で「この回答の根拠となったデータはどのシステムのどの項目に由来するか」を問われたが、加工の途中で列名が変わっており辿れなかった。最も適切な実装はどれか。
選択肢
- 加工前のデータを別のバケットへそのまま保管し、加工の処理を実行したときの日時とスクリプトの版を記録しておいて、必要になったら同じスクリプトを再実行して由来を突き合わせる。保管したデータの保持期間は監査の要求に合わせて決める
- AWS Glue Data Catalog にデータソースを登録して加工の各段階の入出力を関連付け、生成に使ったデータへ由来のシステムと項目をメタデータのタグとして持たせて回答と対応付ける
- 回答に使った文書の識別子だけをログへ記録する
- 加工の処理のソースコードを版管理の仕組みで保管する