Amazon BedrocのRAGとモデル評価が独自のメトリクスをサポート
ID 1797
GUID 2ccf246958c1281c2d01ce124a0268f3d7e685a3
発表日(JST)
要約生成日時(JST)
タイトル Amazon BedrocのRAGとモデル評価が独自のメトリクスをサポート
詳細リンク https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-bedrock-rag-model-evaluations-custom-metrics/
カテゴリ
  • amazon-bedrock
  • amazon-machine-learning
  • artificial-intelligence
要点
  • Amazon Bedrock Evaluationsが独自のメトリクスの作成と再利用機能を追加
  • 顧客は特定のニーズに合わせたカスタムメトリクスを定義可能
  • LLM-as-a-judgeを使用したモデルとRAG評価に対応
  • カスタムプロンプト、評価スケール、変数の使用が可能
  • クイックスタートテンプレートやゼロからの作成が可能
アップデート内容要約

Amazon Bedrock Evaluationsが、モデルとRAG評価のための独自のメトリクスの作成と再利用機能を追加しました。これにより、顧客は特定のニーズに合わせた評価メトリクスを定義できるようになりました。

アップデート内容全文

Amazon Bedrock Evaluationsは、Amazon Bedrockやマルチクラウド、オンプレミス環境でホストされている基盤モデルや検索拡張生成(RAG)システムを評価することができます。
Bedrock Evaluationsは、人間による評価、BERTScoreやF1などのプログラムによる評価、そしてモデルとRAG評価のためのLLM-as-a-judgeを提供しています。
LLM-as-a-judgeによるモデルとRAG評価では、顧客は正確性、完全性、忠実性(幻覚検出)などの組み込みメトリクス、および回答拒否、有害性、固定観念などの責任あるAIメトリクスから選択できます。
しかし、これらのメトリクスを異なる方法で定義したり、ニーズに合わせた新しいメトリクスを作成したりする必要がある場合があります。
例えば、顧客は特定のブランドの声に合わせてアプリケーションの応答を評価するメトリクスを定義したり、カスタムカテゴリー別ルーブリックに従って応答を分類したりすることができます。
今回、Amazon Bedrock Evaluationsは、LLM-as-a-judgeを使用したモデルとRAG評価のための独自のメトリクスを作成・再利用する機能を顧客に提供します。
顧客は独自の審査プロンプトを作成し、独自のカテゴリー別または数値評価スケールを定義し、組み込み変数を使用して実行時にデータセットやGenAI応答からのデータを審査プロンプトに挿入することで、評価のデータフローを完全にカスタマイズできます。
顧客は、提供されているクイックスタートテンプレートを参考に新しい審査プロンプトテンプレート/ルーブリックを作成したり、ゼロから独自のものを作成したりすることができます。
開始するには、Amazon Bedrockコンソールにアクセスするか、Bedrock APIを使用してください。
詳細については、ユーザーガイドを参照してください。

関連サービス
  • Amazon Bedrock
  • Amazon Bedrock Evaluations
関連サービスの説明
  • Amazon Bedrock Evaluationsは、Amazon Bedrockの一部として提供される評価ツールです。基盤モデルやRAGシステムの性能を評価するために使用されます。人間による評価、プログラムによる評価、LLM-as-a-judgeなど、さまざまな評価方法を提供し、モデルの正確性や責任あるAIの観点からの評価を可能にします。
  • Amazon Bedrockは、AWSが提供する生成AIサービスです。複数の基盤モデルにアクセスし、カスタマイズして、アプリケーションに統合することができます。APIを通じて、テキスト生成、画像生成、埋め込み生成などの機能を利用できます。
関連URL