Amazon SageMaker AIがコンテナイメージキャッシュの自動化により生成AIの推論スケールアウト時間を最大半分に短縮
ID 5233
GUID 407993dcd96fde58d21c0df4cfb1b290be4d49e8
発表日(JST)
要約生成日時(JST)
タイトル Amazon SageMaker AIがコンテナイメージキャッシュの自動化により生成AIの推論スケールアウト時間を最大半分に短縮
詳細リンク https://aws.amazon.com/about-aws/whats-new/2026/06/sagemakerai-inf-scale-out-time
カテゴリ
  • amazon-sagemaker
  • artificial-intelligence
要点
  • Amazon SageMaker Inferenceがコンテナイメージキャッシュをサポートし、スケールアウト時のスケーリングを最大2倍高速化
  • 生成AIワークロードで使用される大容量コンテナイメージ(10GB以上)のプル待ち時間を解消
  • コンテナイメージを事前にキャッシュすることで、新しいインスタンスのコールドスタートレイテンシーを大幅に削減
  • お客様側での設定変更は不要で、サービスが自動的にイメージをキャッシュ
  • アクセラレータインスタンスタイプ、シングルモデルエンドポイント、推論コンポーネントベースのエンドポイントに対応
  • SageMaker InferenceがサポートされているすべてのAWSコマーシャルリージョンで利用可能
  • サブミニッツ同時実行メトリクスやインスタンスストアコンテナキャッシュと合わせて包括的なスケーリング最適化スイートを構成
アップデート内容要約

Amazon SageMaker Inferenceがコンテナイメージキャッシュをサポートし、スケールアウト時の生成AIモデルのエンドツーエンドスケーリングを最大2倍高速化しました。新しいインスタンスが起動する際にAmazon ECRからの大容量コンテナイメージのプルを待つ必要がなくなり、コールドスタートレイテンシーが大幅に削減されます。

アップデート内容全文

Amazon SageMaker Inferenceは、コンテナイメージキャッシュをサポートするようになり、スケールアウトイベント時に生成AIモデルのエンドツーエンドスケーリングを最大2倍高速化できるようになりました。
エンドポイントがスケールアウトする際、サービスがコンテナイメージを事前にキャッシュするため、新しいインスタンスはAmazon ECRから大容量のコンテナイメージがプルされるのを待つことなく、より速くトラフィックの処理を開始できます。

生成AIワークロードは通常、ディープラーニングフレームワークやモデルサービングのために大容量のコンテナイメージ(10GB以上)を使用します。
以前は、スケールアウト時に起動するすべての新しいインスタンスがECRからフルイメージをプルする必要があり、コールドスタートレイテンシーが数分追加されていました。
コンテナイメージキャッシュは、イメージを事前にプルすることでこのボトルネックを解消し、新しいインスタンスがコンテナをローカルで利用可能な状態で起動できるようにします。

お客様は変更を行う必要はありません。
サービスは、エンドポイントまたは推論コンポーネントの設定で指定されているイメージURIを自動的にキャッシュします。
この機能は、アクセラレータインスタンスタイプ、シングルモデルエンドポイント、および推論コンポーネントベースのエンドポイントをサポートしています。

このリリースにより、SageMaker Inferenceは生成AI向けの包括的なスケーリング最適化スイートを提供するようになりました:最大6倍高速な負荷検出のためのサブミニッツ同時実行メトリクス、既存インスタンスでのより高速なスケーリングのためのインスタンスストアコンテナキャッシュ、そして新しいインスタンスでの最大2倍高速なスケーリングのためのコンテナイメージキャッシュです。

コンテナイメージキャッシュは、SageMaker InferenceがサポートされているすべてのAWSコマーシャルリージョンで利用可能です。

関連サービス
  • Amazon ECR
  • Amazon SageMaker AI
関連サービスの説明
  • Amazon ECR(Elastic Container Registry)は、Dockerコンテナイメージを安全に保存、管理、デプロイするためのフルマネージドなコンテナレジストリサービスです。開発者はコンテナイメージをECRにプッシュして保存し、必要な時にプルして使用できます。SageMakerなどの他のAWSサービスと統合されており、機械学習の推論に使用するコンテナイメージの管理にも利用されています。
  • Amazon SageMaker AIは、機械学習モデルの構築、トレーニング、デプロイを簡単に行えるフルマネージドサービスです。SageMaker Inferenceはその中の推論機能で、トレーニング済みのモデルをエンドポイントとしてデプロイし、リアルタイムまたはバッチで予測を提供します。スケーリング機能により、トラフィックの変動に応じて自動的にインスタンスを追加・削除でき、生成AIモデルのような大規模なモデルのサービングにも対応しています。
関連URL