Amazon SageMaker AIがコンテナイメージキャッシュの自動化により生成AIの推論スケールアウト時間を最大半分に短縮
| ID | 5233 |
|---|---|
| GUID | 407993dcd96fde58d21c0df4cfb1b290be4d49e8 |
| 発表日(JST) | |
| 要約生成日時(JST) | |
| タイトル | Amazon SageMaker AIがコンテナイメージキャッシュの自動化により生成AIの推論スケールアウト時間を最大半分に短縮 |
| 詳細リンク | https://aws.amazon.com/about-aws/whats-new/2026/06/sagemakerai-inf-scale-out-time |
| カテゴリ |
|
| 要点 |
|
| アップデート内容要約 |
Amazon SageMaker Inferenceがコンテナイメージキャッシュをサポートし、スケールアウト時の生成AIモデルのエンドツーエンドスケーリングを最大2倍高速化しました。新しいインスタンスが起動する際にAmazon ECRからの大容量コンテナイメージのプルを待つ必要がなくなり、コールドスタートレイテンシーが大幅に削減されます。 |
| アップデート内容全文 |
Amazon SageMaker Inferenceは、コンテナイメージキャッシュをサポートするようになり、スケールアウトイベント時に生成AIモデルのエンドツーエンドスケーリングを最大2倍高速化できるようになりました。
生成AIワークロードは通常、ディープラーニングフレームワークやモデルサービングのために大容量のコンテナイメージ(10GB以上)を使用します。
お客様は変更を行う必要はありません。
このリリースにより、SageMaker Inferenceは生成AI向けの包括的なスケーリング最適化スイートを提供するようになりました:最大6倍高速な負荷検出のためのサブミニッツ同時実行メトリクス、既存インスタンスでのより高速なスケーリングのためのインスタンスストアコンテナキャッシュ、そして新しいインスタンスでの最大2倍高速なスケーリングのためのコンテナイメージキャッシュです。 コンテナイメージキャッシュは、SageMaker InferenceがサポートされているすべてのAWSコマーシャルリージョンで利用可能です。 |
| 関連サービス |
|
| 関連サービスの説明 |
|
| 関連URL |