Amazon SageMaker HyperPodがSlurmオーケストレーションクラスターのパーティションレベルトポロジーをサポート
ID 5389
GUID 4f72c0d5f264d728a8343e036af802fd4361fdd7
発表日(JST)
要約生成日時(JST)
タイトル Amazon SageMaker HyperPodがSlurmオーケストレーションクラスターのパーティションレベルトポロジーをサポート
詳細リンク https://aws.amazon.com/about-aws/whats-new/2026/07/hyperpod-partition-topology-slurm/
カテゴリ
  • artificial-intelligence
  • compute
要点
  • Amazon SageMaker HyperPodがSlurmクラスターのパーティションレベルでのネットワークトポロジー構成をサポート
  • 単一クラスター内で、パーティションごとにツリートポロジーとブロックトポロジーを使い分け可能
  • EC2 UltraServerインスタンスタイプ(ml.p6e-gb200.36xlargeなど)はブロックトポロジー、階層型インターコネクトインスタンスタイプ(ml.p5.48xlargeなど)はツリートポロジーを使用
  • GPU間通信の高速化、NCCL集合通信の効率化、トレーニングスループットの向上を実現
  • スケールアップ、スケールダウン、ノード置換時に自動的にトポロジー構成を維持
  • Slurm 25.11以降が必要で、トポロジー対応スケジューリングはデフォルトで有効
  • SageMaker HyperPodがサポートされているすべてのAWSリージョンで利用可能
アップデート内容要約

Amazon SageMaker HyperPodが、Slurmオーケストレーションクラスターにおいてパーティションレベルでのネットワークトポロジー構成をサポートするようになりました。単一クラスター内で、あるパーティションではツリートポロジー、別のパーティションではブロックトポロジーを使用でき、各パーティションのインスタンスタイプに最適なトポロジーを適用することで、分散トレーニングのパフォーマンスが向上します。

アップデート内容全文

Amazon SageMaker HyperPodは、Slurmオーケストレーションクラスターにおいてパーティションレベルでのネットワークトポロジー構成をサポートするようになりました。
単一のクラスターで、あるパーティションではツリートポロジーを、別のパーティションではブロックトポロジーを実行できるようになり、各パーティションはそのインスタンスタイプに最も適したトポロジーを使用します。
これにより、ジョブの配置が各インスタンスタイプのインターコネクト特性に合わせられるため、分散トレーニングのパフォーマンスが向上し、GPU間通信がより高速になり、NCCLの集合通信がより効率的になり、トレーニングスループットが改善されます。

HyperPodは、各パーティションのコンピュートインスタンスグループのインスタンスタイプに基づいてトポロジーを決定します。
ml.p6e-gb200.36xlargeなどのAmazon EC2 UltraServerインスタンスタイプを使用するパーティションではブロックトポロジーが使用され、ml.p5.48xlarge、ml.p5e.48xlarge、ml.p5en.48xlargeなどの階層型インターコネクトインスタンスタイプを使用するパーティションではツリートポロジーが使用されます。
一方、ネットワークトポロジー情報を提供しないインスタンスタイプのパーティションは完全にスケジューラブルなままです。

HyperPodは、スケールアップ、スケールダウン、ノード置換イベントを通じてクラスターが変化しても、この構成を自動的に維持し、各パーティションのトポロジーが常にクラスターの現在の状態を反映するようにします。

開始するには、サポートされているGPUインスタンスタイプを使用して、Slurm 25.11以降を実行するSageMaker HyperPod Slurmクラスターを作成または更新してください。
トポロジー対応スケジューリングはデフォルトで有効になっており、設定は不要です。
この機能は、Amazon SageMaker HyperPodがサポートされているすべてのAWSリージョンで利用可能です。
詳細については、Amazon SageMaker HyperPodでのトポロジー対応スケジューリングの使用を参照してください。

関連サービス
  • Amazon EC2
  • Amazon SageMaker HyperPod
関連サービスの説明
  • Amazon EC2(Elastic Compute Cloud)は、AWSが提供する仮想サーバーサービスです。ユーザーは必要に応じてコンピューティング能力を調達でき、さまざまなインスタンスタイプ(CPU、GPU、メモリ最適化など)から選択できます。本記事で言及されているUltraServerインスタンスタイプは、超大規模なAI/MLトレーニング向けに設計された高性能GPUインスタンスです。
  • Amazon SageMaker HyperPodは、大規模な機械学習モデルのトレーニングを効率的に行うためのマネージドコンピューティングインフラストラクチャです。数百から数千のGPUを使用した分散トレーニングを簡素化し、クラスターの管理、障害からの自動回復、ジョブスケジューリングなどの機能を提供します。SlurmやAmazon EKSなどのオーケストレーターと統合して、大規模なAIトレーニングワークロードを実行できます。
関連URL