当AI工場から数千顆GPUが数十万顆GPUに拡大すると、速度の遅いまたは渋滞している接続が、大量の加速器を待たせる可能性があります。NVIDIAは、毎秒102.4 Tbの伝送速度を誇る新型Spectrum-6イーサネット交換器システムを発表しました。このシステムは、10万GPUを超える環境でもネットワーク効率を最大95%に維持できるとされています。CoreWeave、Microsoft、Nebius、SpaceXAI、Teslaが最初の採用企業となります。Spectrum-6は、Vera Rubinプラットフォームや1GW規模のAI工場向けに設計されています。前衛的なモデル、代理型AI、物理AIがより多くのGPUを協調して計算する必要があるため、ネットワークはデータ伝送ツールから、GPUの利用率、モデル訓練時間、単語あたりのコストを決定するコアインフラに変わっています。AI工場が百万瓩級に向かうGPUのピーク性能は全体の計算能力を意味しません。伝統的な企業データセンターのイーサネットは、主にユーザー、サーバー、ストレージシステム間の南北方向のトラフィックを処理します。しかし、大規模なAIモデルの訓練と推論には、数千から数十万のGPUが継続的にデータを交換する必要があり、巨大な東西方向のトラフィックが生まれます。特に集団通信作業では、各GPUは計算結果を同期して交換する必要があります。一部のノードで遅延、パケット損失、またはネットワーク渋滞が発生すると、他のGPUが待たされる可能性があり、高価な加速器がフル稼働を維持できなくなります。したがって、GPUの理論的なピーク性能だけを見ても、AI工場の実際の生産量を測定するには不十分です。交換器の帯域幅、ネットワークルーティング、渋滞制御、故障復旧、光学伝送などが、システム全体が効果的に拡張できるかどうかを影響します。Spectrum-6は、新世代のSpectrum-Xイーサネットプラットフォームのコアであり、単一の交換器システムの伝送速度は毎秒102.4 Tbに達し、前世代より容量が2倍になり、ConnectX-9 SuperNIC、ネットワークソフトウェア、Vera Rubinプラットフォームと共同で設計されています。一般的なイーサネットとは異なり、Spectrum-Xは適応型ルーティング、高度な渋滞制御、リアルタイムテレメトリを導入しており、ネットワーク状況に応じて複数の利用可能な経路間でトラフィックをバランスさせることができます。一部の接続で故障が発生した場合、システムは伝送経路を再配置し、目的地に到達できなかったデータを復元できます。NVIDIAは、Spectrum-XのAIネットワーク性能は一般的なイーサネットの1.6倍に達し、デプロイ環境が10万GPUを超えても、ネットワーク効率は最大95%に維持できると述べています。ハードウェア加速型のマルチプレーンネットワークトポロジーにより、データセンターに必要な交換器の数は1.7倍に減少します。ただし、上記の数値はすべて、NVIDIAが特定のテストまたは設計条件に基づいて提供した結果であり、実際のパフォーマンスはモデルアーキテクチャ、クラスタ規模、ネットワークトポロジー、ソフトウェア設定、ワークロードによって異なります。CoreWeave、Microsoft、Nebius、SpaceXAI、TeslaがSpectrum-6を最初に導入する企業となります。このうち、CoreWeave、Microsoft、Nebiusは、Spectrum-6を搭載したVera Rubinインフラをデプロイし、開発者、スタートアップ、企業に提供します。CoreWeaveのネットワーク製品総監督のMin Junは、ネットワークは大規模環境下でパフォーマンスを維持するためのAIワークロードの鍵であると指摘し、Spectrum-6および液冷式Spectrum-Xインフラの導入により、前衛的なモデル訓練と推論に必要な帯域幅、耐性、効率を提供できるとしている。CoreWeaveは、Spectrum-6チップを搭載したSN6600-LDを採用し、Vera Rubin NVL72交換ネットワークを構築しました。この液冷式高密度交換器ラックは、1ラックあたり1.64 Pb/sの容量を提供し、前世代のエアクール交換器より100%向上しています。また、ノーブロック、マルチプレーン、マルチトラックネットワークアーキテクチャを通じてVera Rubin GPUに接続しています。Nebiusのグローバルパートナーシップ副社長のLaurelle Rosemanは、百万瓩規模では、各GPUが同期を維持できるかどうかがパフォーマンスを決定すると指摘しました。「単一の遅い接続が全体の作業を遅らせないようにすることが重要です」と彼女は述べています。Spectrum-6は、この問題に対処するために設計されており、顧客のワークロードが拡大し続けても、高速性と耐性を維持する必要があります。Spectrum-6は、可換式光学素子と共通封入光学素子の両方をサポートし、液冷を採用することも可能で、Vera Rubinコンピューティングラックとエンドツーエンドの冷却アーキテクチャを形成します。伝統的な可換式光モジュールは、交換器チップからパネル上の光モジュールに電気信号を送信する必要があります。伝送速度と交換器帯域幅が向上するにつれ、信号伝送距離がもたらす消費電力と発熱の問題も顕著になっています。共通封入光学は、光学素子を交換器チップに近づけることで、高速電気信号の伝送距離を短縮します。NVIDIAのデータによると、Spectrum-Xの光子技術は、可換式アーキテクチャに比べて5倍のエネルギー効率を向上させ、平均故障間隔時間を10倍改善しています。CoreWeave、Lambda、OracleのOCIは、最初の採用企業です。数十万GPUを持つAI工場にとって、交換器と光モジュール自体の消費電力、発熱、故障率は増幅されます。このため、CPO、シリコンオプティクス、液冷技術は、個別のコンポーネントからデータセンター全体の保有コストに影響を与える重要な要素に昇格しています。Spectrum-6は、NVIDIAがGPUからネットワークカード、交換器、DPU、光学コンポーネント、ネットワークソフトウェア、冷却システムにまで競争範囲を拡大していることを反映しています。NVIDIAはこの戦略を「垂直統合、水平開放」と呼んでいます。一方ではチップ、システム、ソフトウェアを共同設計し、他方では標準イーサネット、オープンネットワークオペレーティングシステム、異なるRDMA伝送モードをサポートし、顧客が完全なプラットフォームを採用する際の統合難易度を低減しています。AI工場が百万瓩級に達すると、計算性能は単一のチップではなく、GPU、CPU、ネットワーク、光学伝送、電力、冷却システムによって決定されます。Spectrum-6の戦略的意義は、単により多くの交換器を販売することではなく、NVIDIAがGPUからAI工場全体の技術スタックをさらに掌握することです。

FACT BOX ・ 要点整理

  • 出典:PR Times
  • 分類:新製品
  • 関連組織:CoreWeave / Microsoft / Nebius
  • 製品・サービス:Spectrum-6