マスク氏の人工知能(AI)算力の展開は拡大を続けています。マスク氏は先日、Xプラットフォームで、SpaceX(SPCX-US)傘下のAI事業SpaceXAIが今年中にエヌビディア(NVDA-US)のGB300 GPUを66万個追加し、GPUの総保有数を144万個近くにまで引き上げると発表しました。これは、2年前に掲げた「100万GPU」目標を超えるものです。
マスク氏が公開したデータによると、SpaceXAIのColossus 1は現在、H100を15万個、H200を5万個、GB200を3万個搭載しています。Colossus 2はGB200を11万個、GB300を44万個搭載しています。
マスク氏は、さらに22万個のGB300が来週から本格稼働し、さらに22万個が11月に稼働開始予定で、順調に進めば12月末までにさらに22万個のGB300が追加されると述べています。
その時点で、SpaceXAIのGB300総数は110万個、GPU総保有数は144万個に達します。
Colossus 2はBlackwellアーキテクチャを全面採用
算力の拡大に伴い、SpaceXAIは設立からわずか3年で大規模なAI算力クラスターを構築しました。比較すると、upstreamは設立から約6年、upstreamは約10年です。
マスク氏は、Colossus 1はHopperとBlackwellの2つのアーキテクチャを混在しているため、Grokモデルのトレーニング効率が悪く、現在はupstreamにレンタルして推論タスクを実行していると明かしました。
一方、Colossus 2はBlackwellアーキテクチャを全面採用しており、マスク氏はこの構成によりトレーニングプロセスにおけるボトルネックを回避できると述べています。
ただし、SpaceXAIにとって、GPUの継続的な調達はデータセンター拡張の最大の制約ではなく、電力供給がもう一つの重要な課題です。
SpaceXAIは現在、大規模AI算力クラスターに電力を供給するため、1.2ギガワット(GW)の自家発電所を建設しています。自家発電施設を建設することで、送電網への接続に必要な長時間の承認プロセスを回避できます。
しかし、この手法は地元で論争を引き起こしています。SpaceXAIは許可を得ずにガスタービン発電設備を使用したとして訴訟に直面しており、自家発電所の完成を待つ間、1年以内にこれらの仮設発電設備を段階的に撤去することを約束しています。
100万GPUは終点ではない
100万個のGPUの大規模展開は業界唯一の事例ではありません。ブロードコム(AVGO-US)は2024年、傘下の3社の超大規模顧客が2027年までに同様の規模を計画していることを明らかにしました。
しかし、マスク氏にとって100万個のGPUは、より大規模な拡張の出発点に過ぎません。同氏は、SpaceXAIは2027年までにデータセンターの容量を7倍に拡大し、2030年までに5000万個のH100相当GPUを達成するという長期目標を設定していると述べています。
SpaceXAIの算力展開は地上のデータセンターに限定されていません。SpaceXは別途、100万個の衛星からなる軌道データセンターシステムの打ち上げを計画していますが、エヌビディアのジェンスン・フアンCEOは、これは現時点では「単なる夢」に過ぎないと述べています。
SpaceXAIの急速な算力規模拡大は、AIインフラ競争がもはやGPU調達だけの競争ではないことを示しています。自家発電施設の建設、既存算力のレンタル、軌道データセンターの計画まで、マスク氏はエネルギーとデータセンターインフラの両面で展開を同時に拡大しています。
FACT BOX ・ 要点整理
- 出典:PR Times
- 分類:新製品
- 関連組織:Anthropic / upstream
- 製品・サービス:GB300 GPU / H100