AMDは、高性能MI455Xアクセラレータを搭載した新しいHeliosラックスケールAIプラットフォームを導入し、同時にCerebrasとのパートナーシップを確保して、ウェーハスケールのチップをデータセンターシステムに統合しました。
Heliosラックシステムの発売
AMDは、Nvidiaのデータセンター市場シェアに挑戦するために設計されたプラットフォームであるHeliosの立ち上げにより、ラックスケールAI競争に正式に参入しました。このシステムは物理的な規模が特徴で、幅 1.2 メートル、高さ 44OU であり、Nvidia の NVL72 アーキテクチャよりも大幅に大きくなります。 Helios ラック内で、AMD は 18 個の水冷コンピューティング ブレードを利用しており、それぞれに 4 個の MI455X GPU と 1 個の 96 コア Venice Epyc プロセッサーが搭載されています。 Ultra Accelerator Link over Ethernet (UALoE) ファブリックを利用することで、システムは独自のスイッチの必要性を回避し、ビルダーが Broadcom などの企業の業界標準のマーチャント シリコンを活用できるようにします。各 MI455X アクセラレータは 3 枚の 800 Gbps Pensando Vulcano ネットワーク カードでサポートされており、このプラットフォームは Nvidia の既存製品と比較して優れたスケールアウト帯域幅を提供し、大規模なトレーニングおよび推論ワークロードの強力な候補として位置付けられていると AMD は主張しています。
MI455X の技術アーキテクチャ
Helios プラットフォームを支えるのは、第 5 世代 CDNA コンピューティング アーキテクチャに基づいて構築された AMD の最新のデータセンター アクセラレータである MI455X です。このチップは、24 個のチップレットとコンピューティング ダイ用の 2nm プロセス テクノロジを組み込んだ「シリコン サンドイッチ」設計を利用した、大規模なエンジニアリング努力を表しています。 AI パフォーマンスを優先するために、AMD はこの特定の SKU での FP64 サポートから離れ、MXFP4 や MXFP8 などの低精度フォーマットに重点を置くためにダイ領域を再割り当てしました。このアーキテクチャには、共有 L2 キャッシュの大幅な増加と、データ遅延の削減を目的とした新しいダイレクト メモリ アクセス (DMA) エンジンが含まれています。これらの改善により、チップは空間パーティショニングをサポートできるようになり、単一の大型 GPU として機能したり、複数の仮想インスタンスに分割したりできるようになり、ハイパースケーラーに、以前の世代では制限されていた柔軟な導入オプションが提供されます。
Cerebras との戦略的パートナーシップ
AMD は、内部ハードウェアの進歩に加え、Cerebras との新たなパートナーシップを通じてエコシステムへの影響力を深めてきました。 Cerebras CEO の Andrew Feldman 氏は、業界カンファレンスで、同社独自の「ウェーハスケール」チップが AMD の Helios AI システム内で利用されることを認めました。この統合は、迅速な応答時間を必要とする生成 AI アプリケーションに不可欠な超低遅延に対する業界の重要な需要に応えることを目的としています。 Cerebras ハードウェアは、今年後半に Cerebras が管理するデータセンターに登場し始める予定で、サーバーの購入者は、このウェーハ スケールのテクノロジーを使用して独自の AMD ベースのシステムを構成するオプションを得ることができます。両社は、この提携を、1 秒あたり、1 ワットあたりのトークン効率を大幅に向上させる方法として売り込み、標準的な GPU ベースのクラスターが独占していた市場に明確なニッチ市場を創出しました。
市場への影響と競争環境
AMDはHeliosをNvidiaのBlackwellプラットフォームとVera Rubinプラットフォームの直接のライバルとして位置付けており、メモリ帯域幅とAIトレーニング速度のパフォーマンスでリードしていると主張している。 Nvidia の最新プラットフォームの発売スケジュールに合わせることで、AMD は歴史的な「キャッチアップ」モデルから脱却しつつあるようです。同社はまた、大手企業からの重要な約束も取り付けています。OpenAI は MI455X GPU を使用した大規模な計算能力の導入を計画しており、Anthropic は投資取引と引き換えに大規模な導入を約束しています。競争姿勢にもかかわらず、AMD はパフォーマンス指標に関してより透明性の高いマーケティング アプローチを採用しています。同社は、理論上のピーク FLOPS が現実世界のシナリオではめったに達成できないことを公に認めることで、膨れ上がる可能性のあるマーケティング数値よりも持続的で測定可能なパフォーマンスを優先する企業顧客との長期的な信頼関係を構築したいと考えています。
⚖ The Balanced View
Supporting view
支持者は、Helios が現在の Nvidia 同等製品よりも優れた 1 ドル当たりのパフォーマンス比、より高い HBM4 メモリ容量、より高速なスケールアウト帯域幅を提供していることに注目しています。
Concerns & criticism
批評家は、現実世界の AI パフォーマンスはソフトウェアの最適化とワークロードの形状に大きく依存しており、これは「理論上のピーク」FLOPS に機能的に到達できないことが多いことを意味していると指摘しています。
→What's next
AMD は、CDNA 5 ベースの GPU ポートフォリオを拡張して、エンタープライズ展開向けに特に最適化されたバリアントを含める予定です。一方、Cerebras を搭載した Helios システムは、今年後半からデータセンターでの展開が開始される予定です。