TechVaultHub

AMD Unveils Helios Rack-Scale AI Platform and Partners with Cerebras

By TechVaultHub 직원

AMD는 고성능 MI455X 가속기를 갖춘 새로운 Helios 랙 규모 AI 플랫폼을 출시하는 동시에 웨이퍼 규모 칩을 데이터 센터 시스템에 통합하기 위해 Cerebras와의 파트너십을 확보했습니다.

회사
AMD
주요 하드웨어
MI455X 가속기를 갖춘 Helios 랙 시스템
공동
AMD Helios와 통합되는 Cerebras 시스템
주요고객
Meta, Microsoft, Oracle, OpenAI 및 Anthropic
확인
3개의 독립 매장에서 확인됨
Advertisement
1

Helios 랙 시스템 출시

AMD는 Nvidia의 데이터 센터 시장 점유율에 도전하기 위해 설계된 플랫폼인 Helios의 출시로 공식적으로 랙 규모 AI 경쟁에 돌입했습니다. 이 시스템은 너비 1.2미터, 높이 44OU로 Nvidia의 NVL72 아키텍처보다 훨씬 더 큰 물리적 규모로 유명합니다. Helios 랙 내에서 AMD는 18개의 수냉식 컴퓨팅 블레이드를 활용하며, 각 블레이드에는 4개의 MI455X GPU와 단일 96코어 Venice Epyc 프로세서가 탑재되어 있습니다. UALoE(Ultra Accelerator Link over Ethernet) 패브릭을 활용함으로써 시스템은 독점 스위치가 필요하지 않으므로 빌더는 Broadcom과 같은 회사의 업계 표준 상용 실리콘을 활용할 수 있습니다. AMD는 3개의 800Gbps Pensando Vulcano 네트워크 카드가 지원되는 각 MI455X 가속기를 통해 이 플랫폼이 Nvidia의 기존 제품에 비해 우수한 확장 대역폭을 제공하여 대규모 교육 및 추론 워크로드를 위한 강력한 경쟁자로 자리매김했다고 주장합니다.

2

MI455X의 기술 아키텍처

Helios 플랫폼의 강력한 힘은 5세대 CDNA 컴퓨팅 아키텍처를 기반으로 구축된 AMD의 최신 데이터 센터 가속기인 MI455X입니다. 이 칩은 24개의 칩렛과 컴퓨팅 다이용 2nm 공정 기술을 통합한 '실리콘 샌드위치' 설계를 활용하는 대규모 엔지니어링 노력을 나타냅니다. AI 성능의 우선순위를 지정하기 위해 AMD는 이 특정 SKU에서 FP64 지원을 중단하고 MXFP4 및 MXFP8과 같은 정밀도가 낮은 형식에 초점을 맞추기 위해 다이 영역을 재할당했습니다. 이 아키텍처에는 공유 L2 캐시가 크게 증가하고 데이터 대기 시간을 줄이기 위한 새로운 DMA(직접 메모리 액세스) 엔진이 포함되어 있습니다. 이러한 개선을 통해 칩은 공간 분할을 지원하여 단일 대형 GPU로 작동하거나 여러 가상 인스턴스로 분할할 수 있으며, 이전 세대에서는 제한되었던 유연한 배포 옵션을 하이퍼스케일러에 제공합니다.

3

Cerebras와의 전략적 파트너십

내부 하드웨어 발전과 함께 AMD는 Cerebras와의 새로운 파트너십을 통해 생태계 영향력을 더욱 심화시켰습니다. 업계 컨퍼런스에서 Cerebras의 CEO인 Andrew Feldman은 회사의 고유한 '웨이퍼 규모' 칩이 AMD의 Helios AI 시스템 내에서 활용될 것이라고 확인했습니다. 이번 통합은 빠른 응답 시간이 필요한 생성 AI 애플리케이션에 필수적인 초저 지연 시간에 대한 중요한 업계 요구를 해결하는 것을 목표로 합니다. Cerebras 하드웨어는 올해 말부터 Cerebras가 관리하는 데이터 센터에 등장하기 시작할 예정이며, 서버 구매자는 이 웨이퍼 규모 기술을 사용하여 자체 AMD 기반 시스템을 구성할 수 있는 옵션을 갖게 됩니다. 두 회사는 와트당 초당 토큰 효율성을 훨씬 더 높여 표준 GPU 기반 클러스터가 지배하는 시장에서 뚜렷한 틈새 시장을 창출하기 위한 방법으로 이번 협력을 제안했습니다.

4

시장 영향 및 경쟁 환경

AMD는 Helios를 Nvidia의 Blackwell 및 Vera Rubin 플랫폼에 대한 직접적인 경쟁자로 포지셔닝하여 메모리 대역폭과 AI 훈련 속도에서 성능이 우위에 있다고 주장합니다. Nvidia의 최신 플랫폼 출시 일정을 일치시킴으로써 AMD는 역사적인 '추격' 모델에서 벗어나는 것으로 보입니다. 또한 회사는 주요 업체로부터 상당한 약속을 받았습니다. OpenAI는 MI455X GPU를 사용하여 대규모 컴퓨팅 성능을 배포할 계획이며 Anthropic은 투자 계약의 대가로 상당한 배포를 약속했습니다. 경쟁적인 자세에도 불구하고 AMD는 성능 지표와 관련하여 보다 투명한 마케팅 접근 방식을 채택했습니다. 실제 시나리오에서는 이론적 최고 수준의 FLOPS를 달성하기가 거의 불가능하다는 사실을 공개적으로 인정함으로써 회사는 잠재적으로 부풀려진 마케팅 수치보다 지속적이고 측정 가능한 성능을 우선시하는 기업 고객과 장기적인 신뢰를 구축하기를 희망합니다.

Advertisement

The Balanced View

Supporting view

지지자들은 Helios가 현재 Nvidia 제품보다 우수한 달러당 성능 비율, 더 높은 HBM4 메모리 용량 및 더 빠른 확장 대역폭을 제공한다고 지적합니다.

Concerns & criticism

비평가들은 실제 AI 성능이 소프트웨어 최적화 및 워크로드 형태에 크게 좌우된다는 점을 지적합니다. 이는 '이론적 최고' FLOPS에 도달하는 것이 기능적으로 불가능한 경우가 많다는 것을 의미합니다.

What's next

AMD는 기업 배포에 특별히 최적화된 변형을 포함하도록 CDNA 5 기반 GPU 포트폴리오를 확장할 계획입니다. 한편, Cerebras가 장착된 Helios 시스템은 올해 말부터 데이터 센터에서 출시되기 시작할 것으로 예상됩니다.

Frequently Asked Questions

#artificial-intelligence#data-centers#amd-helios#cerebras-chips#mi455x#gpu-acceleration#semiconductor-manufacturing
Advertisement