AMD ha presentado su nueva plataforma de IA a escala de bastidor Helios, que presenta aceleradores MI455X de alto rendimiento, y al mismo tiempo ha asegurado una asociación con Cerebras para integrar chips a escala de oblea en sus sistemas de centro de datos.
El lanzamiento de los sistemas Helios Rack
AMD ha entrado oficialmente en la competencia de IA a escala de rack con el lanzamiento de Helios, una plataforma diseñada para desafiar la participación de mercado de centros de datos de Nvidia. El sistema destaca por su escala física, que mide 1,2 metros de ancho y 44 OU de alto, lo que lo hace significativamente más grande que la arquitectura NVL72 de Nvidia. Dentro del rack Helios, AMD utiliza 18 blades de cómputo refrigerados por líquido, cada uno de los cuales alberga cuatro GPU MI455X y un único procesador Venice Epyc de 96 núcleos. Al utilizar una estructura Ultra Accelerator Link over Ethernet (UALoE), el sistema evita la necesidad de conmutadores propietarios, lo que permite a los constructores aprovechar el silicio comercial estándar de la industria de empresas como Broadcom. Con cada acelerador MI455X respaldado por tres tarjetas de red Pensando Vulcano de 800 Gbps, AMD afirma que la plataforma ofrece un ancho de banda escalable superior en comparación con las ofertas existentes de Nvidia, posicionándola como un poderoso competidor para cargas de trabajo de inferencia y capacitación a gran escala.
Arquitectura técnica del MI455X
El poder detrás de la plataforma Helios es el último acelerador de centros de datos de AMD, el MI455X, que se basa en la arquitectura informática CDNA de quinta generación. Este chip representa un enorme esfuerzo de ingeniería, ya que utiliza un diseño de "sándwich de silicio" que incorpora 24 chiplets y tecnología de proceso de 2 nm para matrices informáticas. Para priorizar el rendimiento de la IA, AMD abandonó la compatibilidad con FP64 en este SKU específico y reasignó el área del troquel para centrarse en formatos de baja precisión como MXFP4 y MXFP8. La arquitectura incluye un aumento significativo en la caché L2 compartida y un nuevo motor de acceso directo a la memoria (DMA) destinado a reducir la latencia de los datos. Estas mejoras permiten que el chip admita la partición espacial, lo que le permite funcionar como una única GPU grande o dividirse en múltiples instancias virtuales, brindando a los hiperescaladores opciones de implementación flexibles que antes estaban limitadas en generaciones anteriores.
Asociación Estratégica con Cerebras
Además de sus avances internos en hardware, AMD ha profundizado su influencia en el ecosistema a través de una nueva asociación con Cerebras. En una conferencia de la industria, el director ejecutivo de Cerebras, Andrew Feldman, confirmó que los chips únicos de "escala de oblea" de su compañía se utilizarán dentro de los sistemas Helios AI de AMD. Esta integración tiene como objetivo abordar la demanda crítica de la industria de una latencia ultrabaja, que es esencial para las aplicaciones de IA generativa que requieren tiempos de respuesta rápidos. El hardware de Cerebras comenzará a aparecer en los centros de datos administrados por Cerebras a finales de este año, y los compradores de servidores tendrán la opción de configurar sus propios sistemas basados en AMD con esta tecnología de escala de oblea. Las empresas han presentado esta colaboración como una forma de lograr una eficiencia significativamente mayor de tokens por segundo por vatio, creando un nicho distinto en un mercado que de otro modo estaría dominado por clústeres estándar basados en GPU.
Impacto en el mercado y panorama competitivo
AMD está posicionando a Helios como un rival directo de las plataformas Blackwell y Vera Rubin de Nvidia, afirmando que lidera el rendimiento en ancho de banda de memoria y velocidades de entrenamiento de IA. Al coincidir con el cronograma de lanzamiento de las plataformas más nuevas de Nvidia, AMD parece estar alejándose de su modelo histórico de "puesta al día". La compañía también ha conseguido compromisos importantes de los principales actores: OpenAI planea implementar potencia informática a gran escala utilizando GPU MI455X, y Anthropic se ha comprometido a implementaciones importantes a cambio de acuerdos de inversión. A pesar de la postura competitiva, AMD ha adoptado un enfoque de marketing más transparente con respecto a las métricas de rendimiento. Al admitir públicamente que los FLOPS teóricos máximos rara vez se pueden lograr en escenarios del mundo real, la compañía espera generar credibilidad a largo plazo con los clientes empresariales que priorizan el desempeño sostenido y mensurable sobre las cifras de marketing potencialmente infladas.
⚖ The Balanced View
Supporting view
Los partidarios señalan que Helios ofrece una relación rendimiento por dólar superior, mayor capacidad de memoria HBM4 y ancho de banda escalable más rápido que los equivalentes actuales de Nvidia.
Concerns & criticism
Los críticos señalan que el rendimiento de la IA en el mundo real depende en gran medida de la optimización del software y la forma de la carga de trabajo, lo que significa que los FLOPS "picos teóricos" a menudo son funcionalmente imposibles de alcanzar.
→What's next
AMD planea ampliar su cartera de GPU basadas en CDNA 5 para incluir variantes optimizadas específicamente para implementaciones empresariales. Mientras tanto, se espera que los sistemas Helios equipados con Cerebras comiencen a implementarse en los centros de datos a partir de finales de este año.