TechVaultHub

AMD Unveils Helios Rack-Scale AI Platform and Partners with Cerebras

By Nhân viên TechVaultHub

AMD đã giới thiệu nền tảng AI quy mô giá đỡ Helios mới, trang bị bộ tăng tốc MI455X hiệu suất cao, đồng thời đảm bảo mối quan hệ đối tác với Cerebras để tích hợp chip quy mô wafer vào hệ thống trung tâm dữ liệu của mình.

Công ty
AMD
Phần cứng chính
Hệ thống giá đỡ Helios với máy gia tốc MI455X
quan hệ đối tác
Hệ thống Cerebras được tích hợp với AMD Helios
Khách hàng chủ chốt
Meta, Microsoft, Oracle, OpenAI và Anthropic
Xác minh
Được xác nhận bởi 3 cửa hàng độc lập
Advertisement
1

Sự ra mắt của hệ thống giá đỡ Helios

AMD đã chính thức bước vào cuộc cạnh tranh AI quy mô lớn với sự ra mắt của Helios, một nền tảng được thiết kế để thách thức thị phần trung tâm dữ liệu của Nvidia. Hệ thống này đáng chú ý nhờ quy mô vật lý, rộng 1,2 mét và cao 44OU, khiến nó lớn hơn đáng kể so với kiến ​​trúc NVL72 của Nvidia. Trong giá đỡ Helios, AMD sử dụng 18 cánh máy tính làm mát bằng chất lỏng, mỗi cánh chứa bốn GPU MI455X và một bộ xử lý Venice Epyc 96 lõi. Bằng cách sử dụng kết cấu Ultra Accelerator Link over Ethernet (UALoE), hệ thống sẽ tránh được nhu cầu sử dụng bộ chuyển mạch độc quyền, cho phép các nhà xây dựng tận dụng silicon thương mại tiêu chuẩn công nghiệp từ các công ty như Broadcom. Với mỗi bộ tăng tốc MI455X được hỗ trợ bởi ba card mạng Pensando Vulcano 800 Gbps, AMD tuyên bố nền tảng này cung cấp băng thông mở rộng vượt trội so với các sản phẩm hiện có của Nvidia, định vị nó là đối thủ mạnh mẽ cho khối lượng công việc suy luận và đào tạo quy mô lớn.

2

Kiến trúc kỹ thuật của MI455X

Sức mạnh đằng sau nền tảng Helios là bộ tăng tốc trung tâm dữ liệu mới nhất của AMD, MI455X, được xây dựng trên kiến ​​trúc điện toán CDNA thế hệ thứ 5. Con chip này thể hiện nỗ lực kỹ thuật to lớn, sử dụng thiết kế 'bánh sandwich silicon' kết hợp 24 chiplet và công nghệ xử lý 2nm cho khuôn máy tính. Để ưu tiên hiệu suất AI, AMD đã loại bỏ hỗ trợ FP64 trong SKU cụ thể này, phân bổ lại khu vực khuôn để tập trung vào các định dạng có độ chính xác thấp như MXFP4 và MXFP8. Kiến trúc này bao gồm sự gia tăng đáng kể về bộ đệm L2 dùng chung và công cụ truy cập bộ nhớ trực tiếp (DMA) mới nhằm giảm độ trễ dữ liệu. Những cải tiến này cho phép chip hỗ trợ phân vùng không gian, cho phép nó hoạt động như một GPU lớn duy nhất hoặc được chia thành nhiều phiên bản ảo, cung cấp cho các bộ siêu quy mô các tùy chọn triển khai linh hoạt mà trước đây bị hạn chế ở các thế hệ trước.

3

Quan hệ đối tác chiến lược với Cerebras

Bên cạnh những tiến bộ về phần cứng nội bộ, AMD đã tăng cường ảnh hưởng đến hệ sinh thái của mình thông qua mối quan hệ hợp tác mới với Cerebras. Tại một hội nghị trong ngành, Giám đốc điều hành Cerebras Andrew Feldman đã xác nhận rằng các chip 'quy mô wafer' độc đáo của công ty ông sẽ được sử dụng trong các hệ thống Helios AI của AMD. Sự tích hợp này nhằm mục đích giải quyết nhu cầu quan trọng của ngành về độ trễ cực thấp, điều này rất cần thiết cho các ứng dụng AI tổng hợp đòi hỏi thời gian phản hồi nhanh. Phần cứng của Cerebras sẽ bắt đầu xuất hiện trong các trung tâm dữ liệu do Cerebras quản lý vào cuối năm nay và người mua máy chủ sẽ có tùy chọn định cấu hình hệ thống dựa trên AMD của riêng họ bằng công nghệ quy mô wafer này. Các công ty đã quảng cáo sự hợp tác này như một cách để đạt được hiệu suất mã thông báo trên mỗi giây trên mỗi watt cao hơn đáng kể, tạo ra một vị trí riêng biệt trong một thị trường vốn bị thống trị bởi các cụm dựa trên GPU tiêu chuẩn.

4

Tác động thị trường và bối cảnh cạnh tranh

AMD đang định vị Helios là đối thủ trực tiếp của nền tảng Blackwell và Vera Rubin của Nvidia, khẳng định hiệu suất dẫn đầu về băng thông bộ nhớ và tốc độ đào tạo AI. Bằng cách khớp với lịch trình ra mắt của các nền tảng mới nhất của Nvidia, AMD dường như đang rời xa mô hình 'bắt kịp' lịch sử của mình. Công ty cũng đã đạt được các cam kết quan trọng từ các đối thủ lớn: OpenAI có kế hoạch triển khai sức mạnh tính toán quy mô lớn bằng cách sử dụng GPU MI455X và Anthropic đã cam kết triển khai đáng kể để đổi lấy các thỏa thuận đầu tư. Bất chấp tư thế cạnh tranh, AMD đã áp dụng cách tiếp thị minh bạch hơn về các chỉ số hiệu suất. Bằng cách công khai thừa nhận rằng FLOPS cao nhất về mặt lý thuyết hiếm khi đạt được trong các tình huống thực tế, công ty hy vọng sẽ tạo dựng được uy tín lâu dài với những khách hàng doanh nghiệp ưu tiên hiệu suất bền vững, có thể đo lường được thay vì các số liệu tiếp thị có khả năng bị thổi phồng.

Advertisement

The Balanced View

Supporting view

Những người ủng hộ lưu ý rằng Helios cung cấp tỷ lệ hiệu suất trên mỗi đô la vượt trội, dung lượng bộ nhớ HBM4 cao hơn và băng thông mở rộng quy mô nhanh hơn so với các sản phẩm tương đương của Nvidia hiện tại.

Concerns & criticism

Các nhà phê bình chỉ ra rằng hiệu suất AI trong thế giới thực phụ thuộc rất nhiều vào việc tối ưu hóa phần mềm và hình dạng khối lượng công việc, có nghĩa là FLOPS 'đỉnh cao về mặt lý thuyết' thường không thể đạt được về mặt chức năng.

What's next

AMD có kế hoạch mở rộng danh mục GPU dựa trên CDNA 5 của mình để bao gồm các biến thể được tối ưu hóa đặc biệt cho việc triển khai của doanh nghiệp. Trong khi đó, hệ thống Helios được trang bị Cerebras dự kiến ​​sẽ bắt đầu được triển khai tại các trung tâm dữ liệu vào cuối năm nay.

Frequently Asked Questions

#artificial-intelligence#data-centers#amd-helios#cerebras-chips#mi455x#gpu-acceleration#semiconductor-manufacturing
Advertisement