Đội ngũ AMD công bố Helios – hệ thống rack-scale AI đầu tiên của họ – và tôi chỉ mất 20 phút để nhận ra điều họ không nói. Họ khoe Microsoft đã mua, Meta lên kế hoạch 1GW, OpenAI và Oracle cũng theo chân. Nhưng là một kỹ sư audit blockchain, tôi đã thấy quá nhiều lần: một bản phát hành hào nhoáng thường che giấu những lỗ hổng kỹ thuật chết người.
Bối cảnh: AMD đã từng chỉ là nhà cung cấp GPU rời rạc, thua NVIDIA ở mọi mặt trận phần mềm. Giờ đây, họ tung ra Helios – một hệ thống tích hợp GPU MI400, EPYC CPU và chip mạng tự phát triển – để cạnh tranh trực tiếp với NVIDIA DGX GB200. Họ tuyên bố chi phí mỗi token thấp hơn, tám trong số mười công ty AI hàng đầu thế giới đã dùng Instinct GPU. Nhưng thực tế phũ phàng: không có benchmark độc lập, không có thông số kiến trúc MI400, không có bất kỳ dữ liệu nào về hiệu năng suy luận thực tế. Đây là một bản tin PR được dàn dựng tinh vi, và tôi sẽ mổ xẻ nó.

Core – Tháo gỡ từng lớp:
Lớp đầu tiên: Phần cứng. MI400 là gì? AMD không nói. Dựa trên kinh nghiệm audit của tôi, một sản phẩm mới mà giấu thông số kỹ thuật thường có hai lý do: hoặc nó chưa hoàn thiện, hoặc nó chỉ là bản nâng cấp nhỏ từ thế hệ trước (MI300X). Tôi cá MI400 chỉ là CDNA 3/4 với xung nhịp cao hơn, không có đột phá kiến trúc. Trong khi đó, NVIDIA Blackwell B200 đã có Transformer Engine thế hệ thứ hai, hỗ trợ FP4 và băng thông nhớ HBM3e gấp rưỡi. So sánh về con số thuần túy: nếu MI400 đạt 1.3 PFLOPS FP16 (ước tính), B200 đã đạt 2.0 PFLOPS. Khoảng cách vẫn còn đó.
Lớp thứ hai: Kết nối. AMD tự hào về chip mạng tự phát triển, nhưng họ không đề cập băng thông liên kết giữa các GPU trong rack. NVIDIA NVLink thế hệ thứ tư cho phép 900 GB/s mỗi GPU, trong khi Infinity Fabric của AMD hiện tại chỉ đạt 200 GB/s. Trong training cluster 1000 GPU, sự chênh lệch này đồng nghĩa với hiệu suất mô hình (MFU) giảm 15–20%. Helios có thể là một rack khép kín, nhưng khi mở rộng ra nhiều rack, tốc độ liên lạc giữa các rack sẽ trở thành nút thắt cổ chai.
Lớp thứ ba: Phần mềm. Đây là tử huyệt của AMD. ROCm vẫn còn xa lạ với 400.000+ nhà phát triển CUDA. Ngay cả PyTorch cũng có bản build ROCm, nhưng các thư viện tối ưu như FlashAttention, vLLM, TensorRT-LLM chỉ hỗ trợ CUDA một cách tự nhiên. AMD tuyên bố 'chi phí mỗi token thấp hơn' – nhưng không đưa ra benchmark nào. Tôi đã thấy nhiều dự án blockchain hứa hẹn 'chi phí thấp hơn' và sau đó phát hiện backdoor trong smart contract. Ở đây, cái backdoor chính là sự thiếu vắng hệ sinh thái phần mềm: nếu bạn phải viết lại toàn bộ pipeline inference từ CUDA sang HIP, chi phí chuyển đổi sẽ nuốt chửng mọi lợi thế giá rẻ.
Lớp thứ tư: Khách hàng. Microsoft, Meta, OpenAI – tất cả đều đã có chip tự thiết kế (Maia, MTIA). Việc họ mua AMD là một chiến lược 'đa nhà cung cấp' để giảm phụ thuộc vào NVIDIA, không phải là sự ưu ái dành cho AMD. Họ sẽ chỉ dùng Helios cho các tác vụ không quan trọng hoặc thử nghiệm. Nếu AMD thực sự tốt, tại sao họ không công bố quy mô cụ thể? 'Microsoft đã triển khai' – bao nhiêu rack? 10 hay 1000? Sự khác biệt là rất lớn.
Contrarian – Phần phe bò có thể đúng:
Tuy nhiên, tôi không phủ nhận hoàn toàn. Có một tín hiệu ngược chiều: AMD đang làm đúng ở cấp độ hệ thống. Tích hợp GPU + CPU + network vào một rack là bước đi thông minh, giảm độ phức tạp cho khách hàng doanh nghiệp. Và nếu họ thực sự đạt được chi phí mỗi token thấp hơn 20–30% so với NVIDIA (điều tôi nghi ngờ nhưng chưa thể bác bỏ), thị trường inference sẽ chứng kiến một cuộc chiến giá. Trong dài hạn, điều này có lợi cho toàn ngành AI – giá inference rẻ hơn đồng nghĩa với nhiều ứng dụng hơn.
Hơn nữa, NVIDIA đang gặp áp lực pháp lý (điều tra chống độc quyền) và nguồn cung H100 vẫn căng thẳng. Các công ty lớn như Meta, với quy mô 1GW, không thể đặt tất cả trứng vào một giỏ. Họ sẽ đầu tư vào AMD, Intel và tự phát triển để đa dạng hóa. Điều này tạo ra một 'cửa sổ chiến lược' cho AMD trong 12–24 tháng tới.

Takeaway – Câu hỏi cuối cùng:
Bạn gọi Helios là đối thủ cạnh tranh thực sự, tôi gọi đó là một nước cờ 'phải chơi' của AMD. Nếu họ không có Helios, họ sẽ chết. Có Helios, họ có cơ hội sống sót. Nhưng cơ hội đó phụ thuộc vào một điều duy nhất: ROCm có thể bắt kịp CUDA trong vòng 18 tháng không? Nếu không, Helios sẽ chỉ là một hòn đá ném xuống hồ – gợn sóng rồi biến mất. Nếu có, nó có thể định hình lại bản đồ AI infrastructure. Câu trả lời sẽ đến từ các benchmark độc lập vào cuối năm nay. Tôi sẽ theo dõi, và bạn cũng nên thế.