Qwen 2.4T tham số: Món quà cho DePIN hay cú lừa của open weights?
Số tham số là một con số, không phải một lời hứa.
Alibaba vừa công bố mô hình Qwen với 2,4 nghìn tỷ tham số. Open weights sẽ được mở vào tuần sau. Crypto Briefing lập tức gắn câu chuyện này với "nhu cầu điện toán phi tập trung". Cộng đồng DePIN bắt đầu mơ về một làn sóng suy luận phân tán. Tôi đọc thông báo đó và thấy một câu chuyện chưa kể.
Mỗi dòng code đều chứa một câu chuyện chưa kể. Và code của Qwen, cho đến thời điểm này, là một chiếc hộp kín.
Hãy đặt mọi thứ vào đúng bối cảnh. Đây không phải một giao thức blockchain. Đây là một mô hình AI do một công ty công nghệ trung tâm phát hành. Việc nó xuất hiện trên một trang tin crypto chỉ cho thấy giới đầu cơ đang tìm mọi thứ để nhét vào câu chuyện AI x Crypto.
Open weights nghĩa là bạn có thể tải trọng số huấn luyện về. Bạn có thể tự chạy, tự tinh chỉnh, tự thuê GPU để phục vụ người dùng. Về lý thuyết, điều đó loại bỏ sự phụ thuộc vào các API đóng như OpenAI hay Anthropic. DePIN – mạng lưới GPU phi tập trung – được kỳ vọng là bên hưởng lợi trực tiếp. Vì sao? Vì nếu Qwen mở, ai cũng có thể mang model này lên mạng lưới GPU phân tán để chạy inference. Đó là câu chuyện mà phe bò đang bán.
Nhưng 2,4 nghìn tỷ tham số không phải là con số bạn có thể nhét vào một chiếc RTX 4090. Đó là mức độ của những cụm GPU lớn mà chỉ các ông lớn cloud mới có thể vận hành trơn tru. Và đây mới là phần tôi muốn mổ xẻ.
Bắt đầu từ thuật ngữ. "2,4 nghìn tỷ tham số" có thể là tổng tham số của một mô hình MoE – Mixture of Experts. Kiến trúc MoE không kích hoạt toàn bộ tham số cho mỗi dự đoán. Nó chỉ bật một phần nhỏ. Nếu Qwen 2.4T là MoE với 10 tỷ tham số kích hoạt, nhu cầu tính toán thực tế sẽ thấp hơn nhiều so với cái vẻ bề ngoài hào nhoáng 2,4T. Giới truyền thông thích con số lớn. Kỹ sư thích đo lượng tham số kích hoạt.
Mỗi dòng code đều chứa một câu chuyện chưa kể. Câu chuyện ở đây là nếu tham số kích hoạt thấp, mô hình có thể chạy trên những GPU tầm trung. Nếu đúng vậy, DePIN có thể phục vụ được. Nếu không, nó sẽ chỉ làm giàu thêm cho các nhà cung cấp hạ tầng tập trung.
Điểm thứ hai: open weights không tự động chuyển thành nhu cầu xác minh phi tập trung. Các mạng lưới DePIN muốn chạy model của Qwen vẫn phải thuyết phục người dùng rằng node chạy đúng, không gian lận. Muốn làm được điều đó, bạn cần ZKML hoặc TEE. Bài viết của Crypto Briefing không hề đề cập đến cơ chế xác minh này. Không có một dòng nào về việc Qwen có đi kèm bằng chứng tính toán hay không. Đó là một khoảng trống kỹ thuật lớn.
Tôi từng dẫn dắt một nhóm audit giao thức AI oracle. CEO của dự án đó cho rằng attestation của mô hình chỉ là việc "ký một hash". Sự thật phức tạp hơn nhiều. Khi deploy một model lên mạng phi tập trung, bạn phải chứng minh model đó chạy đúng trên dữ liệu đầu vào. Nếu không có bằng chứng tin cậy, toàn bộ niềm tin sụp đổ. Qwen không được thiết kế để làm việc đó. Nó chỉ là một bộ trọng số. Nó không biết đến DePIN, không biết đến ZK.
Điểm thứ ba: rào cản triển khai. Không phải ai cũng có 350GB bộ nhớ GPU để tải một mô hình 2.4T dạng dense. Ngay cả với MoE, việc phân tán các expert lên nhiều node cũng cần hạ tầng mạng cực nhanh và đồng bộ chặt chẽ. Hầu hết các mạng DePIN hiện tại vận hành bởi các node nhỏ lẻ, GPU lẻ tẻ trên khắp thế giới. Họ không có backbone nội bộ. Một mô hình khổng lồ như Qwen sẽ buộc họ phải liên kết thành cụm – nghĩa là quay lại mô hình tập trung. Điều này đi ngược lại triết lý của DePIN.
Điểm thứ tư: giấy phép. "Open weights" không đồng nghĩa với "free commercial use". Nhiều mô hình lớn của Trung Quốc đi kèm giấy phép hạn chế, cấm dùng cho một số lĩnh vực hoặc yêu cầu xin phép nếu muốn kinh doanh. Nếu Qwen đi theo hướng đó, những dự án DePIN muốn dùng nó để kiếm tiền sẽ vướng ngay rào cản pháp lý. Tôi không nói rằng Alibaba sẽ làm vậy, nhưng tôi cũng không tin rằng một tập đoàn chi hàng trăm triệu đô để huấn luyện mô hình lại trao nó đi mà không tính toán.
Đây là mấu chốt: chiến lược của Alibaba có thể chỉ đơn giản là dùng open weights để hút developer về hệ sinh thái của họ. Mở model, tạo tiếng vang, kéo người dùng lên Alibaba Cloud để train và serve. Họ không cần quan tâm DePIN. Trong khi đó, các nhà đầu tư crypto đang gắn ý nghĩa lớn hơn cho sự kiện này. Họ tự kể một câu chuyện mà chính đội ngũ Qwen không hứa hẹn.
Có một điều mà phe bò nói đúng. Nếu Qwen thực sự chạy tốt trên GPU tầm trung, nếu giấy phép cho phép thương mại hóa, thì DePIN có thể được hưởng lợi thật sự. Đó là một "nếu" lớn. Nhưng ngay cả khi nó không xảy ra, sự kiện này vẫn có giá trị: nó là bài test căng thẳng đáng giá cho toàn bộ ngành. Liệu một frontier model có thể sống trên phi tập trung hay không? Câu trả lời sẽ không nằm trong tweet của Crypto Briefing mà ở dữ liệu trên chuỗi sau tuần tới. Nếu nhiều node bắt đầu serve Qwen, tôi sẽ tin rằng DePIN có thể nuốt được những con cá lớn. Nếu tất cả chỉ là những chiến dịch marketing, toàn bộ câu chuyện AI x DePIN cần được kiểm tra lại.
Theo dõi tuần sau không phải để xem token nào tăng. Hãy theo dõi lượng GPU thực tế được kéo vào testnet. Hãy theo dõi chi phí inference trên các mạng lưới phi tập trung so với giá trên AWS. Đó là những con số sẽ nói lên sự thật.
Còn hiện tại, tất cả những gì chúng ta có là một câu chuyện chưa kể. Và lần này, câu chuyện chưa kể là liệu open weights có đủ sức giải phóng điện toán phi tập trung hay chỉ là một cách để ông lớn mở rộng đám mây của mình. Tôi đặt cược vào dữ liệu, không đặt cược vào cảm xúc.
Mỗi dòng code đều chứa một câu chuyện chưa kể. Lần này, code thuộc về Qwen. Và câu chuyện của nó sẽ được viết bởi những người thực sự chạy model, không phải những người chỉ đọc title.