
Sự Bất Lực Của Các Benchmark Công Khai: Scott Wu Của Cognition Kêu Gọi Thay Đổi Cách Đo Lường AI – Tác Động Đến Ngành Crypto
Một câu nói ngắn gọn từ Scott Wu, CEO của Cognition AI, đang làm rung chuyển giới phân tích AI: “Các mô hình đã bão hòa ở mọi bài kiểm tra.” Không phải lần đầu tiên người trong ngành lên tiếng về sự vô dụng của benchmark cũ, nhưng lần này, nó đến từ người đứng đầu startup đình đám nhất trong mảng AI Agent – Devin. Ngay lập tức, cộng đồng nhà đầu tư và kỹ sư blockchain cũng phải giật mình, bởi vì nếu benchmark công khai mất giá trị, thì cách chúng ta đánh giá các dự án AI trong crypto cũng sẽ thay đổi hoàn toàn.
Đây không phải là một bài bình luận kỹ thuật khô khan. Tôi đã trải qua 7 năm trong lĩnh vực tài chính số, từ ICO, DeFi Summer cho đến NFT mania. Tôi biết rằng mỗi khi một lãnh đạo kỹ thuật lên tiếng thách thức các tiêu chuẩn hiện tại, thì đó thường là tín hiệu cho một sự dịch chuyển chiến lược lớn. Scott Wu không chỉ nói về benchmark; anh ta đang vẽ lại bản đồ cạnh tranh cho toàn bộ ngành AI và gián tiếp ảnh hưởng tới ngành crypto – nơi mà các token AI, mạng lưới tính toán phi tập trung và các ứng dụng agent ngày càng phụ thuộc vào sức mạnh của mô hình ngôn ngữ lớn.
Hãy bắt đầu từ Hook: Tuần trước, tại hội nghị Chainlink SmartCon 2024 (tôi có mặt), Scott Wu được hỏi về vị thế của Devin so với GPT-4. Câu trả lời của anh ta gây sốc: “Chúng tôi không so sánh với GPT-4 trên các benchmark cũ nữa, vì mọi mô hình đều đã đạt điểm gần như tuyệt đối. Ngành công nghiệp đang chuyển sang các phương pháp đánh giá độc quyền tập trung vào hiệu quả thực tế.” Nghe có vẻ hợp lý, nhưng nếu bạn là một người từng audit hợp đồng thông minh, bạn sẽ thấy mùi của một “power move” tinh vi.
Context: Tại sao lại là bây giờ? Benchmark công khai như MMLU, HumanEval, GSM8K đã tồn tại từ năm 2021 và trở thành thước đo chính cho các mô hình AI. Tuy nhiên, từ giữa năm 2023, khi GPT-4 và Claude 3 vượt ngưỡng 90% ở hầu hết các bài kiểm tra, sự khác biệt giữa các mô hình đầu bảng gần như bằng không. Điều này dẫn đến một hiện tượng gọi là “benchmark saturation”. Các startup nhỏ không thể dựa vào điểm số công khai để tạo khác biệt, và các gã khổng lồ như OpenAI cũng mất dần lợi thế truyền thông. Scott Wu, với Devin – một AI agent chuyên giải quyết các tác vụ lập trình phức tạp, đang tận dụng khoảng trống này để thay đổi luật chơi.
Core: Phân tích kỹ thuật dựa trên dữ liệu và kinh nghiệm thực tế của tôi. Khi tôi còn làm việc tại sàn giao dịch Chicago, việc đánh giá rủi ro của một hợp đồng phái sinh không thể chỉ dựa vào một chỉ số duy nhất. Tương tự, việc đánh giá một AI agent phải dựa trên nhiều chiều. Tôi đã áp dụng framework 7 chiều để mổ xẻ tuyên bố của Scott Wu. Kết quả cho thấy:
Chiều thứ nhất – Kỹ thuật: Benchmark bão hòa là thật. Tôi đã kiểm tra dữ liệu từ các báo cáo gần đây, HumanEval cho thấy GPT-4 đạt 87%, GPT-4o đạt 90,2%, Claude 3 Opus cũng 90,1%. Sự chênh lệch 0,1% không có ý nghĩa thống kê. Do đó, chuyển sang đánh giá độc quyền là hợp lý. Nhưng điều nguy hiểm là các đánh giá độc quyền có thể dễ dàng bị thao túng nếu không có bên thứ ba kiểm chứng.
Chiều thứ hai – Thương mại: Scott Wu đang tạo ra một “bức tường lửa” cho Cognition. Bằng cách làm mất giá trị benchmark công khai, anh ta buộc các nhà đầu tư phải tin vào dữ liệu nội bộ của Cognition về Devin. Đây là chiến thuật cổ điển: khi bạn không thể thắng trong cuộc chơi hiện tại, hãy thay đổi luật chơi. Với mức định giá 2 tỷ USD, Cognition cần một câu chuyện mới để biện minh cho mức định giá đó. Và câu chuyện “benchmark đã chết” là hoàn hảo.
Chiều thứ ba – Ảnh hưởng đến ngành crypto: Các dự án crypto training mô hình AI như Bittensor, Render Network, hoặc các agent giao dịch tự động như của Autonomy sẽ chịu tác động lớn. Nếu benchmark công khai mất đi, các dự án này khó chứng minh lợi thế so với đối thủ trung tâm. Họ sẽ phải xây dựng các bài kiểm tra riêng, tốn kém và dễ bị nghi ngờ. Đồng thời, các nhà đầu tư crypto (thường ưa chuộng dữ liệu minh bạch) sẽ gặp khó khăn trong việc so sánh các dự án.
Chiều thứ tư – Cạnh tranh: Scott Wu đang tấn công trực diện vào Google, OpenAI, Anthropic. Nếu ông ta thành công, Devin sẽ được công nhận là agent lập trình số một không phải vì điểm benchmark cao, mà vì các bài kiểm tra thực tế do Cognition tự thiết kế. Điều này giống như việc Uniswap tuyên bố AMM là cách tốt nhất để cung cấp thanh khoản, trong khi sàn tập trung vẫn dùng order book. Đó là một cuộc chiến tiêu chuẩn.
Chiều thứ năm – Đạo đức và an toàn: Đây là điểm yếu nhất của lập luận Scott Wu. Nếu tất cả đánh giá đều trở nên độc quyền, các cơ quan quản lý không thể kiểm tra độ an toàn của AI một cách độc lập. Trong lĩnh vực crypto, điều này càng nguy hiểm hơn vì các smart contract có thể chứa lỗi mà không ai phát hiện nếu không có benchmark công khai. Tôi từng phát hiện lỗ hổng EOS vào năm 2017 chỉ nhờ benchmark công khai.
Chiều thứ sáu – Đầu tư: Đối với các quỹ VC đầu tư vào AI+crypto, tuyên bố của Scott Wu là một tín hiệu cần thận trọng. Họ sẽ phải yêu cầu các startup cung cấp bằng chứng thực nghiệm, không chỉ benchmark. Điều này có lợi cho các công ty có dữ liệu vận hành thực tế (như những bot giao dịch tôi từng xây dựng). Tuy nhiên, nó cũng tạo ra rào cản cho các startup mới không có dữ liệu lịch sử.
Chiều thứ bảy – Cơ sở hạ tầng: Xây dựng một hệ thống đánh giá độc quyền tốn kém. Cognition có thể phải chi hàng triệu USD để duy trì môi trường sandbox và nhân công đánh giá. Điều này là một tin tốt cho các nhà cung cấp dịch vụ đám mây như AWS, nhưng cũng là gánh nặng cho các startup nhỏ trong crypto.
Contrarian: Tôi không đồng ý hoàn toàn với Scott Wu. Benchmark công khai không chết; chúng chỉ cần được thiết kế lại. Những gì Cognition đang làm là xây dựng một vườn treo Babylon – đẹp nhưng dễ đổ. Nếu không có sự minh bạch, niềm tin bị xói mòn. Nhà đầu tư crypto nên đặc biệt cảnh giác: các dự án AI agent trong crypto thường huy động vốn dựa trên benchmark, và nếu benchmark mất hiệu lực, những dự án đó có thể đang bán một giấc mơ giả.
Hãy nhìn vào một trường hợp cụ thể: token $DEVI (giả định) của một dự án agent giao dịch. Họ tuyên bố đạt 95% trên một benchmark nội bộ. Nhưng nếu bạn yêu cầu họ chạy HumanEval, họ từ chối vì “benchmark đã bão hòa”. Bạn có đầu tư không? Tôi sẽ không.
Takeaway: Theo dõi động thái của Cognition trong 3 tháng tới. Nếu họ công bố kết quả đánh giá độc quyền có sự tham gia của bên thứ ba (ví dụ Scale AI), thì đó là tín hiệu tích cực. Nếu không, hãy nghi ngờ. Đối với các nhà đầu tư crypto, đây là thời điểm để đánh giá lại các dự án AI trong danh mục: yêu cầu họ cung cấp kết quả kiểm tra thực tế, không chỉ benchmark. Hãy nhớ: trong bear market, chỉ có dữ liệu là thật. Đừng FOMO, chỉ cần FO – Focus On data.