Bạn có tin một mô hình AI vừa tăng gần 50 điểm trên bài kiểm tra Agent mà không tăng một xu giá API không?
DeepSeek-V4-Pro-0813 vừa làm điều đó.
Và như mọi khi, tôi đặt câu hỏi đầu tiên: Cái này có thật không, hay chỉ là một câu chuyện bán hàng được gói trong báo cáo tự kiểm tra?
Hãy cùng mổ xẻ.
Context: Ai đang chơi trò chơi gì?
DeepSeek không phải là gã khổng lồ công nghệ Mỹ. Họ là một phòng thí nghiệm Trung Quốc, nổi tiếng với việc tạo ra những mô hình ngôn ngữ lớn (LLM) có hiệu suất cao với chi phí cực thấp.
Phiên bản Preview của V4-Pro đã gây chú ý khi đạt điểm số khả quan trên các benchmark như DeepSWE (12.8), CyberGym (52.7), và AutomationBench (12.8).
Nhưng bây giờ, với bản 0813, mọi thứ đã thay đổi.
Một báo cáo tự kiểm tra bị rò rỉ (theo theo dõi của Dongcha Beating) cho thấy điểm số đã tăng vọt: - DeepSWE: 12.8 → 62.7 (tăng 49.9 điểm) - CyberGym: 52.7 → 83.3 (tăng 30.6 điểm) - AutomationBench: 12.8 → 31.8 (tăng 19 điểm)
Những con số này không chỉ là cải thiện. Chúng là một bước nhảy vọt.
And here's the kicker: giá API không thay đổi. Vẫn là 3 NDT cho mỗi triệu token đầu vào và 6 NDT cho đầu ra.
Trong một thị trường nơi OpenAI và Anthropic đang tăng giá, DeepSeek đang làm điều ngược lại.
Nhưng hãy khoan vui mừng.
Core: Mổ xẻ cơ chế câu chuyện và phân tích tâm lý
Tôi đã dành 24 năm trong ngành này. Tôi đã thấy vô số dự án tuyên bố đột phá chỉ để biến mất trong im lặng.
Câu chuyện DeepSeek đang kể là gì?
1. Câu chuyện về hiệu suất vượt trội với chi phí thấp
Đây là một câu chuyện mạnh mẽ. Nó đánh vào tâm lý của mọi nhà phát triển và doanh nghiệp: "Bạn có thể có được sức mạnh của GPT-4 với giá của một tách cà phê."
Nhưng tôi luôn hoài nghi.
Trong lĩnh vực AI, benchmark không phải là thước đo tuyệt đối. DeepSWE, CyberGym, AutomationBench – chúng đều là những bài kiểm tra Agent. Và Agent evaluation phụ thuộc rất nhiều vào Harness (khung thử nghiệm).
Nếu bạn thay đổi Harness, bạn có thể thay đổi điểm số.
2. Sự gia tăng 49.9 điểm trên DeepSWE
Đây là điểm đáng chú ý nhất. DeepSWE là bài kiểm tra về khả năng của model trong việc giải quyết các vấn đề lập trình phức tạp.

Một bước nhảy từ 12.8 lên 62.7 là gần như không thể tin được nếu không có một sự thay đổi kiến trúc cơ bản.
Hoặc, nó có thể là kết quả của việc tinh chỉnh dữ liệu huấn luyện để "đánh lừa" benchmark.
Tôi không nói DeepSeek đang gian lận. Nhưng tôi đã thấy điều này xảy ra quá nhiều lần.
3. So sánh với Claude Opus 4.8 và Fable 5
Báo cáo cho thấy V4-Pro-0813 vượt qua Claude Opus 4.8 trên Terminal Bench 2.1 (87.9 vs 85.0), CyberGym (83.3 vs 78.3), và DeepSWE (62.7 vs 58.0). Nó cũng vượt qua Fable 5 trên AutomationBench (31.8 vs 29.1).
Đây là những đối thủ nặng ký. Claude Opus 4.8 là một trong những mô hình tốt nhất của Anthropic. Fable 5 là một model mạnh khác.
Nếu những con số này được xác nhận bởi bên thứ ba, DeepSeek sẽ là một kẻ thách thức thực sự.
Nhưng đó là một "nếu" lớn.
Contrarian: Góc nhìn phản trực giác và điểm mù
Đây là phần mà tôi thích nhất.
Hầu hết mọi người sẽ nhìn vào những con số này và nói: "Đây là một cơ hội mua tuyệt vời. Hãy đầu tư vào token DeepSeek ngay lập tức."
Nhưng tôi thấy một câu chuyện khác.
1. Sự im lặng của bên thứ ba
Tại sao không có bên thứ ba nào xác nhận những kết quả này?
Trong thế giới crypto, nếu một dự án tuyên bố có TVL tăng 500%, mọi người sẽ kiểm tra ngay lập tức.

Trong thế giới AI, cũng vậy.
Nhưng cho đến nay, tôi chưa thấy bất kỳ bài kiểm tra độc lập nào cho V4-Pro-0813.
Điều này có thể là do thời gian. Hoặc nó có thể là do các kết quả không thể tái tạo.
2. Tâm lý FOMO và sự khan hiếm
Báo cáo bị rò rỉ tạo ra một cảm giác khan hiếm và cấp bách.
"Nhanh lên, trước khi mọi người biết!"
Đây là một chiến thuật tâm lý cổ điển. Tôi đã thấy nó trong DeFi Summer 2020, nơi mọi người đổ xô vào các pool thanh khoản mà không kiểm tra hợp đồng thông minh.
Hãy nhớ: nếu nó có vẻ quá tốt để trở thành sự thật, nó thường là vậy.
3. Câu chuyện về giá không đổi
Việc giữ nguyên giá API là một nước cờ thông minh nhưng cũng đáng ngờ.
Tại sao DeepSeek không tăng giá khi hiệu suất tăng?
Có thể họ đang cố gắng chiếm thị phần.
Có thể họ đang thử nghiệm một mô hình kinh doanh mới.
Hoặc có thể họ biết rằng sự cải thiện hiệu suất không bền vững và muốn thu hút càng nhiều người dùng càng tốt trước khi nó sụp đổ.
Takeaway: Câu chuyện tiếp theo là gì?
Đây là suy nghĩ của tôi: Đừng nhảy vào câu chuyện DeepSeek ngay bây giờ.
Hãy đợi xác nhận từ bên thứ ba.
Hãy kiểm tra xem các kết quả có thể tái tạo trên các môi trường khác nhau không.
Và hãy nhớ: trong thị trường này, câu chuyện càng hay, sự thật càng đau đớn.
As the market is the ultimate truth-machine, nó sẽ phơi bày mọi thứ.
Câu hỏi duy nhất là: bạn sẽ ở bên nào khi nó xảy ra?