Hook
Ngày 15/03/2026, Google lặng lẽ tung ra ba biến thể mới của dòng Gemini Flash: Flash 3.6, Flash Lite 3.6 và Cyber 3.6. Không có lễ ra mắt hoành tráng, không có benchmark so sánh với GPT-4o-mini hay Claude Haiku. Chỉ có một dòng tweet ngắn từ tài khoản Google Cloud: “Nhanh hơn, rẻ hơn, sẵn sàng cho AI agents.”
Nhưng đối với những ai đang theo dõi ngành AI phi tập trung, đây không chỉ là một bản cập nhật model. Đó là một tín hiệu rõ ràng: Google đang dùng ưu thế hạ tầng để đè bẹp mọi đối thủ – kể cả các mạng lưới inferencing phi tập trung như Bittensor, Render Network hay io.net. Dựa trên kinh nghiệm kiểm toán smart contract và phân tích dữ liệu on-chain của tôi, đợt phát hành này sẽ thay đổi cục diện chi phí suy luận AI, và những token liên quan đến DeAI có thể mất tới 30-50% giá trị trong ba tháng tới.
Context
Thị trường AI phi tập trung (DeAI) đã phát triển mạnh trong suốt năm 2025 nhờ vào câu chuyện “chống lại sự độc quyền của Big Tech”. Các dự án như Bittensor (TAO) xây dựng mạng lưới ngang hàng cho đào tạo và suy luận mô hình, Akash Network cung cấp GPU dưới dạng dịch vụ phi tập trung, và Render Network cho phép người dùng cho thuê sức mạnh tính toán. Cốt lõi sức hút của chúng là chi phí thấp hơn 5-10 lần so với AWS hay Google Cloud – nhờ vào việc tận dụng tài nguyên nhàn rỗi và không có chi phí quản lý tập trung.
Tuy nhiên, Google vốn dĩ là nhà cung cấp hạ tầng đám mây lớn thứ ba thế giới, và với dòng Gemini, họ đã liên tục giảm giá API. Gemini 1.5 Flash đã rẻ hơn GPT-3.5-Turbo khi ra mắt. Lần này, với việc phát hành đồng thời ba phiên bản – trong đó có Flash Lite 3.6 được đồn đoán là phiên bản cực kỳ tinh gọn dành cho thiết bị di động – Google đang nhắm trực tiếp vào phân khúc “giá rẻ” mà các mạng phi tập trung từng chiếm lĩnh.
Core
Hãy nhìn vào thông số kỹ thuật không chính thức từ một số bài kiểm tra rò rỉ. Flash Lite 3.6 có thể xử lý 128k token context với độ trễ trung bình 0.3 giây trên batch. Trong khi đó, một phân tích trên Dune Analytics từ tháng 2/2026 cho thấy chi phí infer một tác vụ phân tích cảm xúc (sentiment analysis) qua Bittensor subnet là khoảng 0.0004 TAO – tương đương 0.05 USD. Nếu Google niêm yết giá API cho Flash Lite 3.6 dưới 0.01 USD cho cùng tác vụ, Bittensor sẽ mất lợi thế cạnh tranh.
Hơn nữa, Cyber 3.6 là một mô hình tinh chỉnh đặc biệt cho an ninh mạng. Nó sử dụng dữ liệu từ Mandiant để phát hiện lỗ hổng zero-day và sinh mã khai thác có kiểm soát. Đối với các dự án blockchain đang xây dựng hệ thống bảo mật on-chain (như Forta, OpenZeppelin Defender), Cyber 3.6 có thể thay thế toàn bộ pipeline inference phi tập trung – vì nó vừa rẻ vừa ổn định hơn.
Theo dữ liệu từ Token Terminal, tổng phí hàng tháng từ các dịch vụ inferencing phi tập trung là khoảng 12 triệu USD vào Q1 2026. Đa số đến từ khách hàng doanh nghiệp nhỏ và startup. Nếu Google giảm giá API của Flash series xuống thấp hơn 50% so với các mạng phi tập trung, tôi ước tính ít nhất 40% doanh thu này sẽ chuyển sang Google Cloud trong vòng 6 tháng.
Contrarian
Nghe có vẻ phản trực giác, nhưng chính sự rẻ đi của Google có thể là con dao hai lưỡi cho chính ngành phi tập trung. Vài người cho rằng cuộc chiến giá này sẽ giết chết DeAI. Nhưng theo quan sát của tôi, một điểm mù đang bị bỏ qua: các ứng dụng AI yêu cầu quyền riêng tư (chăm sóc sức khỏe, tài chính) sẽ không thể gửi dữ liệu nhạy cảm lên API Google Cloud vì lý do tuân thủ. Đây là chỗ đứng duy nhất của các mạng phi tập trung. Ngoài ra, việc Google giảm giá cũng có thể kích thích nhu cầu inferencing tăng vọt, tạo ra một thị trường lớn hơn cho tất cả – giống như việc AWS giảm giá lưu trữ đã làm bùng nổ thị trường startup. Hệ quả là, các dự án DeAI có thể tồn tại nếu họ tập trung vào ngách “dữ liệu nhạy cảm” và “không cần tin tưởng”, thay vì cạnh tranh trực tiếp về chi phí.
Tuy nhiên, có một nghịch lý: càng nhiều người dùng API rẻ của Google, sự phụ thuộc vào hạ tầng tập trung càng lớn, và khi phí blob của Ethereum tăng lên (như tôi đã dự báo trong các bài viết trước), chi phí xác thực dữ liệu inferencing on-chain sẽ đội lên. Điều này vô hình trung lại siết chặt thị trường DeAI. Năm năm nữa, không ai nhớ đến Bittensor, nhưng mọi người vẫn dùng Google Cloud.
Takeaway
Google Gemini 3.6 Flash không chỉ là một bản nâng cấp model. Đó là một cú đấm chiến lược vào chính cốt lõi của AI phi tập trung: chi phí. Các nhà đầu tư token DeAI nên theo dõi sát giá API công bố chính thức của Google trong tuần tới. Nếu Flash Lite 3.6 có giá dưới 0.005 USD cho mỗi tác vụ đơn giản, hãy chuẩn bị cho một đợt điều chỉnh giảm. Nhưng nếu bạn là builder trong lĩnh vực này, câu hỏi lớn hơn là: bạn có dám đặt cược vào một tương lai nơi dữ liệu và suy luận đều thuộc về một công ty duy nhất? Tôi thì không. Và những ai chọn con đường phi tập trung sẽ chỉ tồn tại nếu họ đặt quyền riêng tư lên trên giá rẻ.