Hook
Chín mươi tám phần trăm. Đó là con số gây sốc mà Kimi (Yue Ziyi) vừa tung ra khi công bố benchmark PerceptionBench mới của họ: không một mô hình AI đa phương thức nào đạt nổi 60% độ chính xác trong bài kiểm tra thị giác căn bản. Nhưng cú twist nằm ở những cái tên lạ hoắc trong bảng xếp hạng: GPT-5.6-Sol, Claude-Fable-5, Gemini-3.1-Pro – những cái tên chưa từng xuất hiện trong bất kỳ tài liệu chính thức nào của OpenAI, Anthropic hay Google. Một benchmark mới, một loạt model ma, và một câu hỏi lớn: ai đang chơi trò gì đây?
Context
Kimi, startup AI Trung Quốc từng gây bão với mô hình ngữ cảnh siêu dài, vừa chính thức mở mã nguồn PerceptionBench – một bộ đánh giá năng lực nhận thức thị giác cho các mô hình đa phương thức. Thay vì các bài test tổng hợp như MMLU hay MATH, PerceptionBench chia nhỏ năng lực thị giác thành 10 hạng mục nguyên tử: phát hiện ảo giác, nhận diện chi tiết, phân biệt đối tượng chồng lấn… Kết quả: tất cả 15 mô hình được thử nghiệm (gồm cả Kimi K3 của họ) đều dưới 60%. Nghe có vẻ giống một báo động đỏ về giới hạn của AI, nhưng trong bối cảnh thị trường crypto đang khao khát những câu chuyện mới để đẩy giá token AI, sự xuất hiện của benchmark này giống một quả bom hẹn giờ hơn là một tín hiệu kỹ thuật thuần túy.
Core
PerceptionBench được thiết kế với 3.000 câu hỏi, phủ kín 10 kỹ năng thị giác cốt lõi. Điểm số cao nhất thuộc về một model có tên GPT-5.6-Sol với 59.2%, tiếp theo là Kimi K3 với 58.5%, Claude-Fable-5 ở mức 57.1%, Gemini-3.1-Pro 56.8%. Các model còn lại dao động từ 42% đến 55%. Ngay lập tức, cộng đồng AI và crypto dậy sóng. Nhưng tôi – một kẻ đã săn tin crypto từ ICO 2017, xây bot Telegram quét on-chain từ thời DeFi Summer – nhìn vào danh sách model và tự hỏi: đây là tên mã nội bộ, hay một trò bịa đặt có chủ đích?
Hãy nhìn vào dữ liệu on-chain không phải của blockchain, mà của dòng tweet: không có bất kỳ thông báo chính thức nào từ OpenAI về GPT-5.6-Sol. Anthropic cũng im lặng về Claude-Fable-5. Google chưa từng nhắc đến Gemini-3.1-Pro. Điều này gợi nhớ lại giai đoạn 2020-2021, khi hàng loạt dự án DeFi giả mạo tạo ra những cái tên nghe rất 'ngầu' để hút thanh khoản. PerceptionBench có thể là một benchmark thật, nhưng kết quả mà nó đưa ra đang bị pha loãng bởi những cái tên không thể xác thực.
Từ góc nhìn kỹ thuật, việc chia nhỏ năng lực thị giác thành 10 hạng mục là một bước tiến. Tôi từng viết báo cáo về bot rug pull năm 2021, và biết rõ các mô hình tổng hợp thường che giấu điểm yếu bằng điểm mạnh ở nơi khác. PerceptionBench phơi bày chính xác những lỗ hổng: phát hiện ảo giác, nhận diện vật thể trong điều kiện ánh sáng thấp, phân biệt các đối tượng tương tự. Điều này giúp các đội dev AI tập trung cải thiện. Nhưng vấn đề nằm ở tính đại diện: 3.000 câu hỏi, dù được thiết kế cẩn thận, chưa chắc đã phủ hết các trường hợp biên trong thực tế. Kinh nghiệm audit smart contract của tôi cho thấy: một bộ test 3.000 case có thể bỏ sót 99% lỗi trong production nếu các case không được xây dựng dựa trên dữ liệu thực tế.
Contrarian
Điểm mù lớn nhất: PerceptionBench đang đặt Kimi vào vị thế vừa đá bóng vừa thổi còi. Model của họ xếp thứ hai, chỉ sau một model bí ẩn. Có hai khả năng: một là GPT-5.6-Sol thực sự tồn tại và vượt trội, hai là Kimi cố tình đặt một cái tên 'không thể kiểm chứng' lên trên để tạo cảm giác 'nếu model bí ẩn kia mạnh thế, thì Kimi K3 cũng rất mạnh'. Đây là chiêu thức tâm lý quen thuộc trong marketing: tạo ra một đối thủ ảo để khẳng định vị thế.
Hơn nữa, nguy cơ rò rỉ dữ liệu là có thật. PerceptionBench mới công bố, nhưng các mô hình hàng đầu có thể đã được train trên các bộ dataset tương tự thông qua các kênh không chính thức (Agent, tool gọi API). Nếu Kimi K3 đã tiếp cận bài test trước khi kết quả được niêm phong, điểm 58.5% của nó không còn giá trị.
Với giới đầu tư crypto, bài toán còn nguy hiểm hơn. Một benchmark như PerceptionBench, nếu được các KOL crypto tung hô như 'bằng chứng AI còn yếu, cần thêm tiền đầu tư', có thể tạo ra làn sóng FOMO vào các token AI một cách phi lý. Tôi đã thấy điều này xảy ra với token LINA và YFI vào năm 2020 – một báo cáo 'kỹ thuật' được lan truyền, giá token bay lên, rồi rơi tự do khi sự thật lộ diện. PerceptionBench có thể là công cụ marketing cho Kimi, nhưng nếu không có kiểm toán độc lập, nó chỉ là một mảnh giấy lộn trong cơn lốc thông tin.
Takeaway
Hãy nhìn vào lịch sử: năm 2017, tôi đã kiếm 12x từ BAT nhờ phát hiện sớm thông qua bot Telegram. Nhưng cũng chính tôi đã mất tiền vào các ICO không có sản phẩm thực. PerceptionBench, dù có ý nghĩa học thuật nhất định, đang bị bao phủ bởi một lớp sương mù marketing và bí ẩn. Nếu Kimi muốn benchmark này thực sự có giá trị, họ cần công khai danh tính 15 model, công bố tập test đầy đủ và mời bên thứ ba kiểm toán. Nếu không, đây chỉ là một câu chuyện 'giảm 40% hiệu suất' khác trên thị trường crypto – nơi mọi con số đều có thể bị thao túng.
Câu hỏi cho bạn: khi không thể xác thực nguồn gốc của dữ liệu, bạn có dám đặt cược vào một benchmark không tên tuổi? Trong thế giới on-chain, trust but verify. Ở đây, không có on-chain, chỉ có câu chữ. Hãy tự hỏi: bạn đang đầu tư vào công nghệ, hay vào hype?