MonPing

Giá thị trường

BTC Bitcoin
$79,708.4 -1.74%
ETH Ethereum
$2,453.8 -1.56%
SOL Solana
$101.73 -2.22%
BNB BNB Chain
$718.5 -0.54%
XRP XRP Ledger
$1.4 -3.73%
DOGE Dogecoin
$0.0847 -3.16%
ADA Cardano
$0.2106 -4.23%
AVAX Avalanche
$7.35 -1.91%
DOT Polkadot
$0.8705 -1.82%
LINK Chainlink
$11.63 -1.55%

Lịch sự kiện blockchain

{{年份}}
30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

💡 Smart Money

0x26cd...4404
Thợ đào DeFi hàng đầu
+$1.5M
80%
0x9b61...2082
Nhà giao dịch on-chain dày dặn
+$0.1M
91%
0x1739...8f64
Nhà giao dịch on-chain dày dặn
+$2.2M
61%

Công cụ

Tất cả →

Giải mã cơn sốt PerceptionBench: Kimi tung benchmark 'phơi bày' điểm yếu AI, liệu có phải chiêu trò FOMO cho giới crypto?

Danh mục | Phạm Đức |

Hook

Chín mươi tám phần trăm. Đó là con số gây sốc mà Kimi (Yue Ziyi) vừa tung ra khi công bố benchmark PerceptionBench mới của họ: không một mô hình AI đa phương thức nào đạt nổi 60% độ chính xác trong bài kiểm tra thị giác căn bản. Nhưng cú twist nằm ở những cái tên lạ hoắc trong bảng xếp hạng: GPT-5.6-Sol, Claude-Fable-5, Gemini-3.1-Pro – những cái tên chưa từng xuất hiện trong bất kỳ tài liệu chính thức nào của OpenAI, Anthropic hay Google. Một benchmark mới, một loạt model ma, và một câu hỏi lớn: ai đang chơi trò gì đây?

Context

Kimi, startup AI Trung Quốc từng gây bão với mô hình ngữ cảnh siêu dài, vừa chính thức mở mã nguồn PerceptionBench – một bộ đánh giá năng lực nhận thức thị giác cho các mô hình đa phương thức. Thay vì các bài test tổng hợp như MMLU hay MATH, PerceptionBench chia nhỏ năng lực thị giác thành 10 hạng mục nguyên tử: phát hiện ảo giác, nhận diện chi tiết, phân biệt đối tượng chồng lấn… Kết quả: tất cả 15 mô hình được thử nghiệm (gồm cả Kimi K3 của họ) đều dưới 60%. Nghe có vẻ giống một báo động đỏ về giới hạn của AI, nhưng trong bối cảnh thị trường crypto đang khao khát những câu chuyện mới để đẩy giá token AI, sự xuất hiện của benchmark này giống một quả bom hẹn giờ hơn là một tín hiệu kỹ thuật thuần túy.

Core

PerceptionBench được thiết kế với 3.000 câu hỏi, phủ kín 10 kỹ năng thị giác cốt lõi. Điểm số cao nhất thuộc về một model có tên GPT-5.6-Sol với 59.2%, tiếp theo là Kimi K3 với 58.5%, Claude-Fable-5 ở mức 57.1%, Gemini-3.1-Pro 56.8%. Các model còn lại dao động từ 42% đến 55%. Ngay lập tức, cộng đồng AI và crypto dậy sóng. Nhưng tôi – một kẻ đã săn tin crypto từ ICO 2017, xây bot Telegram quét on-chain từ thời DeFi Summer – nhìn vào danh sách model và tự hỏi: đây là tên mã nội bộ, hay một trò bịa đặt có chủ đích?

Hãy nhìn vào dữ liệu on-chain không phải của blockchain, mà của dòng tweet: không có bất kỳ thông báo chính thức nào từ OpenAI về GPT-5.6-Sol. Anthropic cũng im lặng về Claude-Fable-5. Google chưa từng nhắc đến Gemini-3.1-Pro. Điều này gợi nhớ lại giai đoạn 2020-2021, khi hàng loạt dự án DeFi giả mạo tạo ra những cái tên nghe rất 'ngầu' để hút thanh khoản. PerceptionBench có thể là một benchmark thật, nhưng kết quả mà nó đưa ra đang bị pha loãng bởi những cái tên không thể xác thực.

Từ góc nhìn kỹ thuật, việc chia nhỏ năng lực thị giác thành 10 hạng mục là một bước tiến. Tôi từng viết báo cáo về bot rug pull năm 2021, và biết rõ các mô hình tổng hợp thường che giấu điểm yếu bằng điểm mạnh ở nơi khác. PerceptionBench phơi bày chính xác những lỗ hổng: phát hiện ảo giác, nhận diện vật thể trong điều kiện ánh sáng thấp, phân biệt các đối tượng tương tự. Điều này giúp các đội dev AI tập trung cải thiện. Nhưng vấn đề nằm ở tính đại diện: 3.000 câu hỏi, dù được thiết kế cẩn thận, chưa chắc đã phủ hết các trường hợp biên trong thực tế. Kinh nghiệm audit smart contract của tôi cho thấy: một bộ test 3.000 case có thể bỏ sót 99% lỗi trong production nếu các case không được xây dựng dựa trên dữ liệu thực tế.

Contrarian

Điểm mù lớn nhất: PerceptionBench đang đặt Kimi vào vị thế vừa đá bóng vừa thổi còi. Model của họ xếp thứ hai, chỉ sau một model bí ẩn. Có hai khả năng: một là GPT-5.6-Sol thực sự tồn tại và vượt trội, hai là Kimi cố tình đặt một cái tên 'không thể kiểm chứng' lên trên để tạo cảm giác 'nếu model bí ẩn kia mạnh thế, thì Kimi K3 cũng rất mạnh'. Đây là chiêu thức tâm lý quen thuộc trong marketing: tạo ra một đối thủ ảo để khẳng định vị thế.

Hơn nữa, nguy cơ rò rỉ dữ liệu là có thật. PerceptionBench mới công bố, nhưng các mô hình hàng đầu có thể đã được train trên các bộ dataset tương tự thông qua các kênh không chính thức (Agent, tool gọi API). Nếu Kimi K3 đã tiếp cận bài test trước khi kết quả được niêm phong, điểm 58.5% của nó không còn giá trị.

Với giới đầu tư crypto, bài toán còn nguy hiểm hơn. Một benchmark như PerceptionBench, nếu được các KOL crypto tung hô như 'bằng chứng AI còn yếu, cần thêm tiền đầu tư', có thể tạo ra làn sóng FOMO vào các token AI một cách phi lý. Tôi đã thấy điều này xảy ra với token LINA và YFI vào năm 2020 – một báo cáo 'kỹ thuật' được lan truyền, giá token bay lên, rồi rơi tự do khi sự thật lộ diện. PerceptionBench có thể là công cụ marketing cho Kimi, nhưng nếu không có kiểm toán độc lập, nó chỉ là một mảnh giấy lộn trong cơn lốc thông tin.

Takeaway

Hãy nhìn vào lịch sử: năm 2017, tôi đã kiếm 12x từ BAT nhờ phát hiện sớm thông qua bot Telegram. Nhưng cũng chính tôi đã mất tiền vào các ICO không có sản phẩm thực. PerceptionBench, dù có ý nghĩa học thuật nhất định, đang bị bao phủ bởi một lớp sương mù marketing và bí ẩn. Nếu Kimi muốn benchmark này thực sự có giá trị, họ cần công khai danh tính 15 model, công bố tập test đầy đủ và mời bên thứ ba kiểm toán. Nếu không, đây chỉ là một câu chuyện 'giảm 40% hiệu suất' khác trên thị trường crypto – nơi mọi con số đều có thể bị thao túng.

Câu hỏi cho bạn: khi không thể xác thực nguồn gốc của dữ liệu, bạn có dám đặt cược vào một benchmark không tên tuổi? Trong thế giới on-chain, trust but verify. Ở đây, không có on-chain, chỉ có câu chữ. Hãy tự hỏi: bạn đang đầu tư vào công nghệ, hay vào hype?

Sợ & Tham

74

Tham lam

Tâm lý thị trường

Chỉ số mùa altcoin

41

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Vốn hóa thị trường

Tất cả →
1
Bitcoin
BTC
$79,708.4
1
Ethereum
ETH
$2,453.8
1
Solana
SOL
$101.73
1
BNB Chain
BNB
$718.5
1
XRP Ledger
XRP
$1.4
1
Dogecoin
DOGE
$0.0847
1
Cardano
ADA
$0.2106
1
Avalanche
AVAX
$7.35
1
Polkadot
DOT
$0.8705
1
Chainlink
LINK
$11.63

🐋 Theo dõi cá voi

🔵
0xcc1d...2919
2 phút trước
Stake
3,078.95 BTC
🔵
0xc362...8f53
2 phút trước
Stake
1,087 ETH
🟢
0x3b3b...23c6
30 phút trước
Chuyển vào
1,982,004 USDC