Giá thị trường

BTC Bitcoin
$62,395 -1.05%
ETH Ethereum
$1,840.46 -1.51%
SOL Solana
$71.27 -2.54%
BNB BNB Chain
$575.3 -2.19%
XRP XRP Ledger
$1.06 -0.78%
DOGE Dogecoin
$0.0690 -1.43%
ADA Cardano
$0.1719 +0.41%
AVAX Avalanche
$6.24 -3.32%
DOT Polkadot
$0.7700 +0.35%
LINK Chainlink
$7.96 -2.62%

Lịch sự kiện blockchain

{{年份}}
30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

💡 Smart Money

0xa5c0...d303
Thợ đào DeFi hàng đầu
+$1.0M
64%
0x6082...3e8a
Thợ đào DeFi hàng đầu
+$0.9M
82%
0x54a1...a344
Bot chênh lệch giá
+$4.6M
62%

Công cụ

Tất cả →
DeFi

Kimi K3 và cái bẫy hiệu quả: Khi tối ưu hóa AI chỉ làm tăng thêm khát vọng phần cứng

Võ Tâm

Bạn nghĩ rằng một kiến trúc AI mới, hứa hẹn 'hiệu quả cao hơn', sẽ tự động giảm nhu cầu về chip và bộ nhớ? Hãy nghĩ lại.

Đó chính là luận điểm phản trực giác mà SemiAnalysis vừa phơi bày về cơ chế KDA (Key-Value Cache Decomposition/Attention) trên mô hình Kimi K3. Tin tốt: họ đã tìm ra cách để mô hình suy luận 'thông minh hơn'. Tin xấu: cái giá phải trả là một sự thèm khát vô độ đối với GPU, HBM, DRAM và băng thông mạng. Đây không phải là một bản nâng cấp phần mềm đơn thuần; nó là một bản thiết kế lại phần cứng, và nó đang viết lại các quy tắc của nền kinh tế AI.

Context

Hãy đặt mình vào bối cảnh năm 2024. Cuộc đua AI đang nóng lên từng ngày. Mọi phòng thí nghiệm đều đang chạy đua để mở rộng quy mô mô hình, nhưng họ đang đối mặt với một bức tường: chi phí suy luận. Các kiến trúc Transformer truyền thống, mặc dù mạnh mẽ, lại cực kỳ kém hiệu quả khi xử lý các ngữ cảnh dài (long-context). Đây chính là lúc KDA xuất hiện. Nó hứa hẹn sẽ 'phân hủy' cơ chế chú ý (attention) để làm cho nó hiệu quả hơn, đặc biệt là trong các tác vụ yêu cầu hiểu toàn bộ một cuốn sách hoặc một cơ sở dữ liệu khổng lồ.

Nhưng, như trường hợp thường thấy trong kỹ thuật, 'hiệu quả' trong một lĩnh vực thường đi kèm với cái giá phải trả ở một lĩnh vực khác. KDA, theo phân tích, không phải là một 'miễn phí ăn trưa'. Nó là một sự đánh đổi: hy sinh tính đơn giản và khả năng dự đoán của phần cứng để đổi lấy một lợi thế cạnh tranh tiềm năng trong khả năng suy luận.

Core

Điểm mấu chốt của KDA nằm ở cách nó quản lý KV Cache. Trong một Transformer tiêu chuẩn, mỗi token bạn tạo ra đều cần một không gian lưu trữ trong bộ nhớ. Khi bạn muốn xử lý một ngữ cảnh dài 1 triệu token, không gian lưu trữ đó trở nên khổng lồ và chiếm toàn bộ HBM (High Bandwidth Memory) trên GPU. KDA, bằng cách phân hủy ma trận chú ý, hứa hẹn sẽ làm cho việc tính toán này 'hiệu quả hơn'. Nhưng 'hiệu quả hơn' ở đây có nghĩa là gì?

Nó có nghĩa là thay vì một KV Cache duy nhất, bạn có nhiều KV Cache nhỏ hơn, mỗi cái đại diện cho một khía cạnh khác nhau của thông tin. Điều này nghe có vẻ hợp lý. Nhưng vấn đề nằm ở chỗ: số lượng các 'KV Cache con' này có thể tăng lên một cách phi tuyến tính. Thay vì một bảng bộ nhớ lớn, bạn có một rừng các bảng bộ nhớ nhỏ. Tổng dung lượng bộ nhớ cần thiết, do đó, tăng vọt.

Đây là lý do tại sao SemiAnalysis lập luận rằng KDA sẽ thúc đẩy nhu cầu về DRAM và HBM. Dung lượng bộ nhớ không chỉ dừng lại ở 80GB hay 141GB trên một GPU H100. Nó có thể yêu cầu nhiều hơn thế, buộc bạn phải mua thêm GPU chỉ để có đủ bộ nhớ, ngay cả khi sức mạnh tính toán (FLOPS) của GPU đó đang bị lãng phí. Đây là một viễn cảnh kinh hoàng cho bất kỳ nhà điều hành trung tâm dữ liệu nào: bạn đang trả tiền cho điện năng và làm mát cho các lõi tính toán không được sử dụng, chỉ để có được bộ nhớ bạn cần.

Không chỉ có bộ nhớ. KDA cũng tác động mạnh mẽ đến mạng lưới (network). Các mô hình ngôn ngữ lớn được đào tạo và suy luận trên nhiều GPU. Để duy trì trạng thái 'chú ý' thống nhất trên tất cả các phần của mô hình, các GPU này phải liên tục đồng bộ hóa KV Cache của chúng với nhau. Với KDA, khối lượng dữ liệu cần được đồng bộ hóa này là rất lớn, đòi hỏi băng thông mạng cực kỳ cao, chỉ có thể đáp ứng bởi các giải pháp hàng đầu như InfiniBand hoặc NVLink của NVIDIA. Điều này có nghĩa là bạn sẽ phải chi nhiều tiền hơn cho thiết bị mạng, và cấu hình cluster của bạn sẽ trở nên phức tạp và đắt đỏ hơn.

Cuối cùng, hãy nói về GPU. Bởi vì KDA yêu cầu nhiều bộ nhớ hơn và nhiều băng thông mạng hơn, hiệu suất sử dụng của mỗi GPU sẽ giảm xuống. Để duy trì cùng một throughput (số lượng yêu cầu xử lý mỗi giây), bạn sẽ cần nhiều GPU hơn so với việc sử dụng một kiến trúc Transformer tiêu chuẩn. Đây là một cú hích kép cho các nhà sản xuất chip như NVIDIA, AMD và Intel.

Contrarian

Quan điểm chính thống hiện nay là: tối ưu hóa mô hình sẽ giảm nhu cầu về phần cứng. Đây là nền tảng cho các luận điệu về 'AI dân chủ hóa' và 'hiệu quả năng lượng'. KDA và các kiến trúc tương tự đang lật ngược hoàn toàn logic đó. Chúng ta đang chứng kiến một sự chuyển đổi từ 'Scaling Law' (mở rộng quy mô là trên hết) sang một cái gì đó tôi gọi là 'Hardware Appetite Law' (Định luật Thèm khát Phần cứng).

Hãy nhìn vào các công ty như NVIDIA. Họ đã xây dựng cả một đế chế dựa trên việc cung cấp những cỗ máy tính toán khổng lồ. Các kiến trúc AI mới như KDA, dù có vẻ như đang tối ưu hóa về mặt toán học, lại đang củng cố thêm sự phụ thuộc vào phần cứng chuyên dụng, đắt tiền. Đây không phải là một tai nạn. Có một sự đồng tiến hóa tinh vi giữa các kiến trúc AI và phần cứng. Khi AI trở nên phức tạp hơn, nó đòi hỏi phần cứng mạnh mẽ hơn. Và ngược lại, khi phần cứng trở nên mạnh mẽ hơn, nó sẽ mở ra cánh cửa cho các kiến trúc AI phức tạp hơn.

Điều này có nghĩa là giấc mơ về một thế giới nơi AI có thể chạy trên điện thoại thông minh hoặc các chip giá rẻ có thể còn xa vời hơn chúng ta tưởng. Các mô hình hàng đầu đang đi theo một hướng hoàn toàn ngược lại: chúng đang được thiết kế để khai thác tối đa các siêu máy tính. Đối với các nhà đầu tư, đây là một tín hiệu mạnh mẽ để tiếp tục đặt cược vào chuỗi cung ứng phần cứng AI, thay vì chỉ tập trung vào các mô hình.

Takeaway

KDA không phải là một bước lùi. Nó là một bước đi táo bạo, cho thấy sự sáng tạo không ngừng trong lĩnh vực AI. Nhưng nó cũng là một lời nhắc nhở rằng trong cuộc đua này, 'hiệu quả' là một khái niệm tương đối. Một thứ có thể hiệu quả về mặt tính toán lại có thể vô cùng kém hiệu quả về mặt kinh tế và hạ tầng.

Câu hỏi cuối cùng dành cho các nhà lãnh đạo công nghệ và các nhà đầu tư là: Liệu sự đánh đổi này có đáng giá không? Việc tạo ra một mô hình AI có khả năng vượt trội, nhưng với cái giá phải trả là một sự phình to không kiểm soát của hạ tầng phần cứng, liệu có phải là con đường đúng đắn để xây dựng một ngành công nghiệp bền vững? Hay chúng ta đang chứng kiến sự ra đời của một 'bong bóng hiệu quả', nơi các con số benchmark đẹp đẽ che giấu một thực tế đầy tham vọng về tài nguyên và chi phí? Thanh khoản là vua, và ở đây, thanh khoản phần cứng đang bị thách thức hơn bao giờ hết.

Quy mô không quan trọng bằng chu kỳ. Và chu kỳ hiện tại đang ưu ái cho những kẻ biết cách khai thác sự khan hiếm phần cứng.

Sợ & Tham

27

Sợ hãi

Tâm lý thị trường

Chỉ số mùa altcoin

44

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Vốn hóa thị trường

Tất cả →
1
Bitcoin
BTC
$62,395
1
Ethereum
ETH
$1,840.46
1
Solana
SOL
$71.27
1
BNB Chain
BNB
$575.3
1
XRP Ledger
XRP
$1.06
1
Dogecoin
DOGE
$0.0690
1
Cardano
ADA
$0.1719
1
Avalanche
AVAX
$6.24
1
Polkadot
DOT
$0.7700
1
Chainlink
LINK
$7.96

🐋 Theo dõi cá voi

🟢
0xe3d8...ecd7
30 phút trước
Chuyển vào
302,562 USDT
🔵
0x917c...2df9
1 giờ trước
Stake
41,714 SOL
🔴
0x0370...89ab
1 giờ trước
Chuyển ra
71.82 BTC