KDA · 54 層
不會增長的記憶
Kimi Delta Attention 是線性注意力:每一層不會保留所有過去的 token,而是把對話摺疊進一個固定大小的循環狀態。
為何重要:模型四分之三的層,在第 5 輪和第 500 輪對話時佔用同樣多的記憶體。正因如此,長時間的智能體會話才能在你買得到的硬件上實際運行。
- 固定大小狀態
- 沒有 KV cache
輸入 TOKEN
開源模型 · 預覽版 · 即將推出
長上下文,不再被記憶體拖累。72 層之中,只有 18 層需要 KV cache。一款 32B 稠密開源模型,專為工具調用、編程與長時間工作會話而設計,在企業真正擁有的機器上運行。
問題所在
在傳統模型中,每一層注意力都要保留 KV cache,也就是它看過內容的副本,並隨每個 token 不斷增長。疊上七十二層,到了長上下文時,決定機器裝不裝得下的,是快取而不是權重。
Volundr 改變了這條曲線的形狀。54 層只保存固定大小的狀態,只有 18 層需要快取。
五個設計,一個模型
KDA · 54 層
Kimi Delta Attention 是線性注意力:每一層不會保留所有過去的 token,而是把對話摺疊進一個固定大小的循環狀態。
為何重要:模型四分之三的層,在第 5 輪和第 500 輪對話時佔用同樣多的記憶體。正因如此,長時間的智能體會話才能在你買得到的硬件上實際運行。
輸入 TOKEN
BCSA · 17 層
Blockway Compressed-Sparse Attention 會完整讀取最近的 4,096 個 token;更早的內容以 4:1 壓縮成區塊,再由學習得來的索引器挑選最相關的 512 個區塊讀取。
為何重要:每個 token 的讀取量是固定的:最近的內容一字不漏,加上遠處真正相關的部分。模型可以回看整個上下文窗口,而不必為逐一讀取全部內容付出代價。
遠端 · 以 4:1 壓縮成區塊
索引器挑選前 512 個區塊
精確窗口
最近 4,096 個 token,全部保留
稠密 · 1 層
最後一層採用傳統的完整注意力:在這裡,每個 token 都能看到其他所有 token。
為何重要:五十四層保持精簡,十七層保持選擇性,再由一層保留完整全貌。
ENGRAM · 附加於 72 層中的 2 層
Engram 是一個哈希 n-gram 記憶,即一個大型的模式查找表,存放在主機記憶體而非加速器上。
為何重要:在自行部署的環境中,GPU 記憶體是最稀缺的資源。Engram 的容量由一般系統記憶體承擔,成本更低、容量更大。
GPU 記憶體
模型權重與快取
主機記憶體
Engram n-gram 記憶
mHC · 4 條通道
傳統 Transformer 只用一條殘差通道在層與層之間傳遞資訊,Volundr 則同時使用四條。
為何重要:在 72 層的深度之間有更多空間傳遞資訊,模型不必把所有東西擠進單一路徑。
稠密模型,不是混合專家
約 32B 參數,每一層都會處理每個 token。沒有隱藏的專家池需要常駐記憶體,佔用空間與標示完全一致,為自家機器規劃容量也因此簡單直接。
發佈時
BF16
全精度
運行需求
兩張 48 GB GPU,或一張 H200
Blockway/Agens-Volundr-32B-Preview
INT4
31.7 GiB
運行需求
一張 48 GB GPU
Blockway/Agens-Volundr-32B-Preview-INT4
262K token 上下文
72 層中 54 層只保存固定大小的狀態,長時間會話同樣可以應付
Apache-2.0 開源權重
於 Hugging Face 發佈,可作商業用途
部署
發佈時需使用 Blockway 的 sglang 版本;原版 sglang 與 vLLM 暫時無法載入
GGUF / llama.cpp
計劃於發佈後推出
模型卡與評測細節將隨權重一併公佈。