Blockway

開源模型 · 預覽版 · 即將推出

Agens Volundr

長上下文,不再被記憶體拖累。72 層之中,只有 18 層需要 KV cache。一款 32B 稠密開源模型,專為工具調用、編程與長時間工作會話而設計,在企業真正擁有的機器上運行。

  • 32B · 稠密
  • 72 層
  • 18 層需要 KV cache
  • 262K 上下文
  • Apache-2.0
  • BF16 · INT4
稀疏注意力 · KV cache(17)稠密注意力 · KV cache(1)線性注意力 · 固定大小狀態(54)

問題所在

長上下文首先是記憶體問題,然後才是運算問題

在傳統模型中,每一層注意力都要保留 KV cache,也就是它看過內容的副本,並隨每個 token 不斷增長。疊上七十二層,到了長上下文時,決定機器裝不裝得下的,是快取而不是權重。

Volundr 改變了這條曲線的形狀。54 層只保存固定大小的狀態,只有 18 層需要快取。

上下文長度 →快取記憶體 →每一層都快取Volundr:72 層中 18 層快取
示意圖,非實際比例。

五個設計,一個模型

內部結構,以及為何重要

KDA · 54 層

不會增長的記憶

Kimi Delta Attention 是線性注意力:每一層不會保留所有過去的 token,而是把對話摺疊進一個固定大小的循環狀態。

為何重要:模型四分之三的層,在第 5 輪和第 500 輪對話時佔用同樣多的記憶體。正因如此,長時間的智能體會話才能在你買得到的硬件上實際運行。

  • 固定大小狀態
  • 沒有 KV cache

輸入 TOKEN

狀態固定大小

BCSA · 17 層

近處看得清,遠處看得廣

Blockway Compressed-Sparse Attention 會完整讀取最近的 4,096 個 token;更早的內容以 4:1 壓縮成區塊,再由學習得來的索引器挑選最相關的 512 個區塊讀取。

為何重要:每個 token 的讀取量是固定的:最近的內容一字不漏,加上遠處真正相關的部分。模型可以回看整個上下文窗口,而不必為逐一讀取全部內容付出代價。

  • 4,096 token 精確窗口
  • 遠端 4:1 壓縮
  • 前 512 個區塊

遠端 · 以 4:1 壓縮成區塊

索引器挑選前 512 個區塊

精確窗口

最近 4,096 個 token,全部保留

稠密 · 1 層

一個完整視角

最後一層採用傳統的完整注意力:在這裡,每個 token 都能看到其他所有 token。

為何重要:五十四層保持精簡,十七層保持選擇性,再由一層保留完整全貌。

  • 完整注意力
  • 第 72 層

ENGRAM · 附加於 72 層中的 2 層

把記憶移出 GPU

Engram 是一個哈希 n-gram 記憶,即一個大型的模式查找表,存放在主機記憶體而非加速器上。

為何重要:在自行部署的環境中,GPU 記憶體是最稀缺的資源。Engram 的容量由一般系統記憶體承擔,成本更低、容量更大。

  • 哈希 n-gram 記憶
  • 存放於主機記憶體
  • 附加於其中 2 層

GPU 記憶體

模型權重與快取

主機記憶體

Engram n-gram 記憶

mHC · 4 條通道

四條通道,而不是一條

傳統 Transformer 只用一條殘差通道在層與層之間傳遞資訊,Volundr 則同時使用四條。

為何重要:在 72 層的深度之間有更多空間傳遞資訊,模型不必把所有東西擠進單一路徑。

  • 四條殘差通道

稠密模型,不是混合專家

所見即所用

約 32B 參數,每一層都會處理每個 token。沒有隱藏的專家池需要常駐記憶體,佔用空間與標示完全一致,為自家機器規劃容量也因此簡單直接。

發佈時

發佈內容

BF16

全精度

運行需求

兩張 48 GB GPU,或一張 H200

Blockway/Agens-Volundr-32B-Preview

INT4

31.7 GiB

運行需求

一張 48 GB GPU

Blockway/Agens-Volundr-32B-Preview-INT4

262K token 上下文

72 層中 54 層只保存固定大小的狀態,長時間會話同樣可以應付

Apache-2.0 開源權重

於 Hugging Face 發佈,可作商業用途

部署

發佈時需使用 Blockway 的 sglang 版本;原版 sglang 與 vLLM 暫時無法載入

GGUF / llama.cpp

計劃於發佈後推出

模型卡與評測細節將隨權重一併公佈。

模型自己訓練,硬件由你擁有。

Agens Volundr 32B 預覽版即將推出。關注我們,第一時間取得權重。