Blockway

开源模型 · 预览版 · 即将推出

Agens Volundr

长上下文,不再被显存拖累。72 层之中,只有 18 层需要 KV cache。一款 32B 稠密开源模型,专为工具调用、编程与长时间工作会话而设计,在企业真正拥有的机器上运行。

  • 32B · 稠密
  • 72 层
  • 18 层需要 KV cache
  • 262K 上下文
  • Apache-2.0
  • BF16 · INT4
稀疏注意力 · KV cache(17)稠密注意力 · KV cache(1)线性注意力 · 固定大小状态(54)

问题所在

长上下文首先是内存问题,然后才是算力问题

在传统模型中,每一层注意力都要保留 KV cache,也就是它看过内容的副本,并随每个 token 不断增长。叠上七十二层,到了长上下文时,决定机器能否装下的,是缓存而不是权重。

Volundr 改变了这条曲线的形状。54 层只保存固定大小的状态,只有 18 层需要缓存。

上下文长度 →缓存内存 →每一层都缓存Volundr:72 层中 18 层缓存
示意图,非实际比例。

五个设计,一个模型

内部结构,以及为何重要

KDA · 54 层

不会增长的记忆

Kimi Delta Attention 是线性注意力:每一层不会保留所有过去的 token,而是把对话折叠进一个固定大小的循环状态。

为何重要:模型四分之三的层,在第 5 轮和第 500 轮对话时占用同样多的内存。正因如此,长时间的智能体会话才能在你买得到的硬件上实际运行。

  • 固定大小状态
  • 没有 KV cache

输入 TOKEN

状态固定大小

BCSA · 17 层

近处看得清,远处看得广

Blockway Compressed-Sparse Attention 会完整读取最近的 4,096 个 token;更早的内容以 4:1 压缩成区块,再由学习得到的索引器挑选最相关的 512 个区块读取。

为何重要:每个 token 的读取量是固定的:最近的内容一字不漏,加上远处真正相关的部分。模型可以回看整个上下文窗口,而不必为逐一读取全部内容付出代价。

  • 4,096 token 精确窗口
  • 远端 4:1 压缩
  • 前 512 个区块

远端 · 以 4:1 压缩成区块

索引器挑选前 512 个区块

精确窗口

最近 4,096 个 token,全部保留

稠密 · 1 层

一个完整视角

最后一层采用传统的完整注意力:在这里,每个 token 都能看到其他所有 token。

为何重要:五十四层保持精简,十七层保持选择性,再由一层保留完整全貌。

  • 完整注意力
  • 第 72 层

ENGRAM · 附加于 72 层中的 2 层

把记忆移出 GPU

Engram 是一个哈希 n-gram 记忆,即一个大型的模式查找表,存放在主机内存而非加速器上。

为何重要:在私有化部署的环境中,GPU 显存是最稀缺的资源。Engram 的容量由普通系统内存承担,成本更低、容量更大。

  • 哈希 n-gram 记忆
  • 存放于主机内存
  • 附加于其中 2 层

GPU 显存

模型权重与缓存

主机内存

Engram n-gram 记忆

mHC · 4 条通道

四条通道,而不是一条

传统 Transformer 只用一条残差通道在层与层之间传递信息,Volundr 则同时使用四条。

为何重要:在 72 层的深度之间有更多空间传递信息,模型不必把所有东西挤进单一路径。

  • 四条残差通道

稠密模型,不是混合专家

所见即所用

约 32B 参数,每一层都会处理每个 token。没有隐藏的专家池需要常驻显存,占用空间与标示完全一致,为自有机器规划容量也因此简单直接。

发布时

发布内容

BF16

全精度

运行需求

两张 48 GB GPU,或一张 H200

Blockway/Agens-Volundr-32B-Preview

INT4

31.7 GiB

运行需求

一张 48 GB GPU

Blockway/Agens-Volundr-32B-Preview-INT4

262K token 上下文

72 层中 54 层只保存固定大小的状态,长时间会话同样可以应对

Apache-2.0 开源权重

于 Hugging Face 发布,可用于商业用途

部署

发布时需使用 Blockway 的 sglang 版本;原版 sglang 与 vLLM 暂时无法加载

GGUF / llama.cpp

计划于发布后推出

模型卡与评测细节将随权重一并公布。

模型自己训练,硬件由你拥有。

Agens Volundr 32B 预览版即将推出。关注我们,第一时间获取权重。