KDA · 54 层
不会增长的记忆
Kimi Delta Attention 是线性注意力:每一层不会保留所有过去的 token,而是把对话折叠进一个固定大小的循环状态。
为何重要:模型四分之三的层,在第 5 轮和第 500 轮对话时占用同样多的内存。正因如此,长时间的智能体会话才能在你买得到的硬件上实际运行。
- 固定大小状态
- 没有 KV cache
输入 TOKEN
开源模型 · 预览版 · 即将推出
长上下文,不再被显存拖累。72 层之中,只有 18 层需要 KV cache。一款 32B 稠密开源模型,专为工具调用、编程与长时间工作会话而设计,在企业真正拥有的机器上运行。
问题所在
在传统模型中,每一层注意力都要保留 KV cache,也就是它看过内容的副本,并随每个 token 不断增长。叠上七十二层,到了长上下文时,决定机器能否装下的,是缓存而不是权重。
Volundr 改变了这条曲线的形状。54 层只保存固定大小的状态,只有 18 层需要缓存。
五个设计,一个模型
KDA · 54 层
Kimi Delta Attention 是线性注意力:每一层不会保留所有过去的 token,而是把对话折叠进一个固定大小的循环状态。
为何重要:模型四分之三的层,在第 5 轮和第 500 轮对话时占用同样多的内存。正因如此,长时间的智能体会话才能在你买得到的硬件上实际运行。
输入 TOKEN
BCSA · 17 层
Blockway Compressed-Sparse Attention 会完整读取最近的 4,096 个 token;更早的内容以 4:1 压缩成区块,再由学习得到的索引器挑选最相关的 512 个区块读取。
为何重要:每个 token 的读取量是固定的:最近的内容一字不漏,加上远处真正相关的部分。模型可以回看整个上下文窗口,而不必为逐一读取全部内容付出代价。
远端 · 以 4:1 压缩成区块
索引器挑选前 512 个区块
精确窗口
最近 4,096 个 token,全部保留
稠密 · 1 层
最后一层采用传统的完整注意力:在这里,每个 token 都能看到其他所有 token。
为何重要:五十四层保持精简,十七层保持选择性,再由一层保留完整全貌。
ENGRAM · 附加于 72 层中的 2 层
Engram 是一个哈希 n-gram 记忆,即一个大型的模式查找表,存放在主机内存而非加速器上。
为何重要:在私有化部署的环境中,GPU 显存是最稀缺的资源。Engram 的容量由普通系统内存承担,成本更低、容量更大。
GPU 显存
模型权重与缓存
主机内存
Engram n-gram 记忆
mHC · 4 条通道
传统 Transformer 只用一条残差通道在层与层之间传递信息,Volundr 则同时使用四条。
为何重要:在 72 层的深度之间有更多空间传递信息,模型不必把所有东西挤进单一路径。
稠密模型,不是混合专家
约 32B 参数,每一层都会处理每个 token。没有隐藏的专家池需要常驻显存,占用空间与标示完全一致,为自有机器规划容量也因此简单直接。
发布时
BF16
全精度
运行需求
两张 48 GB GPU,或一张 H200
Blockway/Agens-Volundr-32B-Preview
INT4
31.7 GiB
运行需求
一张 48 GB GPU
Blockway/Agens-Volundr-32B-Preview-INT4
262K token 上下文
72 层中 54 层只保存固定大小的状态,长时间会话同样可以应对
Apache-2.0 开源权重
于 Hugging Face 发布,可用于商业用途
部署
发布时需使用 Blockway 的 sglang 版本;原版 sglang 与 vLLM 暂时无法加载
GGUF / llama.cpp
计划于发布后推出
模型卡与评测细节将随权重一并公布。