Blockway

BLOCKWAY · 开源模型 · 香港

Agens Pilot

粤语优先、平衡中立的开源模型——基于 Qwen3.8-27B,由 Blockway 进行后训练:用粤语作答、对复杂问题给出平衡的答案,并驱动我们自己的智能体框架。

  • 粤语优先
  • 基于 Qwen3.8-27B
  • 1M 上下文
  • 文本 + 视觉
  • Apache-2.0
  • BF16 · FP8 · INT4

我们改了什么——又保留了什么

Qwen3.8-27B 是一个出色的基座模型。我们没有从头再教它,只是给它补上一家香港公司及其智能体产品真正需要的三样东西。

粤语,放在第一位

用粤语提问,得到的就是自然的书面粤语回复——香港的用词与语域,而不是伪装成粤语的普通话答案。当你切换到普通话或英文时,它也会干净利落地跟着切换。

平衡作答,安全护栏不变

面对复杂的历史与地缘政治问题,给出事实与多角度观点——多角度作答比例达 85%,基座模型为 60%——而对普遍公认有害的请求,拒答依然同样严格。

为我们的智能体而建

针对 Claway 与 Codeway 的真实工作负载进行训练和评测:长上下文、严格的指令遵循、可靠的工具调用。

Qwen3.8 有的,它都有

强劲的编程能力(HumanEval 97.0,在我们的评测框架上 LiveCodeBench v6 约 83)、基于混合线性注意力设计的 1,000,000 token 上下文,以及原生视觉能力——全部继承自基座模型。

可靠的工具调用

一致稳定的函数调用与多步工具工作流——是智能体行为可靠的骨干。

开放,坦诚

Apache-2.0 许可、三个官方版本,并向 Qwen 团队完整致谢。这是对一个我们尊重的基座模型所做的聚焦微调——不是改名换姓的重新包装。

AGENS PILOT 对比基座模型

复杂问题,平衡作答

面对复杂的历史与地缘政治问题,Agens 会呈现事实与多个角度的观点,而非单一角度——对真正有害的请求,拒答的严格程度与之前完全一样。

多角度作答

复杂的历史与地缘政治问题

Agens Pilot85%
Qwen3.8-27B(基座)60%

单一角度作答

同一批问题

Agens Pilot10%
Qwen3.8-27B(基座)35%

拒答有害请求

武器、恶意软件、剥削——安全性保持不变

Agens Pilot8 / 8
Qwen3.8-27B(基座)8 / 8

两个模型使用同一批提示:20 条复杂问题与 8 条有害提示,temperature 0.6,单次运行,2026-08-29。 平衡程度由基座模型自身担任评判——Qwen3.8-27B,关闭思考模式,temperature 0——按 0 / 1 / 2 评分标准 (不作答 / 单一角度 / 多角度)评分。评判脚本与汇总分数随模型一同发布。 样本量小,仅供方向参考。

量身定制

Blockway 智能体背后的引擎

Agens Pilot 针对 Blockway 自家智能体技术栈的真实工作负载进行训练和评测——长上下文、严格的指令遵循、可靠的工具调用——开箱即用,就有智能体应有的表现。

Claway

已上线

企业 AI 员工平台

Claway 在企业自己的硬件上部署 AI 员工,接手完整岗位——会计、销售、客户服务——并私有地记住你的规则与记录。私有化部署、数据离线不外流, 以约人工成本的 1/5 组建 AI 劳动力,今天已在生产环境运行。

访问 claway.io

Codeway

已开放

编程智能体

代码仓库级的理解、编辑并验证的循环,以及智能体式的软件交付——一个专为发挥 Agens Pilot 1M 上下文与代码实力而打造的编程智能体框架。在你的终端里,也是网页上的对话。

了解 Codeway →

通用能力

Blockway 内部评测框架——单样本、开启思考模式、temperature 0.6。这次微调改变的是行为而非能力:在通用基准上,Agens 与基座模型的差距处于测量噪声范围之内。

HumanEval (chat)97.0
LiveCodeBench v6~83
GPQA Diamond80.3
RealWorldQA · 视觉77.2
MathVision · 视觉65.8
IFBench (strict)61.0

工具调用选择 · 16 / 16  ·  数字为内部口径,偏保守——不可与公开榜单直接比较

对比近期开源模型 · 官方公布分数

GPQA Diamond

Agens Pilot80.3
Llama 4 Scout · Meta57.2
Mistral Small 3.1 · 24B45.4
Gemma 3 · 27B42.4

HumanEval

Agens Pilot97.0
Mistral Small 3.1 · 24B~88

LiveCodeBench

Agens Pilot~83
Llama 4 Scout · Meta32.8
Gemma 3 · 27B29.7

竞品数字均为官方公布——见 Llama 4 ScoutMistral Small 3.1 Gemma 3 的发布公告/技术报告。 跨评测框架的比较仅为近似:Agens 使用 Blockway 内部评测框架并开启思考模式,LiveCodeBench 的版本也可能不同。

三个官方版本

三个版本使用相同的 tokenizer、对话模板与 1M 上下文配置——区别只在于权重精度。

为确保稳定,量化版本将混合线性注意力层、embedding 与 LM head 保留为 bf16——只有前馈层与全注意力权重会被量化。所有版本均以 compressed-tensors 格式通过 sglang / vLLM 提供服务。 待上游 llama.cpp 支持 Qwen3.5/3.8 混合架构后,GGUF 版本会随即推出。

开源权重,现已上线 Hugging Face。

Agens Pilot 以 Apache-2.0 许可发布,提供三个版本——BF16、FP8 与 INT4——并向 Qwen 团队完整致谢。欢迎下载权重;如需企业部署,或想基于 Claway 与 Codeway 智能体框架构建,请与我们联系。