Blockway

BLOCKWAY · 開源模型 · 香港

Agens Pilot

廣東話優先、持平中立的開源模型——建基於 Qwen3.8-27B,由 Blockway 進行後訓練:以廣東話作答、對複雜問題給出持平答案,並驅動我們自家的智能體框架。

  • 廣東話 first
  • 建基於 Qwen3.8-27B
  • 1M 上下文
  • 文字 + 視覺
  • Apache-2.0
  • BF16 · FP8 · INT4

我們改了什麼——又保留了什麼

Qwen3.8-27B 是一個出色的基座模型。我們沒有從頭再教它,只是給它補上一家香港公司及其智能體產品真正需要的三樣東西。

廣東話,放在第一位

以廣東話書寫,回覆便是自然的書面廣東話——香港的用字與語域,而非偽裝成廣東話的普通話答案。你轉用普通話或英文時,它亦會乾淨利落地跟着切換。

持平作答,安全護欄不變

面對複雜的歷史與地緣政治問題,給出事實與多角度觀點——多角度作答比例達 85%,基座模型則為 60%——而對普世公認有害的請求,拒答依然一樣嚴格。

為我們的智能體而建

針對 Claway 與 Codeway 的真實工作負載進行訓練和評測:長上下文、嚴格的指令遵循、可靠的工具調用。

Qwen3.8 有的,它都有

強勁的編程能力(HumanEval 97.0,在我們的評測框架上 LiveCodeBench v6 約 83)、建基於混合線性注意力設計的 1,000,000 token 上下文,以及原生視覺能力——全部繼承自基座模型。

可靠的工具調用

一致穩定的函數調用與多步工具工作流——是智能體行為可靠的骨幹。

開放,坦誠

Apache-2.0 授權、三個官方版本,並向 Qwen 團隊完整致謝。這是對一個我們尊重的基座模型所做的聚焦微調——不是改名換姓的再包裝。

AGENS PILOT 對比基座模型

複雜問題,持平作答

面對複雜的歷史與地緣政治問題,Agens 會呈現事實與多個角度的觀點,而非單一角度——對真正有害的請求,拒答的嚴格程度與之前完全一樣。

多角度作答

複雜的歷史與地緣政治問題

Agens Pilot85%
Qwen3.8-27B(基座)60%

單一角度作答

同一批問題

Agens Pilot10%
Qwen3.8-27B(基座)35%

拒答有害請求

武器、惡意軟件、剝削——安全性保持不變

Agens Pilot8 / 8
Qwen3.8-27B(基座)8 / 8

兩個模型使用同一批提示:20 條複雜問題與 8 條有害提示,temperature 0.6,單次運行,2026-08-29。 持平程度由基座模型自身擔任評判——Qwen3.8-27B,關閉思考模式,temperature 0——按 0 / 1 / 2 評分標準 (不作答 / 單一角度 / 多角度)評分。評判腳本與匯總分數隨模型一同發佈。 樣本量小,僅供方向參考。

度身訂造

Blockway 智能體背後的引擎

Agens Pilot 針對 Blockway 自家智能體技術棧的真實工作負載進行訓練和評測——長上下文、嚴格的指令遵循、可靠的工具調用——開箱即用,就有智能體應有的表現。

Claway

已上線

企業 AI 僱員平台

Claway 在企業自己的硬件上部署 AI 僱員,接手完整職位——會計、銷售、客戶服務——並私有地記住你的規則與紀錄。私有化部署、數據離線不外流, 以大約人手成本的 1/5 組建 AI 勞動力,今天已在生產環境運行。

瀏覽 claway.io

Codeway

已開放

編程智能體

整個程式庫規模的理解、編輯並驗證的循環,以及智能體式的軟件交付——一個專為發揮 Agens Pilot 1M 上下文與程式碼實力而打造的編程智能體框架。在你的終端裏,亦是網頁上的對話。

了解 Codeway →

通用能力

Blockway 內部評測框架——單樣本、開啟思考模式、temperature 0.6。這次微調改變的是行為而非能力:在通用基準上,Agens 與基座模型的差距處於測量噪聲範圍之內。

HumanEval (chat)97.0
LiveCodeBench v6~83
GPQA Diamond80.3
RealWorldQA · 視覺77.2
MathVision · 視覺65.8
IFBench (strict)61.0

工具調用選擇 · 16 / 16  ·  數字為內部口徑,偏保守——不可與公開榜單直接比較

對比近期開源模型 · 官方公佈分數

GPQA Diamond

Agens Pilot80.3
Llama 4 Scout · Meta57.2
Mistral Small 3.1 · 24B45.4
Gemma 3 · 27B42.4

HumanEval

Agens Pilot97.0
Mistral Small 3.1 · 24B~88

LiveCodeBench

Agens Pilot~83
Llama 4 Scout · Meta32.8
Gemma 3 · 27B29.7

對手數字均為官方公佈——見 Llama 4 ScoutMistral Small 3.1 Gemma 3 的發佈公告/技術報告。 跨評測框架的比較只屬約略:Agens 使用 Blockway 內部評測框架並開啟思考模式,LiveCodeBench 的版本亦可能不同。

三個官方版本

三個版本使用相同的 tokenizer、對話模板與 1M 上下文配置——分別只在於權重精度。

為確保穩定,量化版本將混合線性注意力層、embedding 與 LM head 保留為 bf16——只有前饋層與全注意力權重會被量化。所有版本均以 compressed-tensors 格式經 sglang / vLLM 提供服務。 待上游 llama.cpp 支援 Qwen3.5/3.8 混合架構後,GGUF 版本會隨即推出。

開源權重,現已上架 Hugging Face。

Agens Pilot 以 Apache-2.0 授權發佈,提供三個版本——BF16、FP8 與 INT4——並向 Qwen 團隊完整致謝。歡迎下載權重;如需企業部署,或想基於 Claway 與 Codeway 智能體框架構建,請與我們聯絡。