廣東話,放在第一位
以廣東話書寫,回覆便是自然的書面廣東話——香港的用字與語域,而非偽裝成廣東話的普通話答案。你轉用普通話或英文時,它亦會乾淨利落地跟着切換。
BLOCKWAY · 開源模型 · 香港
廣東話優先、持平中立的開源模型——建基於 Qwen3.8-27B,由 Blockway 進行後訓練:以廣東話作答、對複雜問題給出持平答案,並驅動我們自家的智能體框架。
Qwen3.8-27B 是一個出色的基座模型。我們沒有從頭再教它,只是給它補上一家香港公司及其智能體產品真正需要的三樣東西。
以廣東話書寫,回覆便是自然的書面廣東話——香港的用字與語域,而非偽裝成廣東話的普通話答案。你轉用普通話或英文時,它亦會乾淨利落地跟着切換。
面對複雜的歷史與地緣政治問題,給出事實與多角度觀點——多角度作答比例達 85%,基座模型則為 60%——而對普世公認有害的請求,拒答依然一樣嚴格。
針對 Claway 與 Codeway 的真實工作負載進行訓練和評測:長上下文、嚴格的指令遵循、可靠的工具調用。
強勁的編程能力(HumanEval 97.0,在我們的評測框架上 LiveCodeBench v6 約 83)、建基於混合線性注意力設計的 1,000,000 token 上下文,以及原生視覺能力——全部繼承自基座模型。
一致穩定的函數調用與多步工具工作流——是智能體行為可靠的骨幹。
Apache-2.0 授權、三個官方版本,並向 Qwen 團隊完整致謝。這是對一個我們尊重的基座模型所做的聚焦微調——不是改名換姓的再包裝。
AGENS PILOT 對比基座模型
面對複雜的歷史與地緣政治問題,Agens 會呈現事實與多個角度的觀點,而非單一角度——對真正有害的請求,拒答的嚴格程度與之前完全一樣。
多角度作答
複雜的歷史與地緣政治問題
單一角度作答
同一批問題
拒答有害請求
武器、惡意軟件、剝削——安全性保持不變
兩個模型使用同一批提示:20 條複雜問題與 8 條有害提示,temperature 0.6,單次運行,2026-08-29。 持平程度由基座模型自身擔任評判——Qwen3.8-27B,關閉思考模式,temperature 0——按 0 / 1 / 2 評分標準 (不作答 / 單一角度 / 多角度)評分。評判腳本與匯總分數隨模型一同發佈。 樣本量小,僅供方向參考。
度身訂造
Agens Pilot 針對 Blockway 自家智能體技術棧的真實工作負載進行訓練和評測——長上下文、嚴格的指令遵循、可靠的工具調用——開箱即用,就有智能體應有的表現。
企業 AI 僱員平台
Claway 在企業自己的硬件上部署 AI 僱員,接手完整職位——會計、銷售、客戶服務——並私有地記住你的規則與紀錄。私有化部署、數據離線不外流, 以大約人手成本的 1/5 組建 AI 勞動力,今天已在生產環境運行。
瀏覽 claway.io編程智能體
整個程式庫規模的理解、編輯並驗證的循環,以及智能體式的軟件交付——一個專為發揮 Agens Pilot 1M 上下文與程式碼實力而打造的編程智能體框架。在你的終端裏,亦是網頁上的對話。
了解 Codeway →Blockway 內部評測框架——單樣本、開啟思考模式、temperature 0.6。這次微調改變的是行為而非能力:在通用基準上,Agens 與基座模型的差距處於測量噪聲範圍之內。
工具調用選擇 · 16 / 16 · 數字為內部口徑,偏保守——不可與公開榜單直接比較
對比近期開源模型 · 官方公佈分數
GPQA Diamond
HumanEval
LiveCodeBench
對手數字均為官方公佈——見 Llama 4 Scout、Mistral Small 3.1 與 Gemma 3 的發佈公告/技術報告。 跨評測框架的比較只屬約略:Agens 使用 Blockway 內部評測框架並開啟思考模式,LiveCodeBench 的版本亦可能不同。
三個版本使用相同的 tokenizer、對話模板與 1M 上下文配置——分別只在於權重精度。
~51 GB
~34 GB
~26 GB
Agens Pilot 以 Apache-2.0 授權發佈,提供三個版本——BF16、FP8 與 INT4——並向 Qwen 團隊完整致謝。歡迎下載權重;如需企業部署,或想基於 Claway 與 Codeway 智能體框架構建,請與我們聯絡。