EPISODE · Aug 26, 2026 · 7 MIN
Alibaba 開放 Qwen3.8-Flash-Next 權重,以 6B active parameters 探索 Qwen4 成本效率架構
from EasyVibeCoding Podcast · host Qwen
Alibaba 開放 Qwen3.8-Flash-Next 權重,以 6B active parameters 探索 Qwen4 成本效率架構。 Qwen 的 Qwen3.8-Flash 發表宣傳圖,深色背景搭配藍色幾何光暈與幾何立體造型,正中以大字顯示產品名稱與「Now Available」字樣,下方標註「Qwen3.8-Flash-Next:Now Open Weights」。 Qwen3.8-Flash 的 production version 預計很快透過 QwenCloud API 提供,輸入價格為每 1M tokens 0.16 美元、輸出價格為每 1M tokens 0.47 美元。 發布內容 Qwen3.8-Flash-Next 是 multimodal MoE 模型,也是 Qwen4 架構的 early preview。這次先開放權重,讓社群能在 Qwen4 完整模型建立前獨立評估新設計;至於名稱不同的 Qwen3.8-Flash production version,Qwen 表示將稍後透過 QwenCloud API 上線。模型主體有 125B parameters,另配置 51B N-gram Embedding parameters,但每個 token 只啟用 6B parameters。 架構更新 新模型從注意力、殘差、嵌入與最佳化器四個方向改造,重點如下: GDN + QSA Hybrid Attention:Gated DeltaNet(GDN)壓縮歷史資訊;Qwen Sparse Attention(QSA)則使用輕量 indexer,在 micro-block 粒度挑選重要 context,降低長序列 attention 的計算與索引成本。vLLM 的說明指出,每四層中有三層使用 GDN,第四層使用 QSA 精確擷取長距離資訊。 Gated Residual:將 residual stream 擴展為 4 個平行 branches,透過動態 gating 控制跨層資訊的讀取與寫入,改善資訊流動與 training stability;來源也提到 residual state 可使用 FP8 保存,以減少記憶體流量。 N-gram Embedding:利用 local context 對查找表進行 deterministic lookup,以很低的每 token 計算成本增加模型容量。51B 的 embedding table 可放在 host memory,並透過 asynchronous prefetching 與模型計算重疊。 Muon optimizer:Qwen 重新調整正交化、Muon 與 AdamW 的參數分工,以及 fused parameter splitting,並針對新架構重新擬合 scaling law。 MTP:vLLM recipe 指出模型內建 Multi-Token Prediction,可支援 speculative decoding。 Qwen 的混合架構模型層級與運作流程圖,左側展示垂直堆疊的 Vocabulary Embedding、多層 GDN Layer 與 QSA Layer 及 MTP Modules,右側則以方框放大顯示包含 GR Read、GR Write、MoE、Qwen Sparse Attn 與 Gated DeltaNet 的 QSA Layer 與 GDN Layer 詳細內部結構,頂端標有 Qwen商標與 Hybrid Block 參數。 效能與成本 Qwen 表示,Qwen3.8-Flash-Next 的 training cost 僅為 Qwen3.7-Plus 的 1/9,且整體表現超越 Qwen3.7-Plus,尤其在 coding 與 office tasks 有更明顯的提升。官方列出的評測結果包括 DeepSWE 1.1 得分 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、AndroidWorld 84.5,以及 MathVision(with CI)95.7。 Qwen3.8-Flash-Next 在 DeepSWE 1.1 (58.7)、SWE-bench Pro (62.5)、CoWorkBench (73.9) 等多項 Coding 與 Agent 基準測試取得領先,但在 NL2Repo-Bench 與 HLE 等指標上分別落後 DeepSeek-V4-Flash-0731 與 Claude-Opus-4.6 (Max)。 Qwen3.8-Flash-Next 在多數多模態 benchmark 領先;OSWorld 2.0 Binary 與 Qwen3.8-27B 並列 19.4,CharXiv Without CI 則以 84.6 落後 Qwen3.7-Plus 的 85.8。 模型原生支援 262K context,搭配 YaRN 可延伸至 1M。Qwen 貼文指出,在 1M-token context 下,QSA attention kernel 的 prefill 速度最多為 7.6 倍、decode 速度最多為 4.9 倍;在 prefix-cache hit rate 為 90% 時,Qwen3.8-Flash-Next 的 prefill throughput 為 Qwen3.7-Plus 的 8.6 倍。vLLM recipe 另引用 Qwen 的資料,稱在相同 1M-token 條件下可達到最高 10.2 倍 prefill 與 6.6 倍 decode 加速;兩組數字來自不同來源,不能直接視為同一項測試結果。 Qwen3.8-Flash-Next 在 1M context length 下的相對 Prefill Throughput 達到 8.6x,領先 Qwen3.8-27B (1.2x) 與基線 Qwen3.7-Plus (1.0x)。 Qwen3.8-Flash-Next-Base、Qwen3.8-27B-Base 與 Qwen3.7-Plus-Base 在多項基準測試展現各有高低的結果,其中 Qwen3.8-Flash-Next-Base 在 MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM 與 MMMLU 取得最佳分數,而 Qwen3.7-Plus-Base 在 MMLU、MMLU-Redux、GPQA、MATH、MultiPL-E 與 INCLUDE 領先。 外部評測 Arena.ai 表示,Qwen3.8-Flash-Next 在 Code Arena: WebDev 取得 1617 分,約排名第 8;在 open weights 模型中約排名第 3,並比 Qwen3.8-27B 高 22 分。不過這是早期 AutoEval 分數,由以 Arena 人類偏好資料訓練的 Reward Model 代替即時人類投票,後續排名仍可能隨 live votes 增加而變動,因此不宜當成最終排名。 來源:@arena(回覆)|Qwen3.8-Flash-Next 在 Code Arena: WebDev 取得 1617 分的 Arena Score,價格為每 1M tokens $0.39,並位於 Pareto Frontier 上。 來源:@arena(回覆)|Qwen3.8-Flash-Next 在 Code Arena WebDev Top 15 排行榜中取得 1,617 分的 Arena Score(AutoEval),排名約在第 8 名。 部署與生態 Qwen 同步提供 Hugging Face 與 ModelScope 權重;Hugging Face 版本的模型檔案和設定檔相容於 Hugging Face Transformers、vLLM、SGLang 與 TokenSpeed。vLLM 宣布 day-0 支援,並已在 NVIDIA 與 AMD GPU 上驗證;目前建議使用容器映像 vllm/vllm-openai:qwen38-flash-next,而非 PyPI 安裝。N-gram Embedding 的 host-memory offload 需要至少 51 GB 加上 runtime headroom,且目前 offload 僅支援 NVIDIA 裝置;部署時可使用 VLLMPLECPU_OFFLOAD=1,但這是來源所述的環境設定,實際使用仍需依硬體、版本與部署策略人工核對。 來源:@vllmproject(回覆)|Qwen3.8-Flash-Next 模型資訊頁面,展示其架構預覽摘要、Hugging Face 連結及 vLLM 安裝指令與參數設定。 限制與參考 vLLM recipe 將 262,144 tokens 列為原生上限,但單…
Embed this episode
Ready to play
Alibaba 開放 Qwen3.8-Flash-Next 權重,以 6B active parameters 探索 Qwen4 成本效率架構
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.