EPISODE · Aug 13, 2026 · 4 MIN
Qwen 團隊開放 Qwen3.8-2.4T-A95B 權重,支援 Agent 自主完成長流程開發與研究工作
from EasyVibeCoding Podcast · host ModelScope
Qwen 團隊開放 Qwen3.8-2.4T-A95B 權重,支援 Agent 自主完成長流程開發與研究工作。 這款模型總參數達 2.4T、每個 token 約啟用 95B,並提供可調整的 reasoning、平行 tool calls 與最長 1M context。 模型能力 ModelScope 將 Qwen3.8-Max 定位為 Qwen 迄今最大規模的 open-weight 模型,並列出多項自主工作成果: 在無人值守狀態下連續開發超過 10 天,從零打造可自我演進的 harness。 重現一篇研究論文後,執行 125 小時的 autonomous loop,並取得優於該論文結果的表現。 將晶片設計流程從 RTL 推進到 layout,宣稱將 die area 降低 81%。 來源:@SiliconFlowAI(回覆)|Qwen 3.8 Max 在 PaperBench(93.0)、ERQA(77.8)、PerceptionBench(63.5)、LVBench(81.8)與 OSWorld-Verified(86.1)等多項 Agent 評測中取得領先,而在 SWE-Pro 與 MobileWorld 則由 Fable5 取得最高分。 Qwen3.8-2.4T-A95B 的評測結果也集中在 Agent 實際工作負載:TerminalBench 2.1 為 86.6、PaperBench 為 93.0、CoWorkBench 為 74.8,OSWorld-Verified 則為 86.1。這些數字反映其目標不只是回答問題,而是處理 coding、研究與多步驟操作。 Qwen 3.8 Max 在 PaperBench (93.0)、OSWorld-Verified (86.1) 與 ERQA (77.8) 等多項基準測試取得領先,但在 SWE-Pro (67.7) 與 MobileWorld (77.8) 等項目落後於 Fable5。 架構設計 Hugging Face 模型文件指出,Qwen3.8-2.4T-A95B 採用混合 attention 的 Mixture-of-Experts(MoE)架構,共 92 層,其中 69 層使用 linear attention、23 層使用 full attention;模型配置 512 個 routed experts,每個 token 啟用 10 個,另有一個 shared expert。原生 context window 為 262K,可延伸至 1M,輸出長度最高 128K。 來源:@ClementDelangue(回覆)|Hugging Face 網站介面上 Qwen3.8-2.4T-A95B 模型頁面的標題與標籤區塊,顯示模型名稱、like 數與追蹤數,下方排列有 Text Generation、Transformers、Safetensors 等標籤。 這種設計是為了處理 Agent 工作流程持續累積的系統指示、工具輸出、檢索文件、程式碼、事件紀錄與推理軌跡。full attention 讓模型完整比較 token 關係,linear attention 則以受限的 recurrent state 取代持續增長的 KV cache,藉此控制長 context 下的計算量與記憶體需求。內建的 reasoning 控制提供 low、high、xhigh 三種層級,開發者可依任務在推理品質與吞吐量之間取捨。 部署與供應 Qwen3.8-2.4T-A95B 已同步在 Fireworks 與 SiliconFlow 提供服務,可從 Fireworks 開始建置。SiliconFlow 公布的價格為每 1M tokens:輸入 2 美元、輸出 6 美元、快取輸入 0.25 美元;模型頁面可從 SiliconFlow 試用。模型權重則可從 ModelScope 或 Hugging Face 取得。 來源:@FireworksAIHQ(回覆)|Fireworks 與 Qwen 的雙方品牌識別標誌並列,左側為紫色 Fireworks 字樣與圖示,右側為藍色 Qwen 字樣與圖示,中間有一道垂直分隔線,背景為白底帶有淡紫色漸層。 來源:@SiliconFlowAI(回覆)|SiliconFlow 宣布 Day-0 支援 Qwen3.8-2.4T-A95B,並開放模型上線使用,淡紫色漸層背景中央醒目顯示藍紫色的大標題與網站網址。 硬體效能 NVIDIA 表示,Qwen3.8-2.4T-A95B 在 NVIDIA GB300 NVL72、FP8 精度下,不需額外模型調校即可達到每張 GPU 超過 4K tokens/秒、每位使用者超過 350 tokens/秒。GB300 NVL72 將 72 張 NVIDIA Blackwell Ultra GPU 整合在同一平台,並透過 130 TB/s 的 NVIDIA NVLink 網域支援專家模型所需的高速互連;NVIDIA 也預期後續採用 NVFP4 精度後,效能仍可提升。 來源:@NVIDIAAP(回覆)|Qwen3.8-2.4T-A95B 在 NVIDIA GB300 NVL72 平台上的效能顯示,隨著每位使用者的互動性(TPS per User)提升,每張 GPU 的吞吐量(TPS per GPU)呈下降趨勢。原文:https://easyvibecoding.app/curated/2943-modelscope-qwen3-8-max-weights-autonomous-agent-coding
Embed this episode
Ready to play
Qwen 團隊開放 Qwen3.8-2.4T-A95B 權重,支援 Agent 自主完成長流程開發與研究工作
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.