EPISODE · Sep 10, 2026 · 2 MIN
DeepSeek-V4.1-Flash 上線:支援 1M token context,全域 KV 快取每 token 890 bytes
from EasyVibeCoding Podcast · host DeepSeek
DeepSeek-V4.1-Flash 上線:支援 1M token context,全域 KV 快取每 token 890 bytes。發布重點 DeepSeek 於 2026 年 9 月 10 日宣布 DeepSeek-V4.1-Flash,定位為新架構家族中最小的模型,支援原生影像與文字處理,並宣稱在能力、推理速度、吞吐量及擴展至更大型模型方面有所提升。模型已上線 DeepSeek API,將模型設定為 deepseek-flash 即可使用原生多模態支援。架構與效率 DeepSeek-V4.1-Flash 是具備 552B backbone 參數的多模態 MoE,支援最長 1M token context。其 Causal Encoder-Decoder(CED)架構由 20 層 causal encoder 與 20 層 decoder 組成,輸入 prefill 每個 token 啟用 8B 參數,輸出 decode 啟用 16B 參數;模型每層 MoE 使用 1 個 shared expert 與 384 個 routed experts,每個 token 啟用 6 個 routed experts。模型以 45T token 的多模態資料從頭訓練,先以 64K 序列長度訓練稀疏注意力,再於 34T token 時將 context 擴展至 1M token。 Compressed Sparse Attention 2(CSA2)、Hierarchical Sparse Indexer 與 FP4 main KV caching 將 global KV cache 壓至每 token 890 bytes,約為 DeepSeek-V4-Flash 的 1/4。 SWA Bounded Replay 只重建最近的 n_win token,讓持久化 KV 快取降至 DeepSeek-V4-Flash 的約 1/8;公告則概括為 HBM 需求為前代的 1/4、SSD 儲存需求為 1/8。推理控制與 Agent 工作負載 模型提供 1 至 100 的整數 reasoning effort,可連續調整推理成本與準確度之間的取捨。官方將 KV 快取壓縮與 Agent 成本連結,指出 cache-hit 費用常占 Agent 成本很大比例,因此縮小快取可降低長上下文工作負載的服務成本。模型也整合 Engram conditional memory、DSpark speculative decoding 與 Single-Pass mHC 等元件,Post-training 則沿用 SFT → RL → on-policy distillation 流程,主要改動集中在自動合成 Agent 任務、環境與 rollout 的資料管線。評測結果與條件 官方在 DeepSeek 內部 framework、相同評測設定下比較 base models,分數差距在 0.3 內視為等價。DeepSeek-V4.1-Flash-Base 在 MMLU-Pro 得分 74.1、BigCodeBench Pass@1 得分 60.6、HumanEval Pass@1 得分 79.4、GSM8K 得分 93.0;這些結果與 DeepSeek-V4-Flash-Base、DeepSeek-V4-Pro-Base 的比較都屬內部 framework 評測。在 Agent scaffold 測試中,所有設定使用 Linux containers、temperature=1.0、topp=0.95、1M token context limit、maxsteps=500 與 Max reasoning effort;DeepSWE v1.1 使用每項任務 N=8,Terminal-Bench 2.1 使用 N=3,且後者不提供網路。DeepSeek-V4.1-Flash 搭配 DSH Minimal 在 DeepSWE v1.1 得分 72.6、Terminal-Bench 2.1 Pass@1 為 90.6;mini-SWE-agent 則分別為 74.2 與 90.3。DeepSeek-V4.1-Flash 在 DeepSWE v1.1(74.2)、CyberGym(88.1)與 Automation-Bench(54.8)得分領先其他模型,但在 Terminal-Bench 3.0(30.0)落後於 Opus5 與 GPT5.6-Sol。API、相容性與部署 V4-Flash 與 V4-Flash-Vision-Exp 已退役;deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 目前僅暫時路由至 V4.1-Flash,這項相容性路由並非永久安排。已讀來源片段顯示 API 採尖峰/離峰計價,且離峰價格為尖峰價格的 50%;完整價格尚未確認。DeepSeek 也表示會與開源社群合作推進 V4.1-Flash inference 支援及更多部署選項;目前 encoding 資料夾與 deepseek-recipe 提供 prompt 編碼和 API 格式轉換工具,但 model inference、tool execution 與 HTTP transport 仍由呼叫端負責。原文:https://easyvibecoding.app/curated/3303-deepseek-releases-deepseek-v4-1-flash-1m-token-context-kv
Embed this episode
Ready to play
DeepSeek-V4.1-Flash 上線:支援 1M token context,全域 KV 快取每 token 890 bytes
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.