【第672期】FlashMemory-DeepSeek-V4:前瞻稀疏注意力的超长上下文技术 episode artwork

EPISODE · Aug 2, 2026 · 17 MIN

【第672期】FlashMemory-DeepSeek-V4:前瞻稀疏注意力的超长上下文技术

from Seventy3

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse AttentionSummary传统大语言模型(LLM)在解码阶段需要将全部 KV 缓存(KV Cache)保持加载状态,这导致在超长上下文服务场景下面临严重的 GPU 显存瓶颈。在本报告中,我们提出了前瞻稀疏注意力(Lookahead Sparse Attention,简称 LSA),这是一种由基于 DeepSeek-V4 架构构建的神经记忆索引器(Neural Memory Indexer)驱动的全新推理范式。与被动地对所有历史 Token 进行注意力计算不同,LSA 能够主动预测未来的上下文需求,并仅在 GPU 显存中保留对查询至关重要的 KV 块(KV Chunks)。关键在于,我们通过脱离骨干模型的解耦训练(backbone-free decoupled training)策略实例化了该架构。通过将索引器构建为标准的双编码器(dual-encoder)架构,我们利用标准的检索训练框架对其进行独立训练,而无需将庞大的骨干模型加载到 GPU 显存中。我们证明了这种“少即是多”的范式在大幅提升服务效率的同时,还能在依赖长期全局记忆的任务中充当有效的注意力去噪器(attention denoiser)。在主流的长上下文评估套件(例如 LongBench-v2、LongMemEval 和 RULER)中,FM-DS-V4 将平均物理 KV 缓存占用大幅压缩至全上下文基线(full-context baseline)的 13.5%,同时持续保持甚至略微提升了下游任务的准确率(平均绝对提升 +0.6%)。在 1M(百万)上下文长度下,每个解码 Token 的计算量降至基线的 0.30 倍,GPU KV 缓存体积缩减了 90%(从 3.73 GB 降至 0.37 GB),从而在 8× H20 GPU 上的首字/解码分离(PD-disaggregated)服务中,实现了2.8 倍的总吞吐量提升和 2.7 倍的并发量提升。原文链接:https://arxiv.org/abs/2606.09079前往小宇宙评论区与主播互动

Episode metadata supplied by the publisher feed · Published Aug 2, 2026

Embed this episode

Ready to play

【第672期】FlashMemory-DeepSeek-V4:前瞻稀疏注意力的超长上下文技术

0:00 17:47

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Seventy3?

This episode is 17 minutes long.

When was this Seventy3 episode published?

This episode was published on August 2, 2026.

Can I download this Seventy3 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!