【第663期】分层潜在预测:样本复杂性理论 episode artwork

EPISODE · Jul 24, 2026 · 17 MIN

【第663期】分层潜在预测:样本复杂性理论

from Seventy3

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Learn from your own latents and not from tokens: A sample-complexity theorySummary生成模型——从扩散模型(diffusion models)到大型语言模型(LLMs)——已经取得了卓越的性能,但代价是需要规模远超生物学习系统的数据进行训练,其训练数据量通常比生物学习者所需的数据高出数个数量级。近年来,一种新的学习范式逐渐兴起:网络不再预测原始输入,而是预测自身对于相关视图(related views)或被遮蔽区域(masked regions)的潜在表示(latent representations),代表性方法包括 data2vec 和 JEPA(Joint Embedding Predictive Architecture)。这一思想也与神经科学中关于大脑皮层**预测编码(predictive coding)**的理论相呼应。尽管这些方法已经取得了优异的实验效果,但其理论基础仍然缺乏充分理解。其中两个核心问题是:预测潜在表示究竟能够在多大程度上提升数据效率(data efficiency)?将这种潜在预测机制堆叠成多尺度层次结构(multi-scale hierarchies)是否能够进一步带来收益?本文针对这两个问题给出了理论回答。作者采用了一种**可解析的概率上下文无关文法(Probabilistic Context-Free Grammar,PCFG)**作为数据生成模型,以模拟自然语言和图像所具有的组合结构(compositional structure)。在该模型中,数据的生成过程如下:首先构造一个深度为 LL 的隐藏符号树(latent tree);然后递归应用文法产生式(production rules);最终生成由可观测 token 构成的字符串。在这一数据模型下,作者证明:无论是监督学习(supervised learning)还是基于 Token 的自监督学习(token-level self-supervised learning),若要恢复隐藏树结构,都需要**关于树深度 LL 指数增长(exponential in LL)**数量的训练样本。相比之下,**潜在表示预测(latent prediction)仅需与树深度 LL 无关(constant in LL)**的样本数量(除去对数因子),即可恢复相同的隐藏结构。这意味着,相对于传统监督学习和 Token 级自监督学习,潜在预测能够将样本复杂度从指数级降低到常数级(忽略对数项)。作者进一步通过三方面验证了这一理论结果:层次聚类算法(hierarchical clustering algorithm);一个端到端神经网络,其中每一层都包含预测器(predictor)和聚类器(clusterer)模块,并通过梯度下降不断预测自身的潜在表示,实现逐层的潜在预测;首次对 data2vec 的样本复杂度进行了理论分析,证明 data2vec 实际上隐式地(implicitly)执行了层次化潜在预测(hierarchical latent prediction)。基于这些分析,作者进一步指出:由于 data2vec 已经在内部实现了层次化的潜在预测,因此再显式地构建多层预测结构(例如 H-JEPA 这类层次化 JEPA 架构)所带来的额外收益其实非常有限,在很大程度上是**冗余(largely redundant)**的。总体而言,本文从理论上解释了为什么预测潜在表示能够显著提高数据效率,并表明这种优势已经能够通过 data2vec 等方法自然实现,而无需额外设计复杂的层次化预测架构。原文链接:https://arxiv.org/abs/2605.27734前往小宇宙评论区与主播互动

Episode metadata supplied by the publisher feed · Published Jul 24, 2026

Embed this episode

NOW PLAYING

【第663期】分层潜在预测:样本复杂性理论

0:00 17:40

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Seventy3?

This episode is 17 minutes long.

When was this Seventy3 episode published?

This episode was published on July 24, 2026.

Can I download this Seventy3 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!