PODCAST · technology
Seventy3
by 任雨山
73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。
-
627
【第687期】自我对弈强化学习:30分钟数据教AI像人开车
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Human-like autonomy emerges from self-play and a pinch of human dataSummary自我对弈强化学习(Self-play reinforcement learning)近期成为一种无需任何人类数据即可训练驾驶策略的新方法。它利用低成本、大规模的仿真模拟来替代昂贵且大规模的人类驾驶演示。然而,该方法存在一个关键局限:通过纯自我对弈训练出的策略可能会学到有效但异类(alien)的驾驶习惯,与人类的习惯互不兼容。先前的研究尝试通过大量的奖励工程(reward engineering)和领域随机化(domain randomization)来缓解这种行为上的不对齐,但这些做法往往脆弱且耗费人力。与完全抛弃人类演示不同,我们的方法将人类演示作为一种正则化目标,叠在极简的安全目标达成的奖励之上。正如好汤中的调味香料,我们发现少许人类数据就能起到极大的作用:我们的方法仅使用了 30 分钟的人类演示,比同类模仿学习方法减少了 2500 倍的数据量。由此产生的策略能够与未参与训练的人类轨迹达成协调,且在单块消费级 GPU 上仅需 15 小时即可完成训练。原文链接:https://arxiv.org/abs/2606.19370前往小宇宙评论区与主播互动
-
626
【第686期】大语言模型智能体通信协议技术分类
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:A Technical Taxonomy of LLM Agent Communication ProtocolsSummary随着大语言模型(LLM)的发展,以及多智能体系统(multi-agent systems)致力于突破单体智能体的局限,稳健的通信协议正在成为分布式智能体网络不可或缺的基础设施。然而,碎片化的协议格局带来了显著的互操作性挑战。本研究建立了一个技术分类法(taxonomy),用以分类和分析 LLM 智能体通信协议。遵循成熟的迭代方法,我们定义了该分类法的目标、元特征及终止条件,随后对 9 个活跃维护且具备明确应用案例的开源协议开展了 5 轮迭代(3 轮由经验到概念,2 轮由概念到经验)。该分类法包含 5 个维度:对手方(counterparty)、有效载荷(payload)、交互状态(interaction state)、发现机制(discovery mechanism)以及架构模式/模式灵活性(schema flexibility)。分类结果揭示了屡次出现的架构模式:所有抽样的智能体对智能体(agent-to-agent)协议均结合了混合有效载荷与会话状态持久化;大多数协议支持多种预定义模式(schema),其中两个协议支持运行时模式协商,这表明协议正在走向模式灵活性;去中心化的发现机制依然罕见。分析表明,短期内存在将智能体对智能体通信与智能体对上下文(工具和数据)通信进行统一的协议收敛压力。然而从长期来看,没有任何单一协议能够同时实现通用性、效率和便携性的最大化。该领域更有可能演进为一个联邦化、分层的协议栈。该框架为协议选择提供了指导,并突出了隐私保护和策略执行等尚存的研究空白。原文链接:https://arxiv.org/abs/2606.19135前往小宇宙评论区与主播互动
-
625
【第685期】Agent-as-a-Router:编程任务的智能模型路由框架
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Agent-as-a-Router: Agentic Model Routing for Coding TasksSummary在现实场景中,用户通常可以接入来自不同供应商的多个大语言模型(LLM),且这些 LLM 往往在不同的领域各有所长,但没有单个模型能够独霸所有领域。因此,将每个任务路由至最合适的模型,对于提升性能和控制成本均至关重要。现有的路由器将该问题视为一种静态的、一次性的分类问题。然而,我们发现这些路由器的性能瓶颈在于信息匮乏:仅仅为原生 LLM 路由器补充任务维度层面的性能统计数据,就能带来 15.3% 的相对收益,超越基于同等维度先验构建的启发式路由方式。受此发现启发,我们提出了 Agent-as-a-Router 框架,将路由过程形式化为一个 C-A-F 循环(上下文 Context →行动 Action → 反馈 Feedback → 上下文 Context)。该框架通过在部署期间不断积累基于执行实践的经验,填补了信息鸿沟。我们将该框架实例化为 ACRouter(由协调器 Orchestrator、验证器 Verifier 和记忆模块 Memory 组成),并推出了 CodeRouterBench 评估环境——该环境包含约 1 万个任务实例,并附带来自 8 个前沿 LLM 的验证得分,从而支持在流式任务上进行基于“后悔值”(regret-based)的路由器对比。实验表明,ACRouter 在域内(in-distribution)任务上取得了最低的累计后悔值,并且能够泛化至域外的具主体性编程(agentic-programming)任务,证明了我们的路由框架能够主动弥合信息差。原文链接:https://arxiv.org/abs/2606.22902前往小宇宙评论区与主播互动
-
624
【第684期】Autodata:以智能体模拟数据科学家构建高质量合成数据
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Autodata: An agentic data scientist to create high quality synthetic dataSummary我们推出了 Autodata,这是一种能够让 AI 智能体充当“数据科学家”来构建高质量训练和评估数据的通用方法。我们展示了如何训练(元优化,meta-optimize)这样一个数据科学家智能体,使其学会创建质量更高的数据。我们阐述了其整体公式设计,以及一个具体的实用实现方案——Agentic Self-Instruct。我们在计算机科学研究任务、法律推理任务以及数学对象推理任务上进行了实验,与传统合成数据集创建方法相比,我们取得了更优异的结果。此外,对数据科学家智能体本身进行元优化,带来了更为显著的性能提升。具主体性的数据创建(Agentic data creation)提供了一种将增加的推理算力转化为更高质量模型训练的途径。总体而言,我们相信这一方向有望改变我们构建 AI 数据的方式。原文链接:https://arxiv.org/abs/2606.25996前往小宇宙评论区与主播互动
-
623
【第683期】Agent-Native Memory System的现状与评估综述
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Are We Ready For An Agent-Native Memory System?Summary大语言模型(LLM)智能体的记忆系统已迅速从简单的检索增强机制,演变为能够在智能体执行过程中支持持久化信息存储、检索、更新、整合以及动态生命周期管理的数据管理系统。尽管有了这样的演进,现有评估仍主要通过端到端任务成功率指标(例如 F1、BLEU)来对智能体记忆进行基准测试,同时将底层系统视为一个单体黑盒。因此,包括运营成本、跨记忆模块的架构权衡以及在动态知识更新下的鲁棒性等关键系统层面的关切,依然缺乏充分探讨。在本文中,我们从数据管理的视角对智能体记忆进行了系统的实验研究。我们提出了一个分析框架,将智能体记忆拆解为四个核心模块:记忆表示与存储(memory representation and storage)抽取(extraction)检索与路由(retrieval and routing)维护(maintenance)在该框架下,我们在涵盖 11 个数据集的 5 个基准工作负载上,评估了 12 个具有代表性的记忆系统和 2 个参考基准(baselines)。我们广泛的端到端评估表明,没有任何单一架构能在所有场景中占据绝对主导地位;相反,其有效性在很大程度上取决于记忆结构与工作负载瓶颈的匹配程度。此外,通过细粒度的消融实验,我们量化了各模块对表示忠实度、检索精确度、更新正确性以及长程稳定性的具体影响。最后,我们揭示了在现实工作负载下的成本与性能权衡,表明局部维护比全局重组具有更高的成本效益。基于这些发现,我们指出了构建真正“智能体原生”(agent-native)记忆系统的前景方向。原文链接:https://arxiv.org/abs/2606.24775前往小宇宙评论区与主播互动
-
622
【第682期】Sakana Fugu 技术报告:通过集体智能实现模型编排
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Sakana Fugu Technical ReportSummary前沿大语言模型(LLM)的能力持续提升,不同的提供商也日益在各自的领域形成独特优势。这自然引出了下一个目标:如何将各个 LLM 的独特专长整合为一个协同智能系统。为此,我们报告了 Sakana Fugu 的研发进展——这是一个协调器(orchestrator)模型家族,旨在驾驭并放大 LLM 智能体团队的能力。Fugu 模型本身也是语言模型,经过专门训练后,能够理解用户查询并动态设计“具主体性”(agentic)的支架来解决问题。通过这些自适应支架,Fugu 释放出了超越任何单一 LLM 智能体的高强性能,在一系列极具挑战性的任务中(包括 SWE-Bench Pro、Terminal Bench、LiveCodeBench、GPQA-Diamond、Humanity's Last Exam 以及 CharXiv Reasoning),相较于其他公开可用的模型取得了最前沿(SOTA)的成果。我们发布了两款模型:Fugu:兼顾性能与延迟,适合日常使用;Fugu-Ultra:在极高难度的任务上优先保证回答质量。我们详细阐述了自身的训练范式——涵盖大规模微调、进化算法与强化学习方法,以及将这些方法转化为生产级系统的基础设施和核心设计原则。我们希望本报告能够推动对多智能体系统以及“动态/查询自适应”智能体支架的进一步研究,将其作为通过群体智能迈向 AI 能力下一前沿的有效路径。原文链接:https://arxiv.org/abs/2606.21228前往小宇宙评论区与主播互动
-
621
【第681期】Critique of Agent Model:从代理系统到自主主体的演进
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Critique of Agent ModelSummary什么是智能体(Agent)?什么构成了主体性(Agency)?随着被营销为“编程智能体”、“AI联合科学家”以及其他承诺能大幅提升生产力的“具主体性”(agentic)工具的崛起,与此同时,关于AI可能在推测性的“机器主体性”驱使下摆脱人类控制并施加破坏性力量等“生存级”担忧也日益增长。在此背景下,无论对于构建能力强大的系统,还是对于理解我们是否以及该恐惧什么,明确自动化在哪里终结、主体性从哪里开始,都已变得至关重要。借鉴笛卡尔将主体性建立在独立思考之上的观点,以及科幻小说中对自主存在的描绘,我们综述了当前AI智能体的现状,并从五个维度分析了智能体架构:目标(goal)、身份(identity)、决策(decision-making)、自我调节(self-regulation)和学习(learning)。具体而言,我们认为真正的主体性要求这些结构内化于系统本身内部,而非通过外部支架搭建而成。这种在“代理型”(agentic)系统(其能力依赖于工程化的工作流)与“主体型”(agentive)系统(其能力包括社交互动,均源于内生)之间的区分,划清了专为预设任务设计的系统与能够在开放世界中以真正自主性运行的系统之间的界限。基于这一分析,我们提出了一种用于通用智能体模型的“目标-身份-配置器”(Goal-Identity-Configurator, GIC)架构,它结合了层级化目标分解、身份演化、基于独立训练的世界模型的模拟推理、习得性自我调节,以及来自真实与模拟经验的自主学习。此外,我们还就拥有更高自主性和“主体性”但仍处于人类监督之下的主体型系统的可审计性、可控性和安全性分享了见解。原文链接:https://arxiv.org/abs/2606.23991前往小宇宙评论区与主播互动
-
620
【第680期】世界价值模型:机器人操纵的通用价值评估
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:World Value Models for Robotic ManipulationSummary通用价值模型(Generalist value models)在从大规模、质量混合的数据中扩展机器人策略学习方面发挥着关键作用。从数学角度来看,准确的价值估计需要深刻的时序理解,这要求模型既能利用历史上下文来锚定当前信念,又能对未来结果进行规划。然而,大多数现有的机器人价值模型都是基于视觉语言模型(VLM)底座构建的,这些底座主要在静态或时序稀疏的视觉观测数据上进行预训练,缺乏价值估计所需的时序建模能力。与 VLM 不同,世界模型(world models)天然擅长时序建模与未来规划,这使其成为学习具备泛化能力的价值函数的理想基础。基于这一洞察,我们将世界模型与价值估计相结合,构建了一种全新的机器人通用价值模型——世界价值模型(World Value Model,简称 WVM),能够提供准确的任务进度预测以评估数据质量。在标准基准测试中,WVM 取得了最先进的(SOTA)价值顺序相关性(VOC)结果。除了仅包含专家数据的标准评估套件外,我们还推出了 Suboptimal-Value-Bench,这是一个多具身(multi-embodiment)基准测试,由 800 条包含高保真、人工标注帧标签的次优轨迹组成。评估表明,WVM 在 Suboptimal-Value-Bench 上依然保持了 SOTA 性能,证实了其在处理专家数据和次优数据时的鲁棒性。当应用于策略学习时,无论在模拟环境还是真实世界的部署中,WVM 都提升了各种策略提取方法的操纵性能,为从混合质量的数据中进行学习提供了稳健的指导。原文链接:https://arxiv.org/abs/2606.24742前往小宇宙评论区与主播互动
-
619
【第679期】PAPO:对齐扩散大语言模型推理的奖励与状态
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language ModelsSummary强化学习(RL)在提升扩散大语言模型(dLLM)的推理能力方面蕴含着巨大的潜力。然而,这一领域的进展从根本上受到了真实生成轨迹与梯度更新过程之间“双重错位”(dual misalignment)的限制:过程-奖励错位(Process-reward misalignment):稀疏的终局奖励被无差别地赋予给生成过程的所有中间步骤,无法提供区分度高的信用分配(credit assignment)。状态-轨迹错位(State-trajectory misalignment):策略更新往往偏离至人造的、脱离轨迹的状态,将梯度浪费在信息量较低的样本上。为了解决这些局限,我们提出了过程对齐策略优化(Process Aligned Policy Optimization,简称 PAPO)。这是一个全新的框架,通过两大机制将 RL 更新与 dLLM 的生成轨迹进行整体对齐:步骤感知过程奖励(Step-Aware Process Rewards,简称 SPR):将稀疏的终局奖励转化为密集的步骤级信用;熵引导历史重演(Entropy-Guided Historical Re-enactment,简称 EHR):在高不确定性步骤下重演真实轨迹。在四个基准测试上的大量实验表明,PAPO 显著优于基线方法,在 GSM8K 上实现了高达 4.5% 的提升, MATH500 上提升 4.8%, Countdown 上提升 42.2%, 数独(Sudoku)上提升 16.1%。原文链接:https://arxiv.org/abs/2606.08501前往小宇宙评论区与主播互动
-
618
【第678期】OpenClaw-Skill:基于集合技能树搜索的智能体强化学习
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language ModelsSummary为大语言模型(LLM)Agent 赋予有效的技能,对于解决像 OpenClaw 这类现实世界系统中的复杂任务至关重要。在这项工作中,我们的目标是开发一个能够自动构建此类可重用技能的框架,从而增强 LLM 在工具使用、多步推理以及动态环境交互方面的能力。为此,我们提出了群体技能树搜索(Collective Skill Tree Search,简称 CSTS),这是一种全新的基于树搜索的技能构建框架,能够构建出结构化、多样化且具备泛化能力的技能树。CSTS 的核心思想是利用群体智慧,通过两个迭代阶段来共同搜索、识别与组合有效技能:群体技能节点生成(CSN-Gen)和群体技能节点评估(CSN-Assess)。CSN-Gen 利用来自多个模型的群体知识,为每个子任务探索多样化的候选技能,从而实现全面的技能探索。CSN-Assess 则采用多个模型作为裁判,通过两种打分机制来评估和选择技能节点:(1)群体质量打分,通过聚合独立评估,对技能有效性做出稳健的估计;(2)群体可迁移性打分,显式地验证某项技能是否能在不同模型间良好泛化。借由 CSTS,我们构建了一套完整的技能树以及技能增强的训练数据,使模型能够有效地学习并利用技能。此外,我们还引入了群体技能强化学习,它能主动从树中选择多个相关技能,以拓宽解空间探索,避免陷于单一技能及其产生的同质化或次优解中。结果表明,我们训练出的模型 OpenClaw-Skill 在长流程规划、工具使用以及挑战性基准测试的泛化能力方面,展现出了卓越的 Agent 能力。原文链接:https://arxiv.org/abs/2606.16774前往小宇宙评论区与主播互动
-
617
【第677期】从学徒到导师:强化学习环境生成框架
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent ReasoningSummary强化学习(RL)在大语言模型(LLM)训练中的流水线,通常依赖于在不同阶段之间手动重新设计环境,这就需要从业人员凭启发式经验去推断哪种配置最能提升当前的策略模型。为了将这一过程实现自动化,我们提出了 LLM 作为环境工程师(LLM-as-Environment-Engineer)的框架:在该框架中,当前的策略模型会分析失败轨迹并结合上下文信息,从而为下一阶段的训练环境配置提出修改建议。我们还推出了 MAPF-FrozenLake,这是一个可控的测试床,其生成器暴露了多维度的环境配置,非常适合用来研究和评估环境的重新设计。在该测试床中,我们以策略行为、失败案例和环境统计数据的结构化摘要作为条件引导环境工程师,使其生成下一训练阶段的配置。在以 Qwen3-4B 作为骨干模型时,我们的框架在基准测试中取得了最强的综合性能,超越了更大的闭源商业 LLM(例如 GPT、Gemini)以及固定环境训练的基线方法。我们进一步分析了哪种形式的上下文最为有效,发现成功的环境更新依赖于失败证据,并且会保留已经生效的配置。有趣的是,当前的 RL 检查点(checkpoint)比原始的基座模型能扮演更好的环境工程师角色,这表明策略学习提升了模型诊断自身剩余缺陷的能力。原文链接:https://arxiv.org/abs/2606.17682前往小宇宙评论区与主播互动
-
616
【第676期】智能自动机学习:大语言模型智能体发现世界模型
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Can LLM Agents Infer World Models? Evidence from Agentic Automata LearningSummary我们提出了“Agent 化的自动机学习”(agentic automata learning),用于评估工具调用型 LLM Agent 通过交互揭示隐藏环境的能力。在我们的设定中,Agent 需通过与 Oracle(神谕/专家)进行两种交互来揭示一个隐藏的确定性有限状态自动机(DFA):(1)成员查询(“该字符串是否属于目标语言?”)以及(2)等价性查询(“这是目标 DFA 吗?”)。这提供了一个具有可控任务复杂度、可测量交互效率以及强基线(传统的自动机学习算法)的可扩展测试床。对最先进的 LLM 进行评估后,我们发现其性能随着 DFA 规模的增大而急剧下降。推理模型(reasoning models)的表现显著强于非推理模型,但轨迹分析揭示了其在查询规划、证据整合和假设构建方面反复出现的失败。总体而言,我们的结果表明,当前的 LLM Agent 有时能够完成非平凡的交互式探索,但该任务上的鲁棒性和效率仍远落后于传统算法。原文链接:https://arxiv.org/abs/2606.16576前往小宇宙评论区与主播互动
-
615
【第675期】PreAct:基于状态机与验证机制的计算机辅助代理加速系统
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:PreAct: Computer-Using Agents that Get Faster on Repeated TasksSummary计算机操作 Agent(Computer-using agents)通过屏幕直接驱动真实软件——进行点击与打字——但它们解决每个任务时都是“从头开始”:当被要求重复某项任务时,Agent 会重新读取屏幕、重新推理每一次点击,并再次付出全部代价。我们提出了 PreAct,它能让此类 Agent 在执行曾经做过的任务时速度大幅提升。在首次成功完成任务时,PreAct 会将该运行过程编译为一个精简的状态机程序(状态负责检查屏幕,转移负责执行动作);在后续运行中,PreAct 会直接重放该程序,而无需调用 Agent——不仅没有每一步的语言模型调用,速度还提升了 8.5 到 13 倍。这种重放并非盲目进行:在每一步执行前,PreAct 都会检查屏幕是否符合程序的预期,一旦出现异常便会立即将控制权交还给 Agent。在决定保留哪些程序时,PreAct 同样遵循这一严格原则:一个新编译的程序只有在从干净状态重新运行、并经独立评估器确认确实解决了任务后,才会存入存储库——这能有效筛选出那些虽然重放到最后一步但实际并未完成任务的无效程序。在涵盖移动端、桌面端和 Web 端的三项基准测试中,这种存储阶段的校验将“越用越好”的重复运行与“因错误程序累积而导致性能下降”的运行成功区分开来,在三项基准测试中均带来了相同的正面效果(相当于每项基准测试提升 1.75 到 2.6 个任务);再加上当没有合适程序时重新进行探索的回退机制(fallback),使 PreAct 达到了与强劲的“录制与重放”(record-and-replay)基线相媲美的水平。此外,我们还报告了哪些因素并不重要:提示词措辞、运行时防护栏(guardrails),以及究竟是由语言模型还是普通的嵌入检索器来选择复用哪种程序。原文链接:https://arxiv.org/abs/2606.17929前往小宇宙评论区与主播互动
-
614
【第674期】SkillWeaver:组合式 LLM 代理技能路由框架
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and ComposeSummaryLLM Agent 越来越依赖外部技能(即包含重用工具规范的定义),但现实世界中的任务通常需要组合多个技能,而不仅仅是选择单个技能。我们将该问题形式化为组合式技能路由(Compositional Skill Routing)问题:给定一个复杂的用户查询和一个庞大的技能库,将查询拆解为原子子任务,为每个子任务检索合适的技能,并构建出一个可执行的规划。我们提出了 SkillWeaver,这是一个结合了 LLM 任务分解器、带 FAISS 索引的双编码器(bi-encoder)技能检索器以及依赖感知 DAG 规划器的“拆解-检索-组合”框架。为了支持评估,我们推出了 CompSkillBench,这是一个包含 300 个组合式查询的基准测试,涵盖来自公开 MCP 生态系统、跨越 24 个功能类别的 2,209 个真实 MCP 服务端技能。我们的实验表明,任务分解的质量是主要瓶颈:标准 LLM 分解在步骤层面的类别召回率(category recall)仅达到 34.2%。为了解决这个问题,我们提出了迭代式技能感知分解(Iterative Skill-Aware Decomposition,简称 SAD),这是一种检索增强的反馈循环,能够迭代地将分解过程与可用技能进行对齐。SAD 在单次迭代中将分解准确率从 51.0% 提升至 67.7%(相对提升 +32.7%,Wilcoxon 检验 p<10−6);基于分解准确性(DA)的条件分析证实,正确的粒度是实现有效检索的前提条件(当 DA=1 时,CatR@1 从 34% 上升至 41%)。SkillWeaver 将上下文窗口的消耗降低了 99% 以上,迁移实验也证实了其泛化能力(即使检索池中缺失目标类别,相对 DA 收益仍达到了 +35.6%)。原文链接:https://arxiv.org/abs/2606.18051前往小宇宙评论区与主播互动
-
613
【第673期】SpatialClaw:重塑智能体空间推理的代码动作接口
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:SpatialClaw: Rethinking Action Interface for Agentic Spatial ReasoningSummary空间推理(即确定物体位置、相互关系以及在三维空间中如何运动的能力)依然是视觉语言模型(VLM)面临的一项根本性挑战。工具增强型 Agent 试图通过为 VLM 补强专业感知模块来解决这一问题,但其有效性受到调用这些工具的动作接口(action interface)的限制。在本文中,我们研究了该接口的设计如何塑造 Agent 进行开放式空间推理的能力。现有的空间 Agent 要么采用单次代码执行,这种方式在观察到任何中间结果之前就已确定了完整的分析策略;要么依赖结构化的工具调用接口,这往往缺乏自由组合操作或针对具体任务量身定制分析的灵活性。这两种设计对于开放式、复杂的 3D/4D 空间推理所提供的灵活性都非常有限。因此,我们提出了 SpatialClaw,这是一个采用代码作为动作接口的无需训练的空间推理框架。SpatialClaw 维持一个有状态的 Python 内核,其中预载了输入帧以及一系列感知和几何图元,允许由 VLM 支持的 Agent 在每一步根据所有先前的输出来编写一个可执行单元格,从而使 Agent 能够灵活地组合与操作感知结果,并根据中间的文本、视觉观察以及每个问题的需求来调整其分析过程。在跨越广泛静态与动态 3D/4D 空间推理任务的 20 个空间推理基准测试上的评估表明,SpatialClaw 实现了 59.9% 的平均准确率,超越了近期的空间 Agent +11.2 个百分点;且在来自两个模型家族的六个 VLM 底座上均实现了持续的性能提升,期间无需任何针对基准测试或特定模型的微调适配。原文链接:https://arxiv.org/abs/2606.13673前往小宇宙评论区与主播互动
-
612
【第672期】FlashMemory-DeepSeek-V4:前瞻稀疏注意力的超长上下文技术
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse AttentionSummary传统大语言模型(LLM)在解码阶段需要将全部 KV 缓存(KV Cache)保持加载状态,这导致在超长上下文服务场景下面临严重的 GPU 显存瓶颈。在本报告中,我们提出了前瞻稀疏注意力(Lookahead Sparse Attention,简称 LSA),这是一种由基于 DeepSeek-V4 架构构建的神经记忆索引器(Neural Memory Indexer)驱动的全新推理范式。与被动地对所有历史 Token 进行注意力计算不同,LSA 能够主动预测未来的上下文需求,并仅在 GPU 显存中保留对查询至关重要的 KV 块(KV Chunks)。关键在于,我们通过脱离骨干模型的解耦训练(backbone-free decoupled training)策略实例化了该架构。通过将索引器构建为标准的双编码器(dual-encoder)架构,我们利用标准的检索训练框架对其进行独立训练,而无需将庞大的骨干模型加载到 GPU 显存中。我们证明了这种“少即是多”的范式在大幅提升服务效率的同时,还能在依赖长期全局记忆的任务中充当有效的注意力去噪器(attention denoiser)。在主流的长上下文评估套件(例如 LongBench-v2、LongMemEval 和 RULER)中,FM-DS-V4 将平均物理 KV 缓存占用大幅压缩至全上下文基线(full-context baseline)的 13.5%,同时持续保持甚至略微提升了下游任务的准确率(平均绝对提升 +0.6%)。在 1M(百万)上下文长度下,每个解码 Token 的计算量降至基线的 0.30 倍,GPU KV 缓存体积缩减了 90%(从 3.73 GB 降至 0.37 GB),从而在 8× H20 GPU 上的首字/解码分离(PD-disaggregated)服务中,实现了2.8 倍的总吞吐量提升和 2.7 倍的并发量提升。原文链接:https://arxiv.org/abs/2606.09079前往小宇宙评论区与主播互动
-
611
【第671期】从监督微调到强化学习:在线蒸馏的参数空间几何特性
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:On the Geometry of On-Policy DistillationSummary在线策略蒸馏(On-Policy Distillation,简称 OPD)越来越多地被用于提升大语言模型的推理能力,但其训练动态机制(training dynamics)至今仍缺乏深入了解。我们对 OPD 在参数空间中的更新轨迹进行了刻画,并将其与监督微调(SFT)以及基于可验证奖励的强化学习(RLVR)进行了比较。一系列参数空间诊断结果一致表明,OPD 处于一种宽松的非主方向机制(relaxed off-principal regime):与 SFT 相比,它的更新所影响的权重更少,且更强烈地避开了主方向(principal directions);而与 RLVR 相比,它的限制程度则没有那么严苛。除了这种静态定位之外,OPD 还展现出了子空间锁定(subspace locking)现象:其累积更新会迅速进入一条狭窄的低维通道。将训练限制在训练早期形成的更新子空间内,能够保留 OPD 的性能,却会大幅降低 SFT 的效果,这表明被锁定的子空间在功能上对于 OPD 来说是充分的。对照实验进一步表明,稀疏化更新 Token(sparsifying update tokens)以及将 Rollout 生成转为离线策略(off-policy)依然能保持其秩动态特性(rank dynamics);然而,将 OPD 目标与 RLVR 混合使用则会改变这一特性。总体而言,这些结果表明 OPD 并非仅仅是 SFT 和 RLVR 之间的过渡状态,而是在参数空间中诱导出了其独特的更新几何结构(update geometry)。原文链接:https://arxiv.org/abs/2606.07082前往小宇宙评论区与主播互动
-
610
【第670期】Agentopia:大语言模型长周期社会生活模拟与学习
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Agentopia: Long-Term Life Simulation and Learning in Agent SocietiesSummary人类从社会生活中进行学习。利用大语言模型(LLM)驱动的 Agent 来模拟这一过程是一个很有前景的研究方向,由此也衍生出一个自然的问题:LLM 能否从这种模拟的社会经验中学习,从而更好地理解和复刻人类行为?然而,以往的 Agent 社会模拟通常局限在“天”的量级,限制了社会交互的深度与长期成长。在本文中,我们针对 Agent 社会中的长期生活模拟与 LLM 学习展开研究,旨在实现两个目标:(1)探索终身模拟中涌现出的社会行为;(2)通过数年的模拟社会经验,培养 LLM 的拟人化能力,特别是其在社会生活中的智能水平。具体而言,我们提出了 Agentopia,这是一个用于多 Agent 社会长期生活模拟的综合框架。在该框架中,100 个 Agent 在 10 个模拟年里自主追求个人成长、建立社会关系,并满足自身的需求与目标。我们定义了用来镜像人类幸福感(well-being)的“生活奖励”(life reward),并利用该奖励通过拒绝采样(rejection sampling)来训练 LLM。大量实验表明,Agent 表现出了丰富且涌现出的社会行为。此外,基于生活奖励的训练有效提升了底座 LLM 的能力,这不仅改善了 Agent 在模拟中的幸福感,还泛化到了下游的角色扮演基准测试中,带来了 +15.6% 的性能提升。原文链接:https://arxiv.org/abs/2606.07513前往小宇宙评论区与主播互动
-
609
【第669期】从助手到智能体:AI重塑知识工作的自主性、效率与范围
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:How AI Agents ReshapeKnowledge Work: Autonomy,Efficiency, andScopeSummary前沿 AI 系统正在实现从“对话助手”向“能够端到端执行任务的自主 Agent”的转变,从而弥合智能与实用价值之间的鸿沟。我们利用来自 Perplexity 的 Search(搜索)与 Computer(电脑/计算)产品的生产数据,通过研究 AI Agent 如何加速并重塑知识工作,对这一转型进行了探讨。研究得出了三个关键的实证发现:第一,将使用两个产品尝试相同底层任务且初始查询对近乎一致的会话作为自然实验,数据显示,在每个用户会话中,Computer 能够执行 26 分钟的自主工作,而 Search 仅为 33 秒。 Computer 实现了任务拆解与执行的自动化,而这些工作在过去可能需要 Search 用户手动去协调和实施。因此,Computer 将后续查询的分布推向了诸如“验证”与“拓展”等更高阶的工作。自主性同时也提升了执行质量:Computer 上每条查询的不满意率比 Search 低 55%。第二,得益于其自主性优势,在匹配的同类任务上,Computer 将完成时间从 269 分钟缩减至 36 分钟。 与仅配备 Search 的人类相比,估计的时间和成本分别降低了 87% 和 94%。第三,Computer 改变了用户尝试的工作范围: 相较于同一批用户对 Search 的使用,Computer 上的查询更频繁地跨越职业边界、需要更高阶的认知能力、调用更广泛的专业知识,并且更多地表现为将相互依存的子任务打包进单个查询的复合型任务,从而解锁了在 Search 使用中基本不存在的工作活动。综合来看,这些证据表明 AI Agent 能够加速工作流程、提升输出质量、降低成本,并拓展自动化工作的广度与深度。原文链接:https://arxiv.org/abs/2606.07489前往小宇宙评论区与主播互动
-
608
【第668期】Agents’ Last Exam:工业级通用AI智能体评测基准
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Agents’ Last ExamSummary近期的人工智能系统在一系列广泛的基准测试中取得了优异的成绩,然而这些进步并未能在众多专业领域中转化为具备经济意义的落地应用。我们认为,这一差距很大程度上源于评估环节的问题:目前被广泛使用的基准测试缺乏对真实且具备经济价值的工作流程进行持续性的性能测量。本文介绍了“Agent 的终极考场”(Agents' Last Exam, 简称 ALE),这是一个旨在评估 AI Agent 在具有可验证结果、长流程、具备经济价值且贴近现实世界任务中表现的基准测试。ALE 是与 250 多位行业专家合作开发的,其覆盖的非物理产业均参考了 O*NET / SOC 2018(美国联邦职业分类体系)进行定义。它围绕一个包含 55 个子领域、归类为 13 个行业集群的任务分类体系展开,涵盖 1000 多个任务。目前的结果表明,最难的梯队距离“饱和”还差得远:在主流的框架(harness)和骨干模型(backbone)配置下,平均完全通过率低于 1%。ALE 被设计为一个动态发展的基准测试:随着新工作流程和新行业的不断加入,其任务池将持续扩大。更广泛地说,ALE 的定位不仅是另一个排行榜,更是缩小基准测试的成功与对国内生产总值(GDP)产生实际影响之间差距的工具。原文链接:https://arxiv.org/abs/2606.05405前往小宇宙评论区与主播互动
-
607
【第667期】Self-harness:大语言模型代理的进化演进系统
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Self-Harness: Harnesses That Improve ThemselvesSummaryBased LLM-based agent(基于大语言模型的智能体)的性能受其基座模型以及协调其与环境交互的框架/驾驭系统(harness)共同塑造。由于不同的模型表现出截然不同的行为特征,因此有效的 harness 设计本质上是需要针对特定模型定制的。然而,智能体 harness 至今在很大程度上仍由人类专家手动工程化构建,随着现代 LLM 日益多样化且快速迭代,这种范式在扩展性方面表现极差。在本文中,我们提出了 Self-Harness——一种全新的范式,在此范式下,基于 LLM 的智能体可以在不依赖人类工程师或更强外部智能体的情况下,自我改进其运行 harness。我们将 Self-Harness 实例化为一个包含三个阶段的迭代循环:弱点挖掘(Weakness Mining):从执行轨迹中识别特定模型的失败模式;Harness 方案提出(Harness Proposal):生成与这些失败紧密相关的、多样化且最小化的 harness 修正方案;方案验证(Proposal Validation):仅在通过回归测试后才接受候选的修改。我们在 Terminal-Bench-2.0 上使用一个极简的初始 harness 以及来自不同家族的三款基座模型(MiniMax M2.5、Qwen3.5-35B-A3B 和 GLM-5)对 Self-Harness 进行了实例化评估。在这三款模型上,Self-Harness 均一致提升了性能,保留测试集(held-out)的通过率分别从 40.5% 提升至 61.9%、从 23.8% 提升至 38.1%,以及从 42.9% 提升至 57.1%。定性分析进一步表明,Self-Harness 并不仅仅是添加通用的指令,而是有效地将特定模型的弱点转化为具体、可执行的 harness 改动。这些结果表明,基于 LLM 的智能体不仅能被其 harness 塑造,还能开辟一条参与重塑自身 harness 的演进路径。原文链接:https://arxiv.org/abs/2606.09498前往小宇宙评论区与主播互动
-
606
【第666期】MiniMax Sparse Attention-算力缩减28倍的MSA架构
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:MiniMax Sparse AttentionSummary超长上下文能力正在成为前沿大语言模型(LLM)不可或缺的能力:智能体工作流(agentic workflows)、代码仓库级别的代码推理(repository-scale code reasoning)以及持久化记忆(persistent memory)都要求模型能够联合关注数十万到数百万级别的 token。然而,softmax 注意力机制的二次计算复杂度,使得这种能力在实际部署规模下难以实现。我们提出了 MiniMax 稀疏注意力(MiniMax Sparse Attention, MSA),这是一种基于分组查询注意力(Grouped Query Attention, GQA)构建的块级稀疏注意力机制。MSA 包含一个轻量级的索引分支(Index Branch),用于对键值(key-value)块进行评分,并为每个 GQA 组独立选择一个 Top-k 子集,从而实现针对不同组的稀疏检索,同时保持高效的块级执行;随后,**主分支(Main Branch)**仅在被选中的块上执行精确的块稀疏注意力计算。MSA 的设计遵循简单性与可扩展性原则,经过刻意精简,使其能够在广泛的 GPU 平台上直接高效部署。为了将稀疏性转化为实际的速度提升,我们进一步针对 MSA 设计了专用的 GPU 执行路径:该路径采用无指数运算(exp-free)的 Top-k 选择机制以及 KV 外置稀疏注意力(KV-outer sparse attention),在块粒度访问模式下提升张量核心(tensor core)的利用率。在一个具有原生多模态训练能力的 109B 参数模型上,MSA 的性能与 GQA 基本相当,同时在 100 万 token 上下文长度下,将每个 token 的注意力计算量降低了 28.4 倍。结合我们共同设计的 GPU 内核(kernel),MSA 在 H800 GPU 上实现了 14.2 倍的预填充(prefill)加速以及 7.6 倍的解码(decoding)端到端速度提升。原文链接:https://arxiv.org/abs/2606.13392前往小宇宙评论区与主播互动
-
605
【第665期】语言模型的睡眠、记忆巩固与自进化
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Language Models Need Sleep: Learning to Self-Modify and Consolidate MemoriesSummary过去几十年见证了机器学习算法设计领域的重大进步,从早期针对特定任务的浅层模型研究,到如今更加通用的深度大语言模型(Large Language Models, LLMs)。尽管现有模型在需要即时预测或上下文学习(in-context learning)的任务中展现出了良好的效果,但它们仍然缺乏持续学习的能力,也无法有效地将其随时间积累的上下文知识迁移到长期参数中。受到人类学习过程的启发,我们引入了一种称为 “睡眠(Sleep)”范式 的方法,使模型能够持续学习,通过回放(replay)机制将短期且脆弱的记忆蒸馏为稳定的长期知识,并通过“做梦(Dreaming)”过程递归地实现自我改进。更具体地说,睡眠过程包含两个阶段:(1)记忆巩固(Memory Consolidation):这是一个向上的蒸馏过程,称为知识播种(Knowledge Seeding)。在该过程中,将较小版本自身模型(smaller-self)的记忆蒸馏到一个更大的网络中,从而在保留已有知识的同时提供更大的容量。作为概念验证,我们提出了一种新的用于知识播种的广义蒸馏过程(Generalized Distillation process),即结合了**在策略蒸馏(on-policy distillation)**与基于强化学习(Reinforcement Learning, RL)的模仿学习(imitation learning)的蒸馏方法。(2)做梦(Dreaming):这是一个自我改进阶段。在该阶段,模型利用强化学习生成一个合成数据课程(curriculum of synthetic data),用于反复练习新知识,并在无需人工监督的情况下优化已有能力。我们在长时间跨度任务(long-horizon tasks)、持续学习任务(continual learning)、知识融入任务(knowledge incorporation)以及少样本泛化任务(few-shot generalization tasks)上的实验结果,验证了睡眠阶段的重要性。原文链接:https://arxiv.org/abs/2606.03979前往小宇宙评论区与主播互动
-
604
【第664期】嵌套学习:深层架构的幻象与神经学习模块
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Nested Learning: The Illusion of Deep Learning ArchitectureSummary尽管近年来取得了显著进展,尤其是在语言模型的发展方面,但关于这类模型如何能够持续学习/记忆、自我改进以及寻找有效解决方案,仍然存在一些根本性的挑战和未解问题。在本文中,我们提出了一种新的学习范式,称为嵌套学习(Nested Learning, NL)。该范式以一种统一的方式,将机器学习模型表示为一组嵌套的、多层次的和/或并行的优化问题,其中每一个优化问题都具有其自身的上下文流(context flow)。通过 NL 的视角来看,现有的深度学习方法通过压缩自身的上下文流来从数据中学习,而**上下文学习(in-context learning)**则自然地在大规模模型中涌现出来。NL 提出了一种设计理念:通过引入更多层次来设计具有更强表达能力的学习算法,从而实现更高阶的上下文学习,并有可能解锁有效的持续学习能力。我们通过以下三个核心贡献来阐述并倡导 NL:(1)表达性优化器(Expressive Optimizers):我们展示了,诸如 Adam、带动量的 SGD(SGD with Momentum)等已知的基于梯度的优化器,实际上是联想记忆模块(associative memory modules),其目标是通过梯度下降来压缩梯度信息。在这一洞见的基础上,我们提出了其他更具表达能力的优化器,它们具备深层记忆能力和/或更强大的学习规则。(2)自修改学习模块(Self-Modifying Learning Module):利用 NL 对学习算法的洞察,我们提出了一种序列模型,该模型能够通过学习自身的更新算法,来学习如何修改自身。(3)连续记忆系统(Continuum Memory System):我们提出了一种新的记忆系统表述方式,将传统的长短期记忆(long/short-term memory)视角进行了推广。结合我们的自修改序列模型与连续记忆系统,我们提出了一种持续学习模块,称为 Hope。实验结果表明,该模块在语言建模、知识融入、少样本泛化任务、持续学习任务以及长上下文推理任务中均展现出了良好的潜力。原文链接:https://arxiv.org/abs/2512.24695前往小宇宙评论区与主播互动
-
603
【第663期】分层潜在预测:样本复杂性理论
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Learn from your own latents and not from tokens: A sample-complexity theorySummary生成模型——从扩散模型(diffusion models)到大型语言模型(LLMs)——已经取得了卓越的性能,但代价是需要规模远超生物学习系统的数据进行训练,其训练数据量通常比生物学习者所需的数据高出数个数量级。近年来,一种新的学习范式逐渐兴起:网络不再预测原始输入,而是预测自身对于相关视图(related views)或被遮蔽区域(masked regions)的潜在表示(latent representations),代表性方法包括 data2vec 和 JEPA(Joint Embedding Predictive Architecture)。这一思想也与神经科学中关于大脑皮层**预测编码(predictive coding)**的理论相呼应。尽管这些方法已经取得了优异的实验效果,但其理论基础仍然缺乏充分理解。其中两个核心问题是:预测潜在表示究竟能够在多大程度上提升数据效率(data efficiency)?将这种潜在预测机制堆叠成多尺度层次结构(multi-scale hierarchies)是否能够进一步带来收益?本文针对这两个问题给出了理论回答。作者采用了一种**可解析的概率上下文无关文法(Probabilistic Context-Free Grammar,PCFG)**作为数据生成模型,以模拟自然语言和图像所具有的组合结构(compositional structure)。在该模型中,数据的生成过程如下:首先构造一个深度为 LL 的隐藏符号树(latent tree);然后递归应用文法产生式(production rules);最终生成由可观测 token 构成的字符串。在这一数据模型下,作者证明:无论是监督学习(supervised learning)还是基于 Token 的自监督学习(token-level self-supervised learning),若要恢复隐藏树结构,都需要**关于树深度 LL 指数增长(exponential in LL)**数量的训练样本。相比之下,**潜在表示预测(latent prediction)仅需与树深度 LL 无关(constant in LL)**的样本数量(除去对数因子),即可恢复相同的隐藏结构。这意味着,相对于传统监督学习和 Token 级自监督学习,潜在预测能够将样本复杂度从指数级降低到常数级(忽略对数项)。作者进一步通过三方面验证了这一理论结果:层次聚类算法(hierarchical clustering algorithm);一个端到端神经网络,其中每一层都包含预测器(predictor)和聚类器(clusterer)模块,并通过梯度下降不断预测自身的潜在表示,实现逐层的潜在预测;首次对 data2vec 的样本复杂度进行了理论分析,证明 data2vec 实际上隐式地(implicitly)执行了层次化潜在预测(hierarchical latent prediction)。基于这些分析,作者进一步指出:由于 data2vec 已经在内部实现了层次化的潜在预测,因此再显式地构建多层预测结构(例如 H-JEPA 这类层次化 JEPA 架构)所带来的额外收益其实非常有限,在很大程度上是**冗余(largely redundant)**的。总体而言,本文从理论上解释了为什么预测潜在表示能够显著提高数据效率,并表明这种优势已经能够通过 data2vec 等方法自然实现,而无需额外设计复杂的层次化预测架构。原文链接:https://arxiv.org/abs/2605.27734前往小宇宙评论区与主播互动
-
602
【第662期】AdaCoM:面向长任务的代理兼容上下文管理框架
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Learning Agent-Compatible Context Management for Long-Horizon TasksSummary大语言模型(LLM)智能体在现实应用中越来越多地需要完成长时程任务(long-horizon tasks),例如网络搜索(web search)和深度研究(deep research)。然而,随着交互上下文不断累积,智能体容易出现**长上下文退化(long-context degradation)和推理能力下降(reasoning failures)**等问题。现有工作通常通过**上下文管理(context management)来缓解这一问题,例如由智能体自身控制上下文,或采用固定策略(如摘要生成)对上下文进行压缩。然而,这些方法往往需要重新训练智能体以适应相应策略,因此对于闭源智能体(closed-source agents)**而言难以应用;同时,它们也忽略了不同智能体可能需要采用不同上下文管理策略这一事实。为此,我们提出 Adaptive Context Management(AdaCoM)。AdaCoM 并不修改智能体本身,而是训练一个外部大语言模型(external LLM)作为上下文管理器,通过灵活的上下文修改操作(flexible modification actions)以及端到端强化学习(end-to-end reinforcement learning),为一个保持冻结(frozen)的智能体动态管理其上下文。在多个不同智能体以及网络搜索和深度研究基准上的实验表明,AdaCoM 能够在**删除过时信息(pruning stale content)**的同时,尽可能保留任务约束(task constraints)和执行进度(task progress),从而显著提升智能体的整体性能。进一步分析学习得到的上下文管理策略,我们发现了一种保真度—可靠性权衡(Fidelity–Reliability Trade-off):基础 ReAct 表现较强的智能体,更适合采用**高保真(higher-fidelity)**的上下文保留策略,即尽可能保留完整上下文,以维持其推理能力。基础性能较弱的智能体,则需要采用更加激进的上下文压缩策略,以避免过长上下文导致推理失稳,使其始终保持在一个**可靠的推理工作区间(reliable reasoning regime)**内。此外,我们还进行了跨智能体迁移实验(transfer experiments)。结果表明,AdaCoM 在能力水平相近(以原始 ReAct 性能为衡量标准)的智能体之间具有最佳的迁移效果。这说明,一个为某类智能体训练得到的上下文管理器,可以较容易地复用于能力相近的其他智能体。这些结果表明,将上下文管理从智能体本身解耦出来,并通过一个可复用的外部上下文管理器进行学习和优化,是构建长时程智能体系统的一条切实可行的发展路径。原文链接:https://arxiv.org/abs/2605.30785前往小宇宙评论区与主播互动
-
601
【第661期】AUTOLAB:前沿模型长程自动研发能力评测
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:AUTOLAB: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?Summary科学研究和工程创新本质上都是一个长时程(long-horizon)的迭代优化过程:不断提出改进方案、开展实验、测量结果,并持续优化已有成果。然而,目前针对前沿大语言模型的基准测试主要关注单轮回答(single-turn responses)或短时程智能体轨迹(short-horizon agent trajectories),无法充分评估智能体在长时间尺度上持续迭代改进所面临的挑战。为弥补这一空白,我们提出 AutoLab——一个面向**超长时程闭环优化(ultra long-horizon closed-loop optimization)**的新型基准测试。AutoLab 包含 36 个由领域专家设计的真实任务,覆盖四类具有代表性的应用场景:系统优化(system optimization);谜题与挑战(puzzle & challenge);模型开发(model development);CUDA Kernel 优化(CUDA kernel optimization)。每个任务都提供一个**功能正确但刻意设计得性能欠佳(correct but deliberately suboptimal)的初始版本,并要求智能体在严格限定的墙钟时间(wall-clock time)**预算内不断改进该方案。我们对 17 个当前最先进的大语言模型进行了评测。实验结果表明,决定最终成功与否的最关键因素,并不是智能体第一次尝试的质量,而是在整个优化过程中持续进行基准测试(benchmarking)、修改方案(editing)以及根据实验反馈不断迭代(incorporating empirical feedback)的能力。具体而言:Claude Opus 4.6 展现出了较强的长时程优化能力,能够持续推进任务并不断改进结果;而大多数前沿模型(包括多个闭源商业模型)则表现出明显不足,要么过早停止优化(terminate prematurely),要么在几乎没有取得有效进展的情况下耗尽全部时间预算。这些实验结果进一步说明,对于自主智能体而言,**时间意识(time awareness)以及持续迭代优化(persistent iteration)**是实现长期自主工作的关键能力,而不仅仅是生成一次高质量的初始解。为了促进这一方向的发展,我们将 AutoLab 的完整内容全部开源,包括:基准任务(benchmark);评测 Harness(evaluation harness);全部任务相关工件(task artifacts)。希望借此推动能够真正胜任长时程自主优化任务的智能体研究。原文链接:https://arxiv.org/abs/2606.05080前往小宇宙评论区与主播互动
-
600
【第660期】有效反馈计算:代理系统的Scaling Law
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Scaling Laws for Agent Harnesses via Effective Feedback ComputeSummary智能体 Harness 通过控制工具使用、反馈机制、结果验证、记忆管理以及错误修复等环节,决定了大语言模型的实际性能。然而,传统的测试时计算开销(test-time compute)指标——例如 Token 数量、工具调用次数、运行时间(wall time)或计算成本——无法区分哪些反馈真正有助于任务完成,哪些只是冗余、无效或不稳定的交互。我们提出 有效反馈计算(Effective Feedback Compute,EFC),作为一种基于执行轨迹(trace-level)的扩展指标,用于度量那些具有信息价值(informative)、有效(valid)、**非冗余(non-redundant)且能够被后续执行保留和利用(retained)**的反馈。在此基础上,我们进一步提出了多个衍生指标,以适用于真实智能体运行轨迹和不同类型任务:Estimated-EFC:EFC 的估计版本;NRS-EFC:一种基于非冗余与稳定性(Non-Redundant Stable)原则构建的 EFC 指标;Harness 效率(Harness Efficiency,η);任务需求归一化(task-demand normalization),用于在不同复杂度任务之间进行公平比较。我们在合成实验(synthetic)、真实数据(real)、**留出测试集(held-out)以及前瞻性实验(prospective evaluations)**中进行了全面评估。结果表明,以 EFC 为横轴建立的扩展规律,相比传统的原始计算量指标(raw compute)以及 SAS 指标,能够更准确地解释智能体性能。具体而言:在受控扩展实验中,采用 Oracle-EFC / Dtask(按任务需求归一化后的理想 EFC)作为尺度变量时,模型拟合优度达到 R² = 0.99;在真实运行轨迹中,采用 NRS-EFC / Dtask 时,拟合优度仍达到 R² = 0.93;相比之下,传统原始计算量指标与性能之间几乎不存在相关性,甚至出现负相关。最后,我们提出的系统 \ours 将 EFC 作为现有 Harness 的一个**协同控制层(companion control layer)**进行集成。在相同实验设置下,该方法:将平均任务通过率(pass rate)由 61.2% 提升至 68.2%;同时将平均原始计算成本由 213.8 降低至 85.1。这些结果表明,Harness 的有效扩展并不依赖于投入更多原始计算资源,而是依赖于能够持续保留、满足任务需求的高质量反馈(durable, task-sufficient feedback)。因此,相比单纯增加计算量,提升反馈质量与反馈利用效率才是推动智能体性能扩展的关键。原文链接:https://arxiv.org/abs/2605.29682前往小宇宙评论区与主播互动
-
599
【第659期】LEAP让通用大模型数学考满分
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:LEAP: Supercharging LLMs for Formal Mathematics with Agentic FrameworksSummary大型语言模型(LLMs)在**非形式化数学推理(informal mathematical reasoning)**方面已展现出较强能力,但在生成能够被 Lean 等形式化证明语言机械验证(mechanically verifiable)的证明时,仍然存在较大困难。我们提出 LEAP,一个智能体化(agentic)的框架,使通用基础模型(general-purpose foundation models)能够在自动形式化定理证明(automated formal theorem proving)任务上达到当前最先进(state-of-the-art)的性能。LEAP 充分利用了基础模型已有的能力,包括:非形式化数学推理(informal reasoning);指令遵循(instruction following);迭代式自我改进(iterative self-refinement)。通过将复杂证明任务拆解为多个较小的子问题,LEAP 在 Lean 编译器的持续交互反馈下,将形式化证明的构造过程与非形式化证明思路(informal blueprints)有效衔接,从而逐步完成形式化证明。为了突破现有基准逐渐趋于饱和的问题,我们进一步提出了 Lean-IMO-Bench,一个由 Lean 形式化表示的国际数学奥林匹克(IMO)风格题目组成的新基准。该基准中的题目虽然题干较短,但证明过程高度非套路化(non-routine),通常包含多个推理步骤,并覆盖了广泛的难度范围,因此能够更严格地评估形式化证明能力。实验结果表明,在 2025 年 Putnam 数学竞赛(北美本科生年度数学竞赛)上,LEAP 成功解决了全部 12 道题目,与近期前沿形式化数学模型取得的突破性成果相当。在 Lean-IMO-Bench 上,LEAP 更显著提升了通用大语言模型的一次性形式化证明成功率(one-shot formal solve rate):由不足 10% 提升至 70%,明显超过了此前由一个专门面向 IMO、达到金牌水平的系统所创造的 48% 基准成绩。此外,我们还展示了 LEAP 在数学研究中的实际应用价值。该系统能够自主完成复杂证明的形式化工作,用于解决开放性的组合数学问题。其中包括为 Knuth 关于偶数阶 Cayley 图哈密顿分解(Hamiltonian decomposition of even-order Cayley graphs)中的一个关键子问题,自动构造并验证了一份形式化证明。这些结果表明,LEAP 不仅显著提升了通用大语言模型的形式化证明能力,也展示了其作为数学研究辅助工具在前沿科研中的潜力。原文链接:https://arxiv.org/abs/2606.03303前往小宇宙评论区与主播互动
-
598
【第658期】大模型智能体外部挂载自演化能力分析
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM AgentsSummary大型语言模型(LLM)智能体正越来越多地以围绕可编辑外部 harness构建的系统形式部署。这些 harness 包括提示(prompts)、技能(skills)、记忆(memories)和工具(tools),它们无需修改模型参数即可影响任务执行过程。**Harness 自演化(harness self-evolution)**则通过利用执行过程中积累的证据,不断更新这些 harness,以实现智能体的持续适应。然而,一个尚未明确的问题是:**模型自身的基础任务求解能力(base capability)是否能够预测其 Harness 自演化能力?**换言之,哪些模型能够生成有价值的 harness 更新,又有哪些模型能够真正从这些更新中获益?我们将 Harness 自演化能力划分为两个方面进行分析:Harness 更新能力(harness-updating):即模型根据执行证据生成有价值、可长期保留的 harness 更新的能力。Harness 受益能力(harness-benefit):即模型在任务执行过程中利用更新后的 harness 提升自身表现的能力。我们的分析得到两个主要发现。首先,Harness 更新能力与模型基础能力几乎无关(flat in base capability)。来自不同能力层级的模型所生成的 harness 更新,带来的性能提升出乎意料地相近。例如,Qwen3.5-9B 所生成的 harness 更新,其效果与 Claude Opus 4.6 产生的更新几乎相当。其次,Harness 受益能力与模型基础能力之间呈现非单调关系(non-monotonic)。具体而言:弱能力层级(weak-tier)模型几乎无法从更新后的 harness 中获得明显收益;中等能力层级(mid-tier)模型能够获得最大的性能提升;强能力层级(strong-tier)模型虽然仍有收益,但提升幅度反而低于中等能力模型。进一步分析表明,弱能力模型收益较低主要源于两种失效模式:无法激活(activate)与当前任务相关的 harness 内容;虽然成功激活了相关 harness,但无法忠实地遵循(follow faithfully)其中提供的指导。这些发现表明,在构建具备 Harness 自演化能力的智能体时,计算和能力预算更应优先投入到负责任务求解的智能体本身,而不是负责生成 harness 更新的演化器(evolver)。与此同时,在智能体训练过程中,应重点提升其Harness 调用能力(harness invocation)以及长时程指令遵循能力(long-horizon instruction following)。原文链接:https://arxiv.org/abs/2605.30621前往小宇宙评论区与主播互动
-
597
【第657期】Agentic Discovery:AI自主发明物理规律
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial IntelligenceSummary科学发现不仅仅是生成答案,更是在证据(evidence)、研究对象(artifacts)、**操作(operations)和验证器(verifiers)所属类型体系(representational regime)上的修订。本文提出了一种面向材料科学智能体发现(agentic discovery)的范畴论(category theory)**框架。在一个固定的表示体系 bb 中,其模式范畴(schema category)记为 SbSb。系统状态表示为一个余预层(copresheaf)It:Sb→Set,而其溯源信息(provenance)则由元素范畴(category of elements)∫SbIt来表示。在固定表示体系下,系统运行表现为对此类状态的更新。只有当能够明确指定并保持**保留溯源(provenance-preserving)的细化过程时,这种更新才能被视为一个自函子(endofunctorial)**操作。相比之下,科学发现对应的是一个经过验证的表示体系转换 u:Sb→Sb′, 即从旧表示体系迁移到新的表示体系。在这一过程中,已有研究对象不会被丢弃,而是通过左 Kan 扩张(left Kan extension)LanuIt 被映射到新的表示体系中;随后,再将该迁移结果与转换后的实际系统状态进行比较,从而识别出那些无法仅通过函子式迁移(functorial transport)解释的剩余信息(residual content)。这一框架无需依赖主观意义上的“新颖性”,即可清晰地区分检索(retrieval)、**搜索(search)与科学发现(discovery)**三者。我们将这一理论框架具体应用于两个系统。第一个系统是 Builder/Breaker。在该系统中,一个蛋白质力学世界模型(protein-mechanics world model)在**最小描述长度(Minimum Description Length,MDL)准则的约束下进行修订。最终接受的新规律指出:链内柔性(within-chain flexibility)可以表示为由缓慢集体模态(slow collective modes)参与程度所决定的全模态弹性顺应性(all-mode elastic compliance),即一种模态条件顺应性(mode-conditioned compliance)**模型。第二个系统是 CategoryScienceClaw。在该系统中,类型化技能(typed skills)、研究对象(artifacts)、开放问题(open needs)、工作流变异(workflow mutation)、评估门控(gates)、压力测试(stress tests)以及公开讨论(public discourse)共同构成了一个具有证明携带能力(proof-carrying)的知识—计算图(knowledge-computation graph)。文中以一个纤维网络(fiber network)案例进行了说明:整个知识图完整记录了候选模型、被拒绝的替代方案、基于 AIC(Akaike Information Criterion,赤池信息准则) 的模型选择门控、扰动实验(perturbation tests),以及最终被接受的模型——一种以各向同性纤维数量描述符(isotropic fiber-count descriptor)为基础、结合取向张量(orientation tensor)的各向异性刚度代理模型(anisotropic stiffness surrogate)。这两个案例共同表明,范畴论不仅能够作为描述科学发现过程的数学语言,也能够作为构建具备自我修订能力的 AI 科学发现系统的工程规范。原文链接:https://arxiv.org/abs/2606.01444前往小宇宙评论区与主播互动
-
596
【第656期】基于Llama 3模型的全同态加密隐私保护推理
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Fully Homomorphic Encryption on Llama 3 model for privacy preserving LLM inferenceSummary生成式人工智能(Generative Artificial Intelligence,GenAI)的广泛应用,以及其与医疗、金融、交通运输和信息安全等数据驱动领域的深度融合,显著提升了服务效率并降低了响应延迟。然而,这种融合也引发了关于大型语言模型(LLMs)安全性及其对企业和用户数据隐私影响的严重担忧。许多科技公司在其服务中集成了具备一定自主决策能力的大语言模型,但由于 LLM 推理流水线(LLM pipeline)存在安全隐患,面临数据泄露和机密信息泄露的风险,使其容易遭受多种攻击,包括数据投毒(data poisoning)、**提示注入(prompt injection)和模型窃取(model theft)**等。尽管目前已经采用了多种安全技术来降低这些风险,例如输入/输出净化(input/output sanitization)、去中心化学习(decentralized learning)、访问控制管理(access control management)以及加密技术(encryption),但量子计算攻击仍构成迫在眉睫的威胁。预计未来的量子计算能力将能够破解现有加密算法,从而恢复密钥、获取加密的敏感数据,并解密经过加密保护的模型。在本文中,我们将基于**后量子密码学(Post-Quantum Cryptography,PQC)的格密码同态加密(Lattice-based Homomorphic Encryption,HE)**核心功能集成到大语言模型的推理流水线中,以保护其中部分网络层免受数据隐私攻击。具体而言,我们对 LLaMA-3 模型所采用的 Transformer 架构推理流程进行了修改,并引入 concrete-ml 库提供的核心同态加密操作,将其嵌入推理过程。实验结果表明,在采用**全同态加密(Fully Homomorphic Encryption,FHE)**保护的 LLaMA-3 推理模型上,我们仍然能够获得较高的文本生成准确率(最高可达 98%),同时保持较为合理的推理延迟(在 Intel Core i9 CPU 上约为 237 毫秒),生成速度最高可达 80 token/s。这些结果证明了本文方案在 FHE 保护下运行 LLaMA-3 推理模型的可行性与有效性。此外,本文还通过进一步的实验与分析,对模型文本生成的延迟特性及其行为表现进行了深入讨论,以解释其性能表现及其背后的原因。原文链接:https://arxiv.org/abs/2604.12168前往小宇宙评论区与主播互动
-
595
【第655期】推理时执行轨迹的对齐Harness设计
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Harnesses for Inference-Time Alignment over Execution TrajectoriesSummaryHarness 工程(harness engineering)已成为大型语言模型(LLM)智能体一种重要的推理时(inference-time)技术,其目标是通过任务分解和引导式执行提升智能体的长期表现。然而,更复杂的 harness 并不一定更优:增加任务分解的粒度或执行引导的强度,有时能够改善执行过程,但也可能降低最终任务的成功率。我们从推理时轨迹对齐(inference-time trajectory alignment)的视角研究 harness 的设计。该视角将 harness 拆解为两种机制:任务分解(task decomposition),负责将任务组织为一系列子目标;以及引导式执行(guided execution),负责在执行过程中重塑局部动作分布(local action distributions)。这种机制划分使我们能够量化工作流粒度(workflow granularity)、重试预算(retry budgets)以及引导导致的动作重加权(guidance-induced action reweighting)如何共同决定 harness 设计的性能上限。同时,它也揭示了若干具体的失效模式,包括过度分解(over-decomposition)、过度剪枝(over-pruning)以及幻觉式执行(hallucinated execution)。我们通过受控的合成实验(controlled synthetic experiments)和真实终端智能体基准测试(real terminal agent benchmarks)验证了上述理论预测。受该理论启发,我们进一步发现,一个高效的 harness 并不一定需要覆盖完整的执行流程:仅对任务的初始阶段进行结构化设计,而将后续执行交由智能体自主完成,相较于完全结构化的工作流,反而能够获得更高的任务通过率(pass rate)。原文链接:https://arxiv.org/abs/2605.21516前往小宇宙评论区与主播互动
-
594
【第654期】衰退的智能体:部署系统的寿命工程研究
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed SystemsSummary长期运行的 AI 智能体正越来越多地作为持续运行的业务系统投入部署,但它们仍然按照刚初始化的模型进行评估。部署首日(Day-one)的基准测试忽略了一个最基本的系统性问题:一个智能体在部署之后究竟能够保持可靠多久?即使模型权重保持冻结,智能体的有效状态(effective state)仍会持续变化:它会压缩交互历史、从不断增长的记忆库中检索信息、在信息更新后修订已有事实,并经历日常维护。因此,可靠性应当被视为整个智能体运行框架(agent harness)的生命周期属性,而不仅仅是基础模型在某一时刻的静态属性。我们提出 AgingBench,一个面向智能体生命周期工程(agent lifespan engineering)的纵向可靠性基准。它不仅衡量已部署智能体是否会发生性能退化,还关注退化以何种形式出现,以及修复工作应当针对哪些环节展开。AgingBench 将智能体老化归纳为四种机制:压缩老化(compression aging)、干扰老化(interference aging)、修订老化(revision aging)以及维护老化(maintenance aging)。为了诊断这些失效机制,AgingBench 引入了时间依赖图(temporal dependency graphs)和成对的反事实探针(paired counterfactual probes),从而为记忆流水线(memory pipeline)的写入(write)、**检索(retrieval)和利用(utilization)**三个阶段生成诊断画像(diagnostic profiles)。在涵盖 7 个场景、14 个模型、多种记忆策略,以及由运行器控制(runner-controlled)和自主运行(autonomous)的智能体的实验中,我们完成了约 400 次运行,覆盖 8–200 个会话。结果表明,智能体老化并非单一维度的现象:行为测试可能依然表现良好,而事实精度却已开始下降;同一模型内部,对衍生状态(derived state)的跟踪能力可能在一次实验中急剧崩溃;甚至对于同一个错误答案,根据诊断画像所揭示的失效机制不同,其所需的修复方式也可能完全不同。这些结果表明,要实现可靠的智能体部署,仅仅依赖更强的部署首日模型是不够的;还需要对智能体整个生命周期进行评估、开展机制层面的诊断,并针对不同阶段实施有针对性的修复。原文链接:https://arxiv.org/abs/2605.26302前往小宇宙评论区与主播互动
-
593
【第653期】CUSP:人工智能预测科学进展基准研究
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Forecasting Scientific Progress with Artificial IntelligenceSummary人工智能(AI)正越来越多地融入科学发现之中,然而它是否能够预见科学进展仍不明确。为了研究这一问题,我们引入了一个在受控知识约束下预测科学进展的时间落地评估框架。我们提出了 CUSP(基于截止日期约束的未见科学进展,Cutoff-conditioned Unseen Scientific Progress)——这是一个多学科且事件级别的基准测试,它通过可行性评估、机制推理、生成式解决方案设计以及时间预测来评估 AI 系统中的科学预测能力。在 4,760 个科学事件中,我们观察到当前尖端模型存在系统性且高度依赖特定领域的局限性。虽然模型能够从竞争候选方案中识别出合理的合理研究方向,但它们无法可靠地预测科学进展是否会真正实现,并会系统性地错估进展发生的时间。不同领域的表现存在极大的异质性,其中 AI 自身进展的时间比生物学、化学和物理学的进展更具可预测性。无论是事件发生在训练截止日期之前还是之后,模型的表现基本不受影响,这表明这些局限性不能完全用训练数据中的知识暴露来解释。在受控的信息获取条件下,增加截止日期前的知识可以提高性能,但无法消除与全信息设置之间的差距,而这一差距在具有高引用量的重大进展中表现得更为明显。此外,模型还表现出系统性的过度自信和强烈的响应偏差,这表明其不确定性估计并不可靠。总而言之,当前的 AI 系统在作为科学进展的预测工具时表现不佳。获取先验知识并不能转化为可靠的预测能力,并且模型在性能上更多得益于事后信息的提供,而非前瞻性的预测。原文链接:https://arxiv.org/abs/2605.22681前往小宇宙评论区与主播互动
-
592
【第652期】LIFE-HARNESS:基于运行时接口的大模型代理适配技术
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM AgentsSummaryLLM 智能体不仅受到其语言模型本身的影响,还受到运行时装备(runtime harness)的塑造,该装备介导了观察、工具使用、行动执行、反馈解读以及轨迹控制。尽管现有的智能体自适应方法主要更新模型参数,但在确定性、规则约束的领域中,许多失败实际上源于模型与环境接口(model–environment interface)之间的不匹配。我们提出了 Life-Harness,这是一个具备生命周期感知能力的运行时装备,它可以在不改变模型权重或评估环境的情况下,提升冻结状态下 LLM 智能体的性能。Life-Harness 通过将反复出现的交互失败转化为可复用的干预措施(涵盖环境契约、程序化技能、行动实现和轨迹调节),从而从训练轨迹中演化而来,并在对未知任务进行评估时保持固定。在来自 τ-bench、τ2-bench 和 AgentBench 的 7 个确定性环境中,Life-Harness 在 18 个模型骨干网络的 126 个“模型-环境”设置中改进了其中的 116 个,平均相对提升达 88.5%。仅从 Qwen3-4B-Instruct 的轨迹中演化出的装备可以迁移到其他 17 个模型上,这表明 Life-Harness 捕捉到的是可复用的环境侧结构,而非特定于模型的行为。这些结果将运行时接口自适应定位为一种与“以模型为中心”的智能体训练互补的替代方案。原文链接:https://arxiv.org/abs/2605.22166前往小宇宙评论区与主播互动
-
591
【第651期】大模型深度学习:通过离线循环提升推理能力
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Do Language Models Need Sleep? Offline Recurrence for Improved Online InferenceSummary基于 Transformer 的大语言模型越来越多地被用于长周期任务;然而,它们的注意力机制在处理长上下文时扩展性较差。为了解决这一问题,我们研究了一种类似于睡眠的巩固机制(sleep-like consolidation mechanism),在该机制中,模型会定期将最近的上下文转化为持久的快速权重(fast weights),然后清除其键值缓存(KV cache)。在睡眠期间,模型会对积累的上下文进行 N 次线下循环处理(recurrent passes),并通过一种学习到的局部规则更新其状态空间模型(SSM)块中的快速权重。在推理过程中,这种做法将额外的计算量转移到了睡眠阶段,同时保持了觉醒时(wake-time)预测的低延迟。我们在受控的合成任务(包括细胞自动机和多步图检索)以及一个现实的数学推理任务上测试了我们的方法,在这些任务上,常规的 Transformer 以及 SSM-Attention 混合模型均宣告失败。随后我们表明,增加模型的睡眠持续时间 N 可以提升性能,其中在需要更深层次推理的样本上,性能提升最为显著。原文链接:https://arxiv.org/abs/2605.26099前往小宇宙评论区与主播互动
-
590
【第650期】AutoScientists:自组织智能体团队助力长期科学实验探索
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:AUTOSCIENTISTS: Self-Organizing Agent Teams for Long-Running Scientific ExperimentationSummary科学研究是通过“假设生成、实验设计、执行和修正”的迭代循环来推进的。AI 智能体可以使这一过程的部分环节实现自动化,但现有的方法通常遵循单一的研究轨迹,或者通过一个具有固定目标的核心规划器来进行协调。因此,在长期运行的实验中,它们难以维持并行探索、难以随着实验证据的变化而进行调整,也难以保存有关失败方向的知识。我们引入了 AutoScientists,这是一个用于长期计算科学实验的去中心化 AI 智能体团队。智能体们共同解读一个共享的实验状态,围绕有前景的假设自发组织成团队,在调用实验算力前对提案进行审辩式评议(critique),并分享成功与失败的经验以减少冗余探索。在相同的实验预算下,AutoScientists 在生物医学机器学习、语言模型训练优化以及蛋白质适应度预测方面均比先前的 AI 智能体有所提升:在 BioML-Bench 上(涵盖生物医学成像、蛋白质工程、单细胞组学和药物发现),AutoScientists 在 24 个任务中实现了 74.4% 的平均排行榜百分位,比最强的 AI 智能体提高了 +8.33%。在 GPT 训练优化上,AutoScientists 达到目标验证位/字节(bits-per-byte)的速度比 Autoresearch 快 1.9 倍,并且能够从一个初始的最优基准(starting champion)出发持续发现改进方案,而单智能体方法在此时则无法找到任何改进(采纳的改进方案数量为 7 对 0)。在 ProteinGym 适应度预测上,AutoScientists 发现了一种用于 ACE2-Spike 结合的方法,该方法相比当前最先进(SOTA)的模型在斯皮尔曼相关系数(Spearman correlation)上提升了 +12.5%。在不加修改地应用到所有 217 个 ProteinGym 测试中时,该方法将先前的最先进水平提升了 +6.5%(斯皮尔曼相关系数)。原文链接:https://arxiv.org/abs/2605.28655前往小宇宙评论区与主播互动
-
589
【第649期】编译智能体:将工作流写入大模型权重
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less CostSummary智能体编排框架在近年来大量涌现,LangGraph、CrewAI、Google ADK、OpenAI Agents SDK、Semantic Kernel、Strands 和 LlamaIndex 等框架在 GitHub 上累计获得的星标(stars)已突破 290,000 个。所有这些框架都遵循同一种模式:在 LLM 之上设立一个外部编排器,在每一步(turn)中注入指令并做出路由决策。近期的研究表明,对于程序化任务而言,这种架构的性能会被一种更简单的方法所压倒:即直接将操作程序写入尖端模型(frontier model)的系统提示词中 [Dennis et al., 2026a];但这需要付出代价——它会消耗上下文窗口、每次对话都需要调用尖端模型,并且会将专有操作程序暴露给第三方供应商。将程序编译到经过微调的小型模型的权重中——从而创建一个“隐形智能体”(subterranean agent)——应该能解决所有这些问题,且先前的研究(SimpleTOD、FireAct、SynTOD、WorkflowLLM、Agent Lumos)已经证实了该技术的可行性。然而,开发者的采纳态度却压倒性地偏向于编排框架。我们识别出了三个普遍认知的障碍,并通过在机票酒店预订(14 个节点)、Zoom 技术支持(14 个节点,包含特定产品知识)以及保险理赔(55 个节点,6 个决策中心)三个场景中的实证研究,对它们逐一进行了解决。原文链接:https://arxiv.org/abs/2605.22502前往小宇宙评论区与主播互动
-
588
【第648期】SkillOpt:大语言模型智能体技能的系统化文本优化器
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:SkillOpt: Executive Strategy for Self-Evolving Agent SkillsSummary今天的智能体技能(skills)要么是手工打造的、要么是一阶段(one-shot)生成的,或者是通过控制松散的自我修正演化而来的,这些方式的表现都不像针对技能的深度学习优化器,且在反馈下都无法可靠地超越其初始起点。我们认为,技能反而应该作为冻结状态下智能体的外部状态(external state)来进行训练,并应当具备与让权重空间优化(weight-space optimization)可复现相同的严谨度。据我们所知,SkillOpt 是首个针对智能体技能的系统化、可控的文本空间优化器(text-space optimizer):一个独立的优化器模型将带有评分的测试流(scored rollouts)转化为对单个技能文档进行有限制的“添加/删除/替换”编辑,并且只有当某次编辑能严格提升留出验证集(held-out validation score)的分数时,该编辑才会被接受。文本学习率预算(textual learning-rate budget)、被拒绝编辑缓冲区(rejected-edit buffer)以及基于轮次(epoch-wise)的慢速/元更新(slow/meta update),使得技能训练保持稳定,同时在部署时增加了零推理时间模型调用(zero inference-time model calls)。在涵盖 6 个基准测试、7 个目标模型和 3 个执行装备(直接对话、Codex、Claude Code)的测试中,SkillOpt 在所有 52 个被评估的(模型、基准测试、装备)组合单元格中均位列第一或并列第一,并击败了包括人类编写、一阶段 LLM 生成、Trace2Skill、TextGrad、GEPA 和 EvoSkill 技能在内的所有同单元格竞争对手。在 GPT-5.5 上,它在直接对话中将无技能基础准确率提升了 +23.5 个百分点,在 Codex 智能体循环中提升了 +24.8 个百分点,在 Claude Code 中提升了 +19.1 个百分点。迁移实验进一步表明,经过优化的技能产物在跨模型规模迁移、在 Codex 与 Claude Code 执行环境之间迁移,以及在无需进一步优化的情况下迁移到相近的数学基准测试时,依然能保持其价值。原文链接:https://arxiv.org/abs/2605.23904前往小宇宙评论区与主播互动
-
587
【第647期】CSIDH:高效后量子交换性群作用
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:CSIDH: An Efficient Post-Quantum Commutative Group ActionSummary我们提出了一种高效的交换群作用(commutative group action),适用于后量子环境下的非交互式密钥交换。我们的构建沿用了 Couveignes–Rostovtsev–Stolbunov 加密系统的布局,但我们将其应用于定义在大素数域 Fp 上的超奇异椭圆曲线(supersingular elliptic curves),而非普通椭圆曲线。由该群作用产生的 Diffie–Hellman 方案允许以极低的成本进行公钥验证,在实际运行中速度合理,并且在推测的 AES-128 安全级别下公钥仅为 64 字节,符合 NIST 的后量子安全类别 I(Category I)。原文链接:https://eprint.iacr.org/2018/383.pdf前往小宇宙评论区与主播互动
-
586
【第646期】PoUW:基于矩阵乘法的有用功证明方案
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Proofs of Useful Work from Arbitrary Matrix MultiplicationSummary我们重新审视了一个长期存在的开放性问题:在矿工自身选择输入 x 的真正无许可(permissionless)环境中,如何基于现实世界中的计算任务 T(x)(而非人为构建的随机哈希)来实现中本聪的共识。设计此类“有功证明”(Proof-of-Useful-Work, PoUW)协议的挑战在于,如何利用 T(x) 的原生计算来生成具有指定难度的证明证书,且该证书相较于 T(⋅) 的最坏情况复杂度而言,其计算开销可以忽略不计——这能确保恶意矿工无法通过欺骗验证器,在消耗同等计算资源的情况下获得比诚实矿工更高的接受概率来“操纵系统”。事实上,对于任何任务 T,获得一个具有 O(1) 倍开销的 PoUW 是轻而易举的,但这也毫无用处。我们的核心成果是针对矩阵乘法任务 MatMul(A,B)(针对任意矩阵)提出的一种 PoUW 协议。与朴素的 MatMul相比,该协议仅带来 1+o(1) 的乘法开销(即使在存在目前尚不实用的快速矩阵乘法类算法的情况下依然成立)。我们推测我们的协议具有最佳的安全性,即恶意证明者无法获得相比诚实证明者的任何显著优势。该推测基于将我们协议的难度归约至求解一批低秩随机线性方程组的任务,这一任务本身也具有独立的学术价值。由于矩阵乘法是大模型等 AI 计算以及无数工业级应用的瓶颈,该原语为设计一种全新的 L1 基础层协议提供了具体的方案。它几乎消除了比特币挖矿带来的能源浪费——允许 GPU 用户通过将计算“复用”于区块链共识来换取区块奖励(一举两得),从而降低其 AI 训练和推理成本。该区块链目前正在构建中。原文链接:https://arxiv.org/abs/2504.09971前往小宇宙评论区与主播互动
-
585
【第645期】生产级大语言模型智能体运行时架构设计模式
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM AgentsSummary生产环境中的大语言模型(LLM)智能体将随机的模型输出与确定性的软件系统结合在一起,然而这两者之间的边界却鲜少被视为一等架构对象(first-class architectural object)来对待。本文将这一边界命名为随机-确定性边界(Stochastic-Deterministic Boundary, SDB):这是一种由提案器(proposer)、验证器(verifier)、提交步骤(commit step)和拒绝信号(reject signal)组成的四部分契约,它规范了 LLM 的输出如何转化为系统行为。我们认为,SDB 是生产级智能体运行时(runtimes)的核心承重原语。围绕这一原语,我们将智能体运行时的设计划分为三个核心关注点:协同(Coordination)、状态(State)和控制(Control)。我们提供了一个包含六种运行时模式的目录,这些模式在对话式、自主式和长周期智能体中对 SDB 进行了不同的组合:分层委托(hierarchical delegation)、分发-聚合加 Saga 模式(scatter-gather plus saga)、事件驱动排序(event-driven sequencing)、共享状态机(shared state machine)、主管加网关(supervisor plus gate)以及人机回环(human in the loop)。对于每种模式,我们都追溯了其与分布式系统概念的渊源,并识别出了当执行者(worker)变为随机模型时所发生的变化。本文的贡献包括:一套用于选择运行时模式的五步方法论;一种将生产环境故障映射到模式缺陷的诊断流程;以及一种被称为重放分歧(replay divergence)的失效模式——即在模型版本或提示词发生变化时,基于 LLM 的确定性事件日志消费者会产生不同的下游输出。一个程式化的可靠性分解公式将单次调用的模型方差与架构惯性(architectural momentum)分离开来,从而有力地支持了这一论点:随着模型方差的降低,模式的选择和 SDB 的强度将成为提升长期可靠性愈发重要的杠杆。我们将该方法论应用到了五种工作负载中,并为一个运行周期为 90 天的合同续签智能体提供了一个可运行的参考实现。原文链接:https://arxiv.org/abs/2605.20173前往小宇宙评论区与主播互动
-
584
【第644期】MetaCogAgent:具有自我意识任务委派的元认知多智能体框架
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:MetaCogAgent: A Metacognitive Multi-Agent LLM Framework with Self-Aware Task DelegationSummary多智能体大语言模型(LLM)系统在通过智能体协同解决复杂任务方面展现出了良好的前景。然而,现有的框架通常基于预定义的角色来分配任务,而没有考虑智能体是否能准确评估自身的能力边界,从而导致智能体在执行超出其专业范围的任务时表现出过度自信。受到认知科学中元认知理论的启发,我们提出了 MetaCogAgent,这是一个多智能体 LLM 框架,其中每个智能体都配备了一个“元认知自我评估单元”(Metacognitive Self-Assessment Unit),用于在执行前评估任务与能力的匹配度。该框架带来了三项核心贡献:自我评估机制:通过将语言化的不确定性与历史能力图谱相结合,来评估每个任务的置信度;自适应委托协议:通过跨智能体评估,将低置信度的任务路由给更合适的智能体;能力边界学习模块:通过控制论反馈,迭代地精细化每个智能体的能力模型。在我们构建的 MetaCog-Eval 基准测试(涵盖 5 个认知维度的 700 个任务)上的实验表明,MetaCogAgent 实现了 82.4% 的任务准确率——比表现最好的路由基线高出 8.7%——同时比 AutoGen 减少了 5% 的 API 调用,比集成投票(ensemble voting)减少了 34% 的调用。消减实验(ablation studies)进一步证实,每个元认知组件都对系统整体性能做出了贡献。原文链接:https://arxiv.org/abs/2605.17292前往小宇宙评论区与主播互动
-
583
【第643期】强化学习推理模型的推理时博弈与增强
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Agentic Systems as Boosting Weak Reasoning ModelsSummary一个由弱推理模型调用组成的委员会,能否达到更强模型的性能?我们将“基于验证器支持的委员会搜索”(verifier-backed committee search)作为推理语言模型在推理阶段的提升机制(inference-time boosting)进行了研究。这一机制并非简单地依靠“智能体越多越好”:样本能够暴露潜在的正确解决方案,而批评器(critics)和比较器(comparators)必须在无法访问隐藏验证器的情况下恢复这些方案。我们通过将该视角拆分为:提案覆盖率(proposal coverage)、局部可识别性(local identifiability)、进展(progress)和多样性(diversity),从而将其公式化。我们证明了通过重复采样可以放大覆盖率,但采样本身无法创建有效的批评器或比较器;可靠的性能放大需要额外的局部正确性信号(local soundness signal),例如执行、证明检查、类型检查、测试或约束求解。我们给出了基于排名的边界,展示了局部选择错误在何时会组合成可靠的轨迹,并刻画了提案侧的天花板:预知(oracle)最高期望值 best-of-k 仅收敛于提案系统分配了非零有用概率的任务切片总量。在实验中,在 SWE-bench Verified 基准测试上,单次 GPT-5.4 nano 提案可以解决 67.0% 的任务。使用相同的 nano 模型,我们的“批评器-比较器”编排机制在 k=8 次提案中达到了 76.4% 的准确率,追平了 Gemini 3 Pro 和 Claude Opus 4.5 Thinking 的独立表现,并逼近了 79.0% 的预知(oracle)best-of-8 上限。因此,许多正确的补丁(patches)已经存在于弱模型的提案池中,主要的挑战在于如何将它们筛选出来。而剩余的失败案例则大多属于提案覆盖率失败,这表明存在着仅靠更强选择机制也无法弥补的共同盲区。原文链接:https://arxiv.org/abs/2605.14163前往小宇宙评论区与主播互动
-
582
【第642期】AIRA:大语言模型智能体自主发现神经架构的研究
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-DesignSummary迈向递归自我提升,我们研究了 LLM 智能体在超越标准 Transformer 的范畴下,自主设计基础模型的能力。我们提出了一种双框架方法:用于高层架构搜索的 AIRA-Compose,以及用于底层机制实现的 AIRA-Design。AIRA-Compose 动用了 11 个智能体,在 24 小时的预算限制下探索基础计算原语。智能体们对百万参数级的候选模型进行评估,并将最优的设计外推至 3.5 亿(350M)、10 亿(1B)和 30 亿(3B)参数规模。这催生了涵盖两个家族的 14 种架构:AIRAformers(基于 Transformer)和 AIRAhybrids(Transformer-Mamba 混合型)。在 1B 规模下进行预训练后,这些模型始终优于 Llama 3.2 和由 Composer 搜索到的基线模型。在下游任务上,AIRAformer-D 和 AIRAhybrid-D 相比 Llama 3.2 分别将准确率提升了 2.4% 和 3.8%。此外,AIRA-Compose 还发现了一些具备极高扩展效率前沿(scaling frontiers)的模型:AIRAformer-C 的扩展速度比 Llama 3.2 和 Composer 最好的 Transformer 分别快 54% 和 71%,而 AIRAhybrid-C 的扩展速度则比 Nemotron-2 快 23%,比 Composer 最好的混合架构快 37%。AIRA-Design 则指派了 20 个智能体来编写用于处理长距离依赖的新颖注意力机制,以及高性能的训练脚本。在长程竞技场(Long Range Arena)基准测试中,智能体设计的架构在文档匹配和文本分类任务上,与人类最先进水平(SOTA)的差距分别缩小到了 2.3% 和 2.6% 以内。在 Autoresearch 基准测试中,Greedy Opus 4.5 在固定时间预算下达到了 0.968 的验证位/字节(bits-per-byte),超越了已发表的最低值。这些框架共同表明,AI 智能体能够自主发现与手工设计基线相媲美甚至超越的架构和算法优化。这为探索下一代基础模型确立了一种强大的范式,标志着向递归自我提升迈出了切实的一步。原文链接:https://arxiv.org/abs/2605.15871前往小宇宙评论区与主播互动
-
581
【第641期】MEMO:大语言模型的模块化知识记忆框架
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:MEMO: Memory as a ModelSummary大型语言模型(LLMs)在广泛的任务中都取得了强大的性能,但在预训练之后、进行后续更新之前,它们始终保持着冻结状态。许多现实世界的应用都需要及时、特定领域的非公开/特定信息,这激发了对高效整合新知识机制的需求。在本文中,我们引入了 MeMo(模型即内存,Memory as a Model),这是一个模块化框架,它将新知识编码到一个专用的记忆模型中,同时保持 LLM 的参数不变。与现有方法相比,MeMo 具有以下几个优势:(a) 它能够捕获复杂的跨文档关系;(b) 它对检索噪声具有鲁棒性;(c) 它避免了 LLM 中的灾难性遗忘;(d) 它不需要访问 LLM 的权重或输出对数几率(logits),从而实现了与开源和专有闭源 LLM 的即插即用集成;(e) 在推理时,其检索成本与语料库大小无关。我们在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 三个基准测试上的实验结果表明,在各种不同的设置下,MeMo 与现有方法相比均取得了强劲的性能表现。原文链接:https://arxiv.org/abs/2605.15156前往小宇宙评论区与主播互动
-
580
【第640期】代码即代理框架:构建可执行与可验证的AI系统
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:Code as Agent HarnessSummary最近的大型语言模型(LLMs)在代码理解和生成方面展现出了强大的能力,涵盖了从竞赛编程到仓库级软件工程的广泛领域。在蓬勃发展的智能体(agentic)系统中,代码不再仅仅是一种目标输出,它正越来越多地扮演着智能体推理、行动、环境建模以及基于执行的验证的操作基底。我们从智能体装备(agent harnesses)的角度来界定这一转变,并引入了“代码即智能体装备”(code as agent harness)的概念:这是一种将代码视为智能体基础设施核心的统一视角。为了系统地研究这一观点,我们围绕三个相互关联的层级展开本次综述。首先,我们研究装备接口,即代码如何将智能体与推理、行动和环境建模连接起来。其次,我们探讨装备机制:用于长周期执行的规划、记忆和工具使用,以及使装备更具可靠性和自适应性的反馈驱动控制与优化。第三,我们讨论如何将装备从单智能体系统扩展到多智能体环境,其中共享的代码产物能够支持多智能体的协同、审查和验证。在这三个层级之上,我们总结了“代码即智能体装备”的代表性方法和实际应用,涵盖了编码助手、GUI/操作系统自动化、具身智能体、科学发现、个性化与推荐、DevOps 以及企业工作流。我们进一步概述了装备工程面临的开放性挑战,包括最终任务成功率之外的评估、不完全反馈下的验证、无回归的装备改进、跨多智能体的一致共享状态、针对安全关键型行动的人类监管,以及向多模态环境的扩展。通过将代码作为智能体 AI 的装备,“代码即智能体装备”这一综述为迈向可执行、可验证且具备状态记忆的 AI 智能体系统提供了一条统一的路线图。原文链接:https://arxiv.org/abs/2605.18747前往小宇宙评论区与主播互动
-
579
【第639期】智能数学协作:加速数学研究的AI引擎
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:AI co-mathematician: Accelerating mathematicians with agentic AISummary我们引入了“AI 联合数学家”(AI co-mathematician)——这是一个供数学家使用的工具平台,旨在通过交互方式利用 AI 智能体来开展开放式研究。该系统经过优化,能够为数学工作流程中充满探索性和迭代性的现实需求提供全方位支持,包括构思、文献检索、计算探索、定理证明以及理论构建。通过提供一个能够管理不确定性、细化用户意图、追踪失败假设并输出原生数学成果的异步且具备状态记忆的工作空间,该系统模拟了人类的协同工作流程。在早期测试中,“AI 联合数学家”协助研究人员解决了开放性问题,发现了新的研究方向,并找出了被忽略的文献参考。除了展示出一种用于 AI 辅助数学发现的高交互性范式外,“AI 联合数学家”在硬核问题解决基准测试中也取得了当前最佳(SOTA)的成绩,其中包括在 FrontierMath Tier 4 中获得了 48% 的评分,创下了所有受评估 AI 系统中的新最高纪录。原文链接:https://arxiv.org/abs/2605.06651前往小宇宙评论区与主播互动
-
578
【第638期】AutoTTS:大语言模型推理时间计算分配的自动发现
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。合作邮箱:zhiwudazhanjiangshi#gmail.com今天的主题是:LLMs Improving LLMs: Agentic Discovery for Test-Time ScalingSummary测试时扩展(Test-time scaling, TTS)已成为通过在推理期间分配额外计算来提高大语言模型性能的有效方法。然而,现有的 TTS 策略很大程度上是手工设计的:研究人员往往凭直觉手动设计推理模式并调整启发式规则,导致大部分计算分配空间未被探索。我们提出了一种环境驱动的框架 AutoTTS,它改变了研究人员的设计范式:从设计单个 TTS 启发式规则,转变为设计能够自动发现 TTS 策略的环境。AutoTTS 的核心在于环境构建:发现环境必须使控制空间易于处理(tractable),并为 TTS 搜索提供低成本且高频的反馈。具体实例化:我们将“宽度-深度”TTS 公式化为基于预先收集的推理轨迹和探测信号的控制器合成(controller synthesis)。在此框架下,控制器可以决定何时进行分支、继续、探测、剪枝或停止,并且可以在无需重复调用 LLM 的情况下进行低成本评估。效率优化:我们进一步引入了 beta 参数化以使搜索更易于处理,并引入了细粒度的执行轨迹反馈,通过帮助智能体诊断 TTS 程序失败的原因来提高发现效率。在数学推理基准测试上的实验表明,与强大的手工设计基线相比,自动发现的策略提升了整体的“准确率-成本”权衡(accuracy-cost tradeoff)。此外,这些策略还可以泛化到留出(held-out)的基准测试和不同的模型规模上,而整个发现过程仅需 39.9 美元和 160 分钟。原文链接:https://arxiv.org/abs/2605.08083前往小宇宙评论区与主播互动
We're indexing this podcast's transcripts for the first time — this can take a minute or two. We'll show results as soon as they're ready.
No matches for "" in this podcast's transcripts.
No topics indexed yet for this podcast.
Loading reviews...
ABOUT THIS SHOW
73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。
HOSTED BY
任雨山
CATEGORIES
Loading similar podcasts...