【第667期】Self-harness:大语言模型代理的进化演进系统 episode artwork

EPISODE · Jul 28, 2026 · 13 MIN

【第667期】Self-harness:大语言模型代理的进化演进系统

from Seventy3

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Self-Harness: Harnesses That Improve ThemselvesSummaryBased LLM-based agent(基于大语言模型的智能体)的性能受其基座模型以及协调其与环境交互的框架/驾驭系统(harness)共同塑造。由于不同的模型表现出截然不同的行为特征,因此有效的 harness 设计本质上是需要针对特定模型定制的。然而,智能体 harness 至今在很大程度上仍由人类专家手动工程化构建,随着现代 LLM 日益多样化且快速迭代,这种范式在扩展性方面表现极差。在本文中,我们提出了 Self-Harness——一种全新的范式,在此范式下,基于 LLM 的智能体可以在不依赖人类工程师或更强外部智能体的情况下,自我改进其运行 harness。我们将 Self-Harness 实例化为一个包含三个阶段的迭代循环:弱点挖掘(Weakness Mining):从执行轨迹中识别特定模型的失败模式;Harness 方案提出(Harness Proposal):生成与这些失败紧密相关的、多样化且最小化的 harness 修正方案;方案验证(Proposal Validation):仅在通过回归测试后才接受候选的修改。我们在 Terminal-Bench-2.0 上使用一个极简的初始 harness 以及来自不同家族的三款基座模型(MiniMax M2.5、Qwen3.5-35B-A3B 和 GLM-5)对 Self-Harness 进行了实例化评估。在这三款模型上,Self-Harness 均一致提升了性能,保留测试集(held-out)的通过率分别从 40.5% 提升至 61.9%、从 23.8% 提升至 38.1%,以及从 42.9% 提升至 57.1%。定性分析进一步表明,Self-Harness 并不仅仅是添加通用的指令,而是有效地将特定模型的弱点转化为具体、可执行的 harness 改动。这些结果表明,基于 LLM 的智能体不仅能被其 harness 塑造,还能开辟一条参与重塑自身 harness 的演进路径。原文链接:https://arxiv.org/abs/2606.09498前往小宇宙评论区与主播互动

Episode metadata supplied by the publisher feed · Published Jul 28, 2026

Embed this episode

NOW PLAYING

【第667期】Self-harness:大语言模型代理的进化演进系统

0:00 13:40

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Seventy3?

This episode is 13 minutes long.

When was this Seventy3 episode published?

This episode was published on July 28, 2026.

Can I download this Seventy3 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!