Skip to content
#710.YC:Harness 比模型更重要 episode artwork

EPISODE · Sep 8, 2026 · 55 MIN

#710.YC:Harness 比模型更重要

from 跨国串门儿计划

📝 本期播客简介 本期我们克隆了:Y Combinator · Why The Harness Matters More Than The Model | YC Paper Club 原内容更新时间:2026-09-07 本期来自 YC Paper Club,也就是 YC 论文俱乐部的 Harness 专场。主持人带着现场研究者和创业者回顾了 harness 从最初的生成循环,如何逐步加入上下文、工具调用、记忆、技能、子 Agent、递归调用与自我改进能力,并讨论为什么这些“模型之外”的系统设计,正在成为 Agent 能力的关键来源。 Seth 介绍了 Prime Agent,一个自我改进的 RLM harness,并展示同一模型在不同 harness 下运行 ARC-AGI、长程编程和自动科研任务时的巨大差异。Jon Saad-Falcon 介绍 OpenJarvis,讨论如何把个人 AI 的模型推理、Agent 执行、记忆和学习搬到端侧;Josh 和 Regan 则分享 YC 内部办公 Agent harness QM 的演进,以及如何通过集中式上下文、可切换的沙盒与模型运行时,为每位员工提供个性化助手。 这场讨论的核心并不是“该选哪个模型”,而是如何把 harness 做得足够有表达力:让 Agent 能管理自己的上下文、调用程序和子 Agent、选择资源与模型,并在长期运行中持续改进。同时,嘉宾也直面了成本、评测、公平比较、权限管理和社交语境等实际问题。 👤 本期嘉宾 本期由 Y Combinator 主持。Seth 是 Prime Intellect 的研究员、普林斯顿大学 Shi- Shi- Shi Chin 的学生,也是 Prime Agent 的作者,分享了如何从第一性原理构建自我改进的 RLM harness。Jon Saad-Falcon 是斯坦福相关项目的研究者,与共同一作 Avantika Narayan、导师 Azalia Mirhoseini 和 Christopher Ré 一起开发 OpenJarvis,探索端侧个人 AI 技术栈。Josh 刚刚升任 YC Labs 的负责人,Regan 与他共同负责 QM,这是 YC 面向办公场景的开源 Agent harness,为 YC 员工提供可在 Slack 和网页端使用的个性化助手。 ⏱️ 时间戳 00:17 harness为何值得研究 06:59 harness六年演进史 17:02 Prime Agent的自我改进 35:54 OpenJarvis走向端侧 43:54 QM连接YC办公系统 🌟 精彩内容 💡 Harness 不是包装层,而是能力本身 harness 长期被误解为 wrapper、脚手架或 Prompt 工程,但 ARC-AGI 的结果说明,模型权重相同,运行框架不同,最终能力可以出现数量级差异。它决定了模型能否使用工具、管理上下文、获得反馈并适应新问题。 "但光靠一些 harness,靠这个被认为不配当科研课题、只配叫包装层和脚手架的东西,我们就能做到 95%,而英伟达的 AVO 甚至做到了 100%。" 💡 模型之外,才是测试时经验的入口 模型可以通过 ICL 获得少量上下文,但很快会触及上下文长度和效果饱和的限制。harness 则把测试时经验组织成记忆、工具、REPL、子 Agent 和反馈循环,让模型能够在任务过程中持续适应,而不必每次都重新训练权重。 "所以我认为,这正是 harness 目前大放异彩的地方。" 💡 好的 harness 应该尽可能有表达力 Seth 认为,harness 不该把 Agent 限制在固定的规划—行动—评估流程里。模型已经能自行探索许多步骤,真正需要由 harness 提供的是调用 compaction、运行 Python REPL、创建子 Agent、访问状态和获取反馈的能力。 "你会希望它是你能想象到的最具表达力的东西。" 💡 上下文可以像缓存一样分层管理 Prime Agent 把模型权重、活跃上下文、REPL 状态、文件系统和持久化记忆看成不同层级的缓存。通过 compaction、程序化操作和子 Agent,系统可以减少重复生成,避免把所有信息都塞进上下文窗口。 "我喜欢把它看作有点像,比如我这里有 L1、L2、L3,它就像一个缓存,对吧?" 💡 自我改进的对象不只是 Prompt 从 DSPy 的系统提示词优化,到达尔文-哥德尔机对 harness 代码本身的修改,再到 continual harness 对历史 Trajectory、技能、记忆和子 Agent 规范的持续调整,Agent 系统正在从静态配置变成可以修改自身的系统。 "你不仅能改 system prompt,还能改 harness 本身,也就是正在跑的 harness 代码。" 💡 长期任务的公平比较,必须考虑预算 如果一个 Agent 因为预算耗尽而停止,另一个 Agent 还在继续运行,二者的结果就不能直接比较。长程评测不仅要看最终得分,还要观察测试时计算投入到什么程度后,性能提升开始趋于平缓。 "首先,你连对比模型时用的固定开销都不是同一个。" 💡 端侧 AI 的关键是优化整套技术栈 OpenJarvis 不只关注本地模型,而是把模型、推理引擎、Agent 逻辑、工具、记忆和学习机制都纳入统一的五层原语。云端模型可以负责优化本地配置,实际推理则在本地运行,从而同时改善成本、延迟、隐私和个性化。 "我们发现,经过 Claude 或 ChatGPT 这类云端大语言模型优化的 OpenJarvis 配置,效果远好于直接开箱即用的本地技术栈。" 💡 Agent 越自由,权限和社交语境越重要 QM 将沙盒从 Agent 的“家”变成可按需调用的资源,也允许 Agent 自主选择更合适的机器和模型运行时。但当 Agent 能访问公司的广泛资源时,权限控制和对话场景判断就会成为核心问题,单纯把信息灌进系统并不够。 "但要想让 Agent 也做到这一点,得花一番真功夫。" 🌐 播客信息补充 本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的 使用 AI 进行翻译,因此可能会有一些地方不通顺 在小宇宙查看该单集文稿

Episode metadata supplied by the publisher feed · Published Sep 8, 2026

Embed this episode

Ready to play

#710.YC:Harness 比模型更重要

0:00 55:41

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of 跨国串门儿计划?

This episode is 55 minutes long.

When was this 跨国串门儿计划 episode published?

This episode was published on September 8, 2026.

Can I download this 跨国串门儿计划 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!