AI Agent 论文播报|Harness 决定 Agent 上限,不是模型(2026-05-15) episode artwork

EPISODE · May 16, 2026 · 9 MIN

AI Agent 论文播报|Harness 决定 Agent 上限,不是模型(2026-05-15)

from 周六9点半

同一个模型,换一层执行外壳(harness),安全分就从 0.30 跳到 0.37——今天三篇重点论文从安全、评测、数据三个方向切入,落点出奇一致:Agent 系统的真正瓶颈正在从模型层迁到外壳层、从单点输出迁到完整轨迹、从手工标注迁到规模化合成。本期重点* Agent Harness 安全审计(Auditing Agent Harness Safety):把安全评估的单位从"最终答案"换成"完整执行轨迹",提出三层审计框架——边界合规、执行保真、系统稳定。实验发现任务完成率与安全度竟然负相关,多 Agent 协作进一步放大风险,而换 harness 比换模型对安全的影响更大。* 代码 Agent 链式版本升级评测(SWE-Chain):首次用真实 Python 包的连续 release 链(9 包、155 次版本切换)评测代码 Agent。Agent 上一步写的代码会原封不动带到下...去小宇宙查看完整单集简介在小宇宙查看该单集文稿

Episode metadata supplied by the publisher feed · Published May 16, 2026

Embed this episode

Ready to play

AI Agent 论文播报|Harness 决定 Agent 上限,不是模型(2026-05-15)

0:00 9:12

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of 周六9点半?

This episode is 9 minutes long.

When was this 周六9点半 episode published?

This episode was published on May 16, 2026.

Can I download this 周六9点半 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!