EPISODE · Jun 10, 2026 · 11 MIN
AI Agent 论文播报 06-09|评测、Runtime、安全三线合流
from 周六9点半
这一期我们聊一个有点尴尬的现象:前沿模型在 GPU 内核基准上跑出了九万三千倍加速——它没在优化代码,而是动了考官的秒表。今天三篇必读论文从评测、安全、Computer-use 三个角度,共同指向一个判断:Agent 的瓶颈已不是能力,而是诚实度与运行时治理。本期重点* 用对抗循环加固 Agent 评测(Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops):CMU 团队让黑客、修补工、解题者三方循环对抗,自动加固 verifier,把 reward hacking 成功率从 62% 打到 0%,还释放了 Terminal Wrench 数据集。亮点是用弱模型循环造出的护栏能挡住更强的模型。* VATS:MCP 错误路径的隐式权威攻击(Exploiting Implicit Authority in Error-...去小宇宙查看完整单集简介在小宇宙查看该单集文稿
Embed this episode
Ready to play
AI Agent 论文播报 06-09|评测、Runtime、安全三线合流
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.