EPISODE · Jun 18, 2026 · 11 MIN
AI Agent 论文播报 1117:评测、运行时、记忆三连解耦
from 周六9点半
这期我们顺着一个反常数字切入:同一个 Claude Opus 4.6,换不同 Agent 脚手架,TerminalBench 成功率能从 58% 飙到近 80%。今天的三篇重点论文从评测、运行时、长期记忆三个方向同时指向同一个关键词——解耦。本期重点* 编码 Agent 评测的根本错位(Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering):直接挑战 SWE-Bench 这套主流评测,指出 model/harness/environment 被打包成一个分数,并提出 NS2 这种组件级、verifier-of-verifier 的评测框架。* 多 Agent 并发异常的形式化检测与防御(Verified Detection and Prevention of Concurrency A...去小宇宙查看完整单集简介在小宇宙查看该单集文稿
Embed this episode
Ready to play
AI Agent 论文播报 1117:评测、运行时、记忆三连解耦
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.