EPISODE · Jun 18, 2026 · 20 MIN
METR:衡量AI复杂软件任务处理能力 AI胜任月度任务倒计时
from 每日AI · host 每日新闻
这份由模型评估与威胁研究机构(METR)发布的报告,提出了一项衡量人工智能能力的创新指标:“50%任务完成时间跨度”。研究人员通过让AI与具有专业背景的人类对比完成170项涵盖软件工程、网络安全和机器学习的真实任务,发现顶尖模型的能力正呈指数级增长。目前,如 o3 等前沿模型的性能已达到人类专业人员处理 110分钟 任务的水平,且该时间跨度大约每 七个月 就会翻倍。报告指出,这种进步主要源于模型在逻辑推理、工具使用及错误修复能力的提升。如果这一趋势持续,AI有望在 五年内 具备自主完成人类需耗时 一个月 才能处理的复杂软件任务的能力。作者同时提醒,这种自主性的增强也可能带来网络攻击或生物武器开发等潜在的风险,因此建立可靠的治理与安全基准至关重要。
Embed this episode
Ready to play
METR:衡量AI复杂软件任务处理能力 AI胜任月度任务倒计时
0:00
20:10
1×
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
Frequently Asked Questions
How long is this episode of 每日AI?
This episode is 20 minutes long.
When was this 每日AI episode published?
This episode was published on June 18, 2026.
Can I download this 每日AI episode?
Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!