EPISODE · Mar 13, 2026 · 10 MIN
Agent Skills 第一份大規模實驗:人寫的有效,AI 寫的無效
from 脈報 · host 思思主播
SkillsBench 用七千次實驗測出:人寫的 Skills 平均提升 16 個百分點,AI 自己寫的反而降低表現。2-3 個精練 Skills 效果最好,寫太多反而有害。本文拆解三條設計原則。 ⭐ 文章深度讀:人寫 vs AI 寫 Skills 的實驗數據和三條設計原則 → https://heymaibao.com/skillsbench-agent-skills-benchmark/ 📝 懶人包 ∙ 人類策展的 Skills 平均提升 16.2 個百分點,但讓 AI 自己寫 Skills 完全無效,平均反而降了 1.3 個百分點 ∙ 少即是多:2-3 個精練 Skills 最有效 (+18.6pp),寫 4 個以上或堆積詳盡文件反而拖累表現 ∙ Skills 對模型訓練資料覆蓋不足的領域幫助最大:醫療保健 +51.9pp,軟體工程只有 +4.5pp ∙ 我的觀點:這篇論文最重要的不是「Skills 有用」,而是證明有效 Skills 的核心是人類隱性知識的外顯化。AI 能消費好的 Skills,但自己寫不出來 📚 參考資料 SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks (Zheng et al., 2026) → https://arxiv.org/abs/2602.12670
Embed this episode
NOW PLAYING
Agent Skills 第一份大規模實驗:人寫的有效,AI 寫的無效
No transcript for this episode yet
Similar Episodes
No similar episodes found.