EPISODE · Aug 24, 2026 · 7 MIN
Simon Willison 做 AI 評測工具,最花時間的不是寫程式,是想清楚九個名詞
from 脈報 · host 思思主播
smevals 這個小型模型評測工具的主要命令只有四條,作者 Simon Willison 說專案最花時間的部分是敲定詞彙。本文攤開那九個名詞,說明詞彙的切法如何決定工具的形狀。 ⭐ 文章深度讀:原文沒有回答的 → https://heymaibao.com/smevals-eval-vocabulary-nine-terms/ ⚡ 章節重點 開場 00:00 先講這是什麼 00:29 那九個名詞 01:03 為什麼說詞彙決定了工具的形狀 03:11 上手路徑是寫給 AI agent 的 04:37 原文沒有回答的 05:09 你可以帶走的 06:07 結語 07:08 📝 懶人包 ∙ smevals 是一個新的小型評測工具,可以拿同一組題目去跑不同的模型設定,再對結果打分數 ∙ 作者說這個專案最花時間的部分是敲定它的詞彙,那份詞彙表有九個名詞 ∙ 執行和評分是兩條分開的命令,原文明說 runs 與 grading 是分開處理的 ∙ 我的觀察是,這個專案最值得抄的不是工具本身,是它先把九個名詞定清楚才動手的順序 📚 參考資料 smevals - a small eval suite for evaluating models, prompts, and harnesses → https://simonwillison.net/2026/Jul/31/smevals/ smevals - a small eval suite for evaluating models, prompts, and harnesses | Prime Radiant → https://primeradiant.com/blog/2026/smevals.html About | Prime Radiant → https://primeradiant.com/about/ Demystifying evals for AI agents → https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents Inspect → https://inspect.aisi.org.uk/ LLM Evals: Everything You Need to Know → https://hamel.dev/blog/posts/evals-faq/
Embed this episode
Ready to play
Simon Willison 做 AI 評測工具,最花時間的不是寫程式,是想清楚九個名詞
No transcript for this episode yet
Similar Episodes
No similar episodes found.