EPISODE · Aug 12, 2026 · 23 MIN
その評価は測りたいものを測れているか? | EP00
from AIエンジニアリングの現場 · host r.kagaya
点数が高ければ、本当に能力が高いと言えるのでしょうか。視力2.0なのに黒板が読めない子のたとえから、LLMベンチマークとAgent Skillの評価を考えます。445件のベンチマーク論文を調べた研究を紹介しながら、課題の選び方、採点、データ汚染、評価者の偏りを整理します。評価で大事なのは、点数をつけることではなく、その点数が何の根拠になるのかを説明できることです。Measuring what Matters: Construct Validity in Large Language Model Benchmarksホスト:kagaya(@ry0_kaga)
Embed this episode
Ready to play
その評価は測りたいものを測れているか? | EP00
0:00
23:09
1×
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
Frequently Asked Questions
How long is this episode of AIエンジニアリングの現場?
This episode is 23 minutes long.
When was this AIエンジニアリングの現場 episode published?
This episode was published on August 12, 2026.
Can I download this AIエンジニアリングの現場 episode?
Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!