EPISODE · Jul 28, 2026 · 10 MIN
为什么 AI 有时半天不开口,一开口却说得很快?
from 本利行间
“这个模型很快”到底是什么意思?它可能是第一句话来得快,也可能是开口以后说得快;还可能只是平均速度漂亮,却经常让少数用户等得很久。这一期用餐厅作比喻,拆开首 token 延迟、输出速度、端到端延迟、吞吐量和尾延迟,并解释为什么任何模型榜单都必须先问:测的是什么负载、上下文和服务条件?时间戳:- 00:00 开场:快,其实有好几种- 01:23 第一口菜等多久:首 token 延迟- 02:43 开口以后有多快:输出 token 速度- 04:24 整顿饭吃多久:端到端延迟- 05:43 一晚接多少桌:吞吐量- 07:03 做完不算,按时做完才算:尾延迟- 08:23 模型榜到底应该怎么看本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
Embed this episode
Ready to play
为什么 AI 有时半天不开口,一开口却说得很快?
0:00
10:16
1×
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
Frequently Asked Questions
How long is this episode of 本利行间?
This episode is 10 minutes long.
When was this 本利行间 episode published?
This episode was published on July 28, 2026.
Can I download this 本利行间 episode?
Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!