EPISODE · Jul 15, 2026 · 12 MIN
EP118 · Qwen 推理、小模型意图、NVIDIA 推理挑战 · 07-15 早报
from BestBlogs
章节时间戳00:00 开场00:43 精讲:Google 拆解 Qwen 3.5 在 Ironwood 上的推理瓶颈03:02 精讲:支付宝用黄金用例推动小模型意图识别上线05:28 精讲:NVIDIA 从 Kaggle 挑战复盘推理评测方法07:38 速览:Airbnb 评测、Vercel 路由、DSL 与 Agent 工程10:08 补充阅读:本地 LLM 成本、Seedream、Agent 协作、ChatGPT 前端11:52 结语★ 精讲一 | 系统工程手册:在 Ironwood (TPU7x) 上优化 Qwen 3.5-397B MoE00:43|来自 Google Developers BlogGoogle 性能团队用 Roofline 分析定位 Qwen 3.5 的预填充与解码瓶颈,再组合 Attention DP、Expert Parallelism 与 JAX/Pallas 内核,把模型拆成可复用模块并建立硬件感知成本模型。文章展开分片、集合通信和内存布局的取舍,最终让解码密集负载提升约 3.1 倍、预填充密集负载提升约 4.7 倍,给出从硬件边界到服务性能的系统优化路径。★ 精讲二 | 一个小模型意图识别系统的 5 天进化实录|支付宝 61803:02|来自 阿里技术阿里技术这份 618 复盘从一线工程约束出发:团队在 4 小时内完成模型选型,因资源交付风险最终采用 Qwen3-8B;随后用 52 条人工审查的黄金用例、训练/测试切分和规则加 LLM 双轨评分迭代系统提示词。它最可复用的部分,是把业务边界、评测反馈与上线取舍连成闭环。★ 精讲三 | 排行榜的经验:5,000+ 名 Kaggle 选手教会我们如何提升 AI 推理能力05:28|来自 NVIDIA Technical BlogNVIDIA 的 Kaggle 推理挑战把模型、硬件、基准和提交约束固定下来,让 5,000 多名参赛者集中比较训练数据、推理轨迹、token 预算和评测方法。文章总结的重点不是单个技巧,而是在受限 LoRA、私榜和问题类型拆分下,如何把推理能力改进做成可验证的工程流程。速览07:38 更多值得关注的内容· 从几周到一天:我们如何让 LLM 评估足够快以便进行迭代 — The Airbnb Tech Blog· 开放权重模型占比激增至 29% 的产出量,代币单价持平 — Vercel News· DSLs 实现 LLM 的可靠应用 — Martin Fowler· 极致量化,近三千亿参数 Hy3 单卡即可部署 — 腾讯混元· 从 Coder 到 Designer:电商团队数据研发的 Harness Engineering 实践 — 阿里技术· 命令行 AI 编程智能体的采用与影响 — Hacker News· AI 与职业这三年:震荡、规律与职业群像 — 腾讯研究院补充阅读10:08 今天额外值得一读的几条· 运行本地 LLM 的实际成本究竟是多少?(以每百万 Token 的欧元成本进行衡量) — Towards Data Science· Seedream 5.0 Pro 测评:图像编辑门槛爆降 — 歸藏的 AI 工具箱· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻 — 非凡产研· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现 — ClaudeDevs(@ClaudeDevs)· ChatGPT 网页版逆向工程全解析:十亿级用户背后的前端架构与性能哲学 — 前端早读课· 论文秀 Live#42 | ICML 2026 论文解读 — 蚂蚁技术 AntTech相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-15· 系统工程手册:在 Ironwood (TPU7x) 上优化 Qwen 3.5-397B MoE:https://www.bestblogs.dev/article/503141b2ed· 一个小模型意图识别系统的 5 天进化实录|支付宝 618:https://www.bestblogs.dev/article/0967b3358a· 排行榜的经验:5,000+ 名 Kaggle 选手教会我们如何提升 AI 推理能力:https://www.bestblogs.dev/article/cdc7dcd3ee· 从几周到一天:我们如何让 LLM 评估足够快以便进行迭代:https://www.bestblogs.dev/article/a3fb3ab87d· 开放权重模型占比激增至 29% 的产出量,代币单价持平:https://www.bestblogs.dev/article/656fa52278· DSLs 实现 LLM 的可靠应用:https://www.bestblogs.dev/article/fb398ea1d9· 极致量化,近三千亿参数 Hy3 单卡即可部署:https://www.bestblogs.dev/article/f37d5dd27b· 从 Coder 到 Designer:电商团队数据研发的 Harness Engineering 实践:https://www.bestblogs.dev/article/c7a89e8181· 命令行 AI 编程智能体的采用与影响:https://www.bestblogs.dev/article/239d6d5778· AI 与职业这三年:震荡、规律与职业群像:https://www.bestblogs.dev/article/a345e09f6d· 运行本地 LLM 的实际成本究竟是多少?(以每百万 Token 的欧元成本进行衡量):https://www.bestblogs.dev/article/21a5fdad9a· Seedream 5.0 Pro 测评:图像编辑门槛爆降:https://www.bestblogs.dev/article/069fb159d3· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻:https://www.bestblogs.dev/article/889606386f· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现:https://www.bestblogs.dev/status/2076789349145092230· ChatGPT 网页版逆向工程全解析:十亿级用户背后的前端架构与性能哲学:https://www.bestblogs.dev/article/e81fbc4ae5· 论文秀 Live#42 | ICML 2026 论文解读:https://www.bestblogs.dev/article/32b0189331关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。前往小宇宙评论区与主播互动
Embed this episode
Ready to play
EP118 · Qwen 推理、小模型意图、NVIDIA 推理挑战 · 07-15 早报
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.