EPISODE · Jul 11, 2026 · 13 MIN
EP114 · 代理长程验证、工程训练车间、产品判断力 · 07-11 早报
from BestBlogs
章节时间戳00:00 开场00:41 真实工程如何验证长程编码代理03:21 从写代码到做工程的训练路径06:08 AI 时代的产品判断与推荐透明度08:48 速览:模型、Agent 与推理成本11:23 补充阅读:具身模型与开源推理12:29 结语★ 精讲一 | Cognition 用真实工程验证 Claude Fable 5 的长程编程能力来自 Claude BlogCognition 用自建 Frontier Code 与工程师日常试用判断模型,而非只看通用基准。其团队称 Claude Fable 5 能在杂乱日志中定位根因、说明未知项,并可连续工作约八小时仍推进任务。文章提供的价值不在分数,而在考察长程编码代理是否值得托付的具体标准:能否守住约束、验证结果并在不确定时停下。★ 精讲二 | KAT-Coder-V2.5 正式发布:从「写代码」到「做工程」,Agentic 能力全面提升来自 快手技术快手把代码智能体的训练重点从单文件补全转向可运行的真实仓库:AutoBuilder 在隔离环境中生成配置、验证测试并迭代修复,使环境构建成功率提升至 57.2%,覆盖 12 种语言和超过 10 万个仓库。再结合多框架训练、分层奖励与失败轨迹回收,文章给出了一套针对长程工程任务的训练管线及其指标。★ 精讲三 | AI 时代品味、人类真实感与判断力的崛起 [视频]来自 Lenny's PodcastAdam Mosseri 在访谈中把 AI 工具普及后的产品工作拆成两个问题:执行成本下降时,团队仍需用有争议、可被反驳的策略判断决定做什么;推荐系统则可借助 LLM 把难以解释的向量偏好转成用户可理解、可调整的兴趣概念。对产品和内容团队而言,这是一份关于人类品味、身份标识与推荐透明度的观察。速览08:48 更多值得关注的内容· 全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑! — 量子位· 从模型到 Harness:WorkBuddy 如何把 Agent 做成可用产品 — 腾讯 WorkBuddy· 使用 NVIDIA NeMo 进行金融 AI 研究的合成数据生成 — NVIDIA Technical Blog· 意识 × Loop:让 Loop 跨 Session 自进化的最佳实践 — 阿里技术· 【揭秘】如何打造一支凌晨 3 点还在交付的 AI 军团 — 腾讯技术工程· 科技爱好者周刊(第 403 期):为什么 Dropbox 不成功 — 阮一峰的网络日志· AI 推理成本首次算清:GPU 利用率不到 52%,千万别自建! — InfoQ 中文补充阅读11:23 今天额外值得一读的几条· 万字科普:一千个「世界模型」在发布,到底什么是世界模型? — Founder Park· 构建智能体基础设施的未来:Claude Platform 如何迈向组织级能力 [视频] — Claude· 用 AI 工具开启全新的设计方式:从编码智能体到可迭代品牌系统 [视频] — Y Combinator· 更好的工具反而让 Copilot 代码审查变差。以下是我们实际改进的方法。 — The GitHub Blog· 一位投资人对具身、模型与算力的 17 条判断 — 腾讯科技· 最快半年 AI 跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地 — 硅谷 101相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-11· Cognition 用真实工程验证 Claude Fable 5 的长程编程能力:https://www.bestblogs.dev/article/accaa4f5· KAT-Coder-V2.5 正式发布:从「写代码」到「做工程」,Agentic 能力全面提升:https://www.bestblogs.dev/article/7e04fc4b· AI 时代品味、人类真实感与判断力的崛起 [视频]:https://www.bestblogs.dev/video/4f144a1· 全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!:https://www.bestblogs.dev/article/795ef869· 从模型到 Harness:WorkBuddy 如何把 Agent 做成可用产品:https://www.bestblogs.dev/article/17a8e853· 使用 NVIDIA NeMo 进行金融 AI 研究的合成数据生成:https://www.bestblogs.dev/article/c40e09e7· 意识 × Loop:让 Loop 跨 Session 自进化的最佳实践:https://www.bestblogs.dev/article/378c699c· 【揭秘】如何打造一支凌晨 3 点还在交付的 AI 军团:https://www.bestblogs.dev/article/27af35d9· 科技爱好者周刊(第 403 期):为什么 Dropbox 不成功:https://www.bestblogs.dev/article/ed17668d· AI 推理成本首次算清:GPU 利用率不到 52%,千万别自建!:https://www.bestblogs.dev/article/8be96450· 万字科普:一千个「世界模型」在发布,到底什么是世界模型?:https://www.bestblogs.dev/article/6db25567· 构建智能体基础设施的未来:Claude Platform 如何迈向组织级能力 [视频]:https://www.bestblogs.dev/video/140de6b· 用 AI 工具开启全新的设计方式:从编码智能体到可迭代品牌系统 [视频]:https://www.bestblogs.dev/video/febedc8· 更好的工具反而让 Copilot 代码审查变差。以下是我们实际改进的方法。:https://www.bestblogs.dev/article/b246fd1d· 一位投资人对具身、模型与算力的 17 条判断:https://www.bestblogs.dev/article/fdd658ce· 最快半年 AI 跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地:https://www.bestblogs.dev/article/58585714关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。前往小宇宙评论区与主播互动
Embed this episode
Ready to play
EP114 · 代理长程验证、工程训练车间、产品判断力 · 07-11 早报
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.