EPISODE · Sep 12, 2026 · 14 MIN
EP173 · 开放模型成本、Agent 记忆、B 端实践 · 09-12 早报
from BestBlogs
章节时间戳00:00 开场00:55 精讲:The Pragmatic Engineer:开放模型选型以质量和成本实测03:48 精讲:大淘宝技术:HL-Mem 用事件和声明管理 Agent 长期记忆06:58 精讲:京东技术:B 端产品用 AI 反问与人工复核推进需求09:38 重点 4–6:递归自我改进、Google 多智能体、ChatGPT 在线存储11:13 重点 7–10:AI 情报定位、ChatGPT 金融服务、LLM 自动评测、AI Agent 工单13:43 结语★ 精讲一 | The Pulse:科技公司转向开放 AI 模型00:55|来自 The Pragmatic Engineer|BestBlogs 评分 90The Pragmatic Engineer 汇集 Uber、Pinterest 与 AT&T 的一线实践:通过开放权重模型、模型路由和持续基准测试,Uber 将单次 AI 请求成本降 34%、单次会话成本降 52%。文章的价值在于把模型选型从偏好之争落到真实任务、质量与成本的持续测量,也提醒团队为复杂任务保留前沿模型。★ 精讲二 | 让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍03:48|来自 大淘宝技术|BestBlogs 评分 90来自淘天直播 AIGC 团队的 HL-Mem 实践,将长期记忆设计为可治理的认知系统:不可变 Event 保存证据,Claim 可被新信息修正,并以有效时间和记录时间解释历史。它还把去重、来源准入、衰减和显式遗忘放进默认链路,为需要中文检索和本地部署的 Agent 提供了一套具体取舍。★ 精讲三 | AI 使用心得:B 端产品工作中的方法、边界与实践06:58|来自 京东技术|BestBlogs 评分 90京东技术的 B 端实战将 34 个人日的需求工作压缩至 15 个人日,并把经验归纳为背景输入、AI 反问、Skill 初稿和人工复核的循环。文中用支付、收银和接口对接案例说明:AI 擅长整理、暴露遗漏与生成可讨论版本;流程边界、异常规则和最终责任仍须由人确认。重点 4–1009:38 继续阅读七篇重点内容AI 研究者讨论递归自我改进究竟有多近 [视频]09:38|来自 Dwarkesh Patel|BestBlogs 评分 87Dwarkesh Patel、Beren Millidge、John Schulman 与 Charlie O’Neill 讨论扩展、强化学习和研究自动化能否带来递归自我改进,并拆解可能阻断它的泛化、评估和现实学习瓶颈。Google 发布多智能体最佳实践09:38|来自 Datawhale|BestBlogs 评分 88Google Research、DeepMind 与 MIT 联合研究用 260 个受控配置证明,多智能体效果取决于任务结构是否适合分工,而非模型强弱,并给出三条可查询判据与智能体数量最优值约束。快速扩展在线存储以服务超过 10 亿 ChatGPT 用户09:38|来自 OpenAI News|BestBlogs 评分 90OpenAI 工程团队解释了他们如何将基于 Python 的在线存储平台 Habitat 从一个简单的客户端库,扩展为一个处理每秒超过 70M 次请求、存储超过 500PB 数据,并为超过 10 亿周活跃 ChatGPT 用户提供服务的分布式系统。衡量 AI 在情报定位与常规武器领域的能力09:38|来自 Anthropic Research|BestBlogs 评分 90Anthropic 前沿红队构建的评估显示,前沿模型在照片地理定位、账号关联等情报定位任务上已匹配或超越人类专家,并能编写无人机制导软件;开放权重模型虽落后,但能力仍令人担忧。推出面向金融服务的 ChatGPT09:38|来自 OpenAI News|BestBlogs 评分 87OpenAI 推出面向金融服务的 ChatGPT,集成内置金融数据、公司专属模板与 GPT-6 Astra 推理能力,为金融机构自动化研究、财务建模和客户交付物。如何构建自评估 AI 系统:用于 LLM 应用的自动化测试和评估管道09:38|来自 freeCodeCamp|BestBlogs 评分 90本文介绍了如何构建一个三层评估管道——确定性检查、LLM-as-judge 评分和定期人工审查——来可靠地测试和监控 LLM 应用,包括回归测试和统计显著性分析。2 分钟到 20 秒!AI Agent 让工单处理可提效 9 倍09:38|来自 腾讯云开发者|BestBlogs 评分 90基于 AI Agent 的智能诊断系统通过配置驱动的并发取数、规则+LLM 双通道标签、分层决策 Trace 与 SSE 实时推送,将工单处理时间从 2-3 分钟压缩到 20-40 秒,实现 3-9× 提效。相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-12· The Pulse:科技公司转向开放 AI 模型:https://www.bestblogs.dev/article/8f1bc2c337· 让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍:https://www.bestblogs.dev/article/b742f07f15· AI 使用心得:B 端产品工作中的方法、边界与实践:https://www.bestblogs.dev/article/25453dd390· AI 研究者讨论递归自我改进究竟有多近 [视频]:https://www.bestblogs.dev/video/2794a8f13· Google 发布多智能体最佳实践:https://www.bestblogs.dev/article/18c7051871· 快速扩展在线存储以服务超过 10 亿 ChatGPT 用户:https://www.bestblogs.dev/article/d10d742de8· 衡量 AI 在情报定位与常规武器领域的能力:https://www.bestblogs.dev/article/93aba83998· 推出面向金融服务的 ChatGPT:https://www.bestblogs.dev/article/0b4d3e94ae· 如何构建自评估 AI 系统:用于 LLM 应用的自动化测试和评估管道:https://www.bestblogs.dev/article/56aa044175· 2 分钟到 20 秒!AI Agent 让工单处理可提效 9 倍:https://www.bestblogs.dev/article/6dfb071cd5关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。前往小宇宙评论区与主播互动
Embed this episode
Ready to play
EP173 · 开放模型成本、Agent 记忆、B 端实践 · 09-12 早报
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.