EP173 · 开放模型成本、Agent 记忆、B 端实践 · 09-12 早报 episode artwork

EPISODE · Sep 12, 2026 · 14 MIN

EP173 · 开放模型成本、Agent 记忆、B 端实践 · 09-12 早报

from BestBlogs

章节时间戳00:00 开场00:55 精讲:The Pragmatic Engineer:开放模型选型以质量和成本实测03:48 精讲:大淘宝技术:HL-Mem 用事件和声明管理 Agent 长期记忆06:58 精讲:京东技术:B 端产品用 AI 反问与人工复核推进需求09:38 重点 4–6:递归自我改进、Google 多智能体、ChatGPT 在线存储11:13 重点 7–10:AI 情报定位、ChatGPT 金融服务、LLM 自动评测、AI Agent 工单13:43 结语★ 精讲一 | The Pulse:科技公司转向开放 AI 模型00:55|来自 The Pragmatic Engineer|BestBlogs 评分 90The Pragmatic Engineer 汇集 Uber、Pinterest 与 AT&T 的一线实践:通过开放权重模型、模型路由和持续基准测试,Uber 将单次 AI 请求成本降 34%、单次会话成本降 52%。文章的价值在于把模型选型从偏好之争落到真实任务、质量与成本的持续测量,也提醒团队为复杂任务保留前沿模型。★ 精讲二 | 让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍03:48|来自 大淘宝技术|BestBlogs 评分 90来自淘天直播 AIGC 团队的 HL-Mem 实践,将长期记忆设计为可治理的认知系统:不可变 Event 保存证据,Claim 可被新信息修正,并以有效时间和记录时间解释历史。它还把去重、来源准入、衰减和显式遗忘放进默认链路,为需要中文检索和本地部署的 Agent 提供了一套具体取舍。★ 精讲三 | AI 使用心得:B 端产品工作中的方法、边界与实践06:58|来自 京东技术|BestBlogs 评分 90京东技术的 B 端实战将 34 个人日的需求工作压缩至 15 个人日,并把经验归纳为背景输入、AI 反问、Skill 初稿和人工复核的循环。文中用支付、收银和接口对接案例说明:AI 擅长整理、暴露遗漏与生成可讨论版本;流程边界、异常规则和最终责任仍须由人确认。重点 4–1009:38 继续阅读七篇重点内容AI 研究者讨论递归自我改进究竟有多近 [视频]09:38|来自 Dwarkesh Patel|BestBlogs 评分 87Dwarkesh Patel、Beren Millidge、John Schulman 与 Charlie O’Neill 讨论扩展、强化学习和研究自动化能否带来递归自我改进,并拆解可能阻断它的泛化、评估和现实学习瓶颈。Google 发布多智能体最佳实践09:38|来自 Datawhale|BestBlogs 评分 88Google Research、DeepMind 与 MIT 联合研究用 260 个受控配置证明,多智能体效果取决于任务结构是否适合分工,而非模型强弱,并给出三条可查询判据与智能体数量最优值约束。快速扩展在线存储以服务超过 10 亿 ChatGPT 用户09:38|来自 OpenAI News|BestBlogs 评分 90OpenAI 工程团队解释了他们如何将基于 Python 的在线存储平台 Habitat 从一个简单的客户端库,扩展为一个处理每秒超过 70M 次请求、存储超过 500PB 数据,并为超过 10 亿周活跃 ChatGPT 用户提供服务的分布式系统。衡量 AI 在情报定位与常规武器领域的能力09:38|来自 Anthropic Research|BestBlogs 评分 90Anthropic 前沿红队构建的评估显示,前沿模型在照片地理定位、账号关联等情报定位任务上已匹配或超越人类专家,并能编写无人机制导软件;开放权重模型虽落后,但能力仍令人担忧。推出面向金融服务的 ChatGPT09:38|来自 OpenAI News|BestBlogs 评分 87OpenAI 推出面向金融服务的 ChatGPT,集成内置金融数据、公司专属模板与 GPT-6 Astra 推理能力,为金融机构自动化研究、财务建模和客户交付物。如何构建自评估 AI 系统:用于 LLM 应用的自动化测试和评估管道09:38|来自 freeCodeCamp|BestBlogs 评分 90本文介绍了如何构建一个三层评估管道——确定性检查、LLM-as-judge 评分和定期人工审查——来可靠地测试和监控 LLM 应用,包括回归测试和统计显著性分析。2 分钟到 20 秒!AI Agent 让工单处理可提效 9 倍09:38|来自 腾讯云开发者|BestBlogs 评分 90基于 AI Agent 的智能诊断系统通过配置驱动的并发取数、规则+LLM 双通道标签、分层决策 Trace 与 SSE 实时推送,将工单处理时间从 2-3 分钟压缩到 20-40 秒,实现 3-9× 提效。相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-12· The Pulse:科技公司转向开放 AI 模型:https://www.bestblogs.dev/article/8f1bc2c337· 让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍:https://www.bestblogs.dev/article/b742f07f15· AI 使用心得:B 端产品工作中的方法、边界与实践:https://www.bestblogs.dev/article/25453dd390· AI 研究者讨论递归自我改进究竟有多近 [视频]:https://www.bestblogs.dev/video/2794a8f13· Google 发布多智能体最佳实践:https://www.bestblogs.dev/article/18c7051871· 快速扩展在线存储以服务超过 10 亿 ChatGPT 用户:https://www.bestblogs.dev/article/d10d742de8· 衡量 AI 在情报定位与常规武器领域的能力:https://www.bestblogs.dev/article/93aba83998· 推出面向金融服务的 ChatGPT:https://www.bestblogs.dev/article/0b4d3e94ae· 如何构建自评估 AI 系统:用于 LLM 应用的自动化测试和评估管道:https://www.bestblogs.dev/article/56aa044175· 2 分钟到 20 秒!AI Agent 让工单处理可提效 9 倍:https://www.bestblogs.dev/article/6dfb071cd5关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。前往小宇宙评论区与主播互动

Episode metadata supplied by the publisher feed · Published Sep 12, 2026

Embed this episode

Ready to play

EP173 · 开放模型成本、Agent 记忆、B 端实践 · 09-12 早报

0:00 14:33

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of BestBlogs?

This episode is 14 minutes long.

When was this BestBlogs episode published?

This episode was published on September 12, 2026.

Can I download this BestBlogs episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!