EPISODE · Jul 24, 2026 · 12 MIN
EP128 · Opus 5、Agent 控制系统、超级团队 · 07-25 早报
from BestBlogs
章节时间戳00:00 开场00:43 精讲:Anthropic 用任务成本解释 Opus 5 的能力增量02:57 精讲:腾讯 WorkBuddy 拆解 Agent 的上下文与控制系统05:32 精讲:袁晓辉分析个人提效为何未转化为组织加速07:39 速览:Kimi K3、FLUX 3、Agent 评测、AMD、算力公平10:25 补充阅读:Harness 降本、HumanLayer、ModelExpress、llm-d、LUNAR12:04 结语★ 精讲一 | Anthropic 发布 Claude Opus 5 新一代旗舰模型00:43|来自 Anthropic NewsAnthropic 将 Opus 5 作为 Max 默认、Pro 最强模型发布:Frontier-Bench 得分超过前代两倍,ARC-AGI 3 是次优模型三倍,OSWorld 以约三分之一成本超过 Fable 5 最佳成绩。它还展示了自建视觉管线和测试工具修复复杂任务的案例;但这些数据多来自厂商测试,网络安全能力仍落后 Mythos 5。★ 精讲二 | 腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品02:57|来自 腾讯技术工程WorkBuddy 团队把 Agent 可靠性拆成上下文、工具、权限、验证与反馈系统:稳定规则放 System Prompt,项目知识和 Skill 按需加载;危险动作由沙箱与审批约束,确定性错误优先交给 linter、测试等程序信号纠正。文章还区分可版本化的 Skill 与长期 Memory,帮助读者判断模型能力何时才能变成可控的产品能力。★ 精讲三 | 袁晓辉:AI 让每个人都变强了,但为什么公司没跑得更快?05:32|来自 腾讯研究院腾讯研究院袁晓辉解释了个人提效为何没有等比例变成组织产出:流程中未被优化的环节限制整体加速,瓶颈转移到跨部门协作、方案判断和反馈闭环。文章给出的判断框架是,人负责选择与创造,Agent 承担执行,同时用共享上下文、知识沉淀和持续反馈连接各节点。速览07:39 更多值得关注的内容· 分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货) — 阿里技术· Kimi K3 重绘开放前沿,Muse Spark 1.1 打响低价竞争 — The Batch | DeepLearning.AI· FLUX 3 x mimic:视频-动作模型的下一代 — Hacker News· 评测与提示词如何塑造智能体行为 [视频] — AI Engineer· 火山引擎开源 Agent 驱动的搜索自迭代技术 — 字节跳动开源· AMD 挑战英伟达全栈壁垒|一文读懂 AMD AAI 2026 — 腾讯科技· 科技爱好者周刊(第 405 期):资源,社会公平与算力 — 阮一峰的网络日志补充阅读10:25 今天额外值得一读的几条· Token 降本 50%:Harness 工作流的成本优化实践 — 腾讯云开发者· 面向编码智能体的高级上下文工程(wsff.md)— humanlayer/advanced-context-engineering-for-coding-agents — Hacker News· ModelExpress:以光速分发模型制品 — NVIDIA Technical Blog· 打造 Claude Design 的产品设计师如何用它 | Claude by Anthropic — Claude Blog· 介绍 llm-d 中的强化学习协作式时间分片 — Google Cloud Blog· 红队测试 LLM 遗忘机制:LUNAR「被遗忘」的知识仍然可恢复 —— LessWrong — LessWrong相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-25· Anthropic 发布 Claude Opus 5 新一代旗舰模型:https://www.bestblogs.dev/article/df39204f7d· 腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品:https://www.bestblogs.dev/article/933063ff13· 袁晓辉:AI 让每个人都变强了,但为什么公司没跑得更快?:https://www.bestblogs.dev/article/7f4db6f6b7· 分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货):https://www.bestblogs.dev/article/e2c6c71ac5· Kimi K3 重绘开放前沿,Muse Spark 1.1 打响低价竞争:https://www.bestblogs.dev/article/c4bb079c24· FLUX 3 x mimic:视频-动作模型的下一代:https://www.bestblogs.dev/article/b8e3c4188e· 评测与提示词如何塑造智能体行为 [视频]:https://www.bestblogs.dev/video/b2b4d795f· 火山引擎开源 Agent 驱动的搜索自迭代技术:https://www.bestblogs.dev/article/df40765058· AMD 挑战英伟达全栈壁垒|一文读懂 AMD AAI 2026:https://www.bestblogs.dev/article/b713cfbd14· 科技爱好者周刊(第 405 期):资源,社会公平与算力:https://www.bestblogs.dev/article/a382dc423d· Token 降本 50%:Harness 工作流的成本优化实践:https://www.bestblogs.dev/article/caad9b4004· 面向编码智能体的高级上下文工程(wsff.md)— humanlayer/advanced-context-engineering-for-coding-agents:https://www.bestblogs.dev/article/4260b34afd· ModelExpress:以光速分发模型制品:https://www.bestblogs.dev/article/daf4b8eca1· 打造 Claude Design 的产品设计师如何用它 | Claude by Anthropic:https://www.bestblogs.dev/article/ee3e8dd6a7· 介绍 llm-d 中的强化学习协作式时间分片:https://www.bestblogs.dev/article/6c9d2fa5ba· 红队测试 LLM 遗忘机制:LUNAR「被遗忘」的知识仍然可恢复 —— LessWrong:https://www.bestblogs.dev/article/189468736e关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。前往小宇宙评论区与主播互动
Embed this episode
Ready to play
EP128 · Opus 5、Agent 控制系统、超级团队 · 07-25 早报
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.