EPISODE · Jul 16, 2026 · 11 MIN
EP119 · AINMM 五级成熟度模型、田渊栋论人类判断力、Ai2 Shippy 智能体构建 · 07-16 早报
from BestBlogs
章节时间戳00:00 开场00:46 精讲:大淘宝技术 AINMM 五级模型,量化 AI 原生研发差距,Harness 比 Agent 更重要02:57 精讲:田渊栋访谈,自进化 AI 已接管大量代码,人类判断力与深层理解是最后护城河05:04 精讲:Ai2 海事智能体 Shippy 面对高风险决策,用确定性专用 CLI 喂给不确定的 agent07:21 速览:GPT-Red、Cursor 飞轮、Qwen 语音、Claude Code 协同编辑、Sal Khan 传统行业09:39 补充阅读:Meta 广告、AI 语音欺诈、AI MediaKit、HSCodeComp 基准、vivo Vue 重构11:09 结语★ 精讲一 | AINMM:存量生产级工程向 AI Native 演进的五级成熟度模型00:46|来自 大淘宝技术大淘宝技术借鉴 CMMI 思想提出 AINMM,把 AI Native 研发能力分成 ML1 已感知到 ML5 持续优化五级,明确面向存量生产级工程。模型围绕上下文工程、能力封装、验证回路、协作契约、自进化五个过程域做雷达图打分,把模糊自评转成可量化的差距识别。作者用挽单系统实测,总分从 30 涨到 48、由 ML1 走到 ML2,并强调 Harness 比 Agent 更重要,框架本身不是银弹。★ 精讲二 | 目前架构下,自进化后的 AI 也无法替代人类的判断力|田渊栋02:57|来自 腾讯科技这是腾讯科技《沸腾之下》对田渊栋的长访:他长期在 Meta FAIR 做前沿 AI 研究,2026 年联合创办 Recursive AI。文中先列出 RSI 进展:Claude 已接管 Anthropic 内部超 80% 的代码,Mythos 在训练代码优化上实现 52 倍加速。但田渊栋判断,人类最后的护城河是无法结构化外化的「深层理解」与判断力(Taste):AI 擅长模式匹配却缺乏对新结构的即时理解,做不出相对论式的概念突破,skill 蒸馏也只能触及表层流程。★ 精讲三 | 从构建 Shippy 中学到的智能体构建经验05:04|来自 Hugging Face - BlogAi2 的 Skylight 团队分享海事智能体 Shippy 的架构:场景是高风险决策,答错可能让巡逻船跑错方向。他们把 agent 拆成 soul(系统提示词定边界)、skills(同 Claude Code 的 markdown 技能)、config(OpenClaw 跑 Claude Opus 4.6)。最关键的一条经验是用确定性专用 CLI 喂给不确定的 agent——早期让它直接拼 API 时,踩了一连串分页、几何编码的坑。沙箱上每用户开独立 K8s 会话,评测也由领域专家写 rubric、LLM 裁判逐项打分。速览07:21 更多值得关注的内容· GPT-Red:解锁自我改进以增强鲁棒性 — OpenAI News· Cursor 如何通过递归模型改进打造训练飞轮 [视频] — AI Engineer· Qwen-Audio-3.0-Realtime 如何让语音交互「懂倾听,更聪明」? — 通义实验室· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻 — 非凡产研· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现 — ClaudeDevs(@ClaudeDevs)· 10000 小时人类数据,练出全球首个全身移动操作隐式世界动作模型 — 机器之心· Khan Academy CEO Sal Khan:AI 真正的机会藏在被忽视的传统行业 [视频] — Silicon Valley Girl补充阅读09:39 今天额外值得一读的几条· 探索用于 Meta 广告深层漏斗优化的分层兴趣表示 — Engineering at Meta· 三秒盗窃:为什么 AI 语音欺诈能够超越所有防御 — Hacker News· 让 Agent 成为音视频工作台:AI MediaKit CLI + Skill 发布 — 字节跳动技术团队· 不要让 Claude 给自己的作业打分 — Towards Data Science· 阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟 — 阿里技术· AI 编码实战 | 0 行手写代码,2 天重构 2 万行 Vue 项目 — vivo 互联网技术相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-16· AINMM:存量生产级工程向 AI Native 演进的五级成熟度模型:https://www.bestblogs.dev/article/8be248980d· 目前架构下,自进化后的 AI 也无法替代人类的判断力|田渊栋:https://www.bestblogs.dev/article/7cf769502e· 从构建 Shippy 中学到的智能体构建经验:https://www.bestblogs.dev/article/dca72de584· GPT-Red:解锁自我改进以增强鲁棒性:https://www.bestblogs.dev/article/240dbf9157· Cursor 如何通过递归模型改进打造训练飞轮 [视频]:https://www.bestblogs.dev/video/ab4ac4684· Qwen-Audio-3.0-Realtime 如何让语音交互「懂倾听,更聪明」?:https://www.bestblogs.dev/article/ff35a34b98· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻:https://www.bestblogs.dev/article/889606386f· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现:https://www.bestblogs.dev/status/2076789349145092230· 10000 小时人类数据,练出全球首个全身移动操作隐式世界动作模型:https://www.bestblogs.dev/article/f690c843a9· Khan Academy CEO Sal Khan:AI 真正的机会藏在被忽视的传统行业 [视频]:https://www.bestblogs.dev/video/8a389c3a2· 探索用于 Meta 广告深层漏斗优化的分层兴趣表示:https://www.bestblogs.dev/article/d2131452af· 三秒盗窃:为什么 AI 语音欺诈能够超越所有防御:https://www.bestblogs.dev/article/13e2028c32· 让 Agent 成为音视频工作台:AI MediaKit CLI + Skill 发布:https://www.bestblogs.dev/article/e7b35eef63· 不要让 Claude 给自己的作业打分:https://www.bestblogs.dev/article/d95341e3df· 阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟:https://www.bestblogs.dev/article/257eda6403· AI 编码实战 | 0 行手写代码,2 天重构 2 万行 Vue 项目:https://www.bestblogs.dev/article/ba784def91关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。前往小宇宙评论区与主播互动
Embed this episode
Ready to play
EP119 · AINMM 五级成熟度模型、田渊栋论人类判断力、Ai2 Shippy 智能体构建 · 07-16 早报
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.