-
4
具身创业90天成独角兽,凭什么?丨量子位 x 郎咸朋
【本期嘉宾】郎咸朋,昆仑行机器人联合创始人兼CTO。李根,量子位联合创始人、总编辑。【本期节目介绍】“具身百机大战也会跑出蔚小理。”离开理想、创办昆仑行后,郎咸朋第一次公开露面。近1.5小时里,他完整讲述了自己从百度、理想一路走到具身智能创业的技术选择和判断思考。为什么说自动驾驶不是终点,而只是具身智能的起点?为什么机器人真正需要的是“理解”,而非“模仿”?从VLA到世界模型,技术路线为什么还在不断变化?2026年创业,为什么还要坚持软硬件全栈自研?以及那些更现实的问题:为什么光靠融资活不下去、最后拼的是“自我造血”能力?机器人进家庭还要几年?关于昆仑行Day one的思考与野心,都在这一期里。【内容提要】00:02:15 早在Scaling Law流行前,他就笃信“数据决定论”:85%的准确率,为什么还是不能用?00:08:57 从理想出走那天,自动驾驶已经不再是终点——VLA做完才发现,它天生是为具身准备的00:13:57 行不行、合不合、久不久:怎么挑联合创始人,为什么“合适比熟悉更重要”00:17:56 出发永远比想清楚更关键:注册公司之前,只有三件事必须想透00:28:05 都2026年了,为什么还坚持软硬全栈自研?攒出一台机器人,离量产还差得远00:38:28 “理解”世界,还是“模仿”动作?被讲窄了的四种具身智能00:48:48 数据编译、一脑多形,和一杯水:怎么考出机器人是真懂,还是死记硬背01:00:51 现在的具身,就像十年前的自动驾驶:百机大战打完,也会跑出自己的“蔚小理”01:12:31 轮式铺量、出货更快,那为什么昆仑行偏要死磕全人形?四个能力,第一天就得一起练01:19:59 几亿甚至十亿都不够:光靠融资,谁也撑不到具身落地那天01:27:55 留给未来同事的一句话:对物理AGI要有信仰——节目中提到的概念——VLA(视觉-语言-动作模型)把“看到的画面、听到的指令、要做的动作”打通在一个模型里的架构,最早用在自动驾驶。郎咸朋认为它天生就是为具身智能准备的,自动驾驶只是它的第一个应用。世界模型(World Model)让AI在“脑子里”建立起对物理世界如何运转的理解,从而能预判“做了这个动作会发生什么”。郎咸朋认为,一个完整的世界模型不仅要能预测或生成未来状态,还应具备动作生成、结果预测和场景渲染等能力。模仿学习 vs 物理因果(理解)模仿学习是让机器人照着人类示范“学样子”;物理因果更强调理解动作为什么会产生某种结果,例如重力、摩擦力、受力关系等物理规律,这样遇到没见过的新场景也能应对。数据编译昆仑行提出的数据处理思路。不直接拿原始数据训练,而是先把场景里物体的物理量、物理规律显式算出来,“编译”进训练样本,让每条数据天然带着物理因果,以此提高数据的“信息密度”和使用效率。一脑多形指同一个“机器人智能大脑”能够适配不同形态、不同本体的机器人。昆仑行认为,如果模型真正学习的是底层物理规律,而不是某一种机器人的动作分布,就天然更有可能实现“一脑多形”。影子模式自动驾驶中的一种数据获取方式:系统可以在车辆正常运行过程中持续采集真实驾驶数据,而不一定直接控制车辆。对话中以此对比具身机器人,说明机器人很难像汽车一样低成本、大规模获得真实任务数据。MoT架构 / 联合因果注意力机制MoT是把大模型拆成多个“专家”分工的架构。多数团队按“文本、视频、动作”这种模态来分,昆仑行则按“目的、动作、结果”这条因果链来分,并让注意力单向流动——做动作时不能“偷看”结果,以贴合物理因果。运控/移动/交互/操作四种智能郎咸朋把具身智能拆成四块:运控(跳舞、平衡)、移动(自主导航,近似自动驾驶)、交互(语言对话)、操作(动手干活)。他认为业内常把“具身智能”狭隘地等同于“操作智能”,其实前三者也很关键。
-
3
干了11年漫画,安妮说AI来了要“杀死过去的自己”丨量子位 x 陈安妮
【本期嘉宾】陈安妮,快看漫画创始人兼CEO。李根,量子位联合创始人、总编辑。【本期节目介绍】快看漫画安妮:AI时代,越成功越是包袱!“你一定要杀死过去的那个自己。”本期节目量子位会客厅邀请到了快看漫画创始人兼CEO陈安妮,聊了聊内容创业标杆公司在AI时代的选择:为什么说AI等于电的发明,而快看要做AI时代的第一部“电影”?全新产品Livo和漫画看似毫无关系,它不是Chatbot,而是AI版「西部世界」——关掉APP角色也活着,会拒绝你、会生气、会离开,这背后的“数字生命”到底是什么?为什么她认为AI不会让创作者失业,反而是天才作者的放大器?除了这些,安妮还首次分享了她用训练大模型的方式管理团队的“群体智能”实验,以及那句她反复讲的话:字典里没有失败,只有还没成功。【内容提要】00:02:07 陈安妮与快看:那些标签在AI时代未必是加分项00:04:06 Livo是AI版《西部世界》00:06:52 AI等于电的发明:电影替代舞台剧的故事,正在重演00:14:47 越成功越是包袱?“你一定要杀死过去的那个自己”00:23:08 为什么不等技术成熟再入场?现在做Livo的四个理由00:29:08 Agent工程大家是平权的:技术不是最大门槛,AI native的组织才是00:39:12 数字生命的四个条件:真实活着、有主体性、有自己的世界、会进化00:50:41 字典里没有“失败”二字:公司没破产之前,谁说你结束了?00:52:53 什么样的人适合AI时代的快看?极有想象力+很高的追求,以及一个记得你MBTI的老板00:56:55 用训练大模型的方式管公司:梯度加权、yes and hope,与“群体智能”01:17:12 马夫没有失业,只是变成了司机——AI是天才作者的放大器01:25:47 初心是起点也是终点:AI是一面镜子,照见用它的人心里想什么——节目中提到的概念——Livo快看孵化的AI原生产品,与漫画业务无直接延续关系。核心是“让故事里的角色活起来”,强调故事性而非闲聊,可类比为AI版《西部世界》。目前处于内测阶段。《西部世界》(Westworld)美剧,设定为一个由高度拟真机器人“接待员”构成的主题乐园,游客可进入其中与角色互动、推动剧情。该节目中被用来类比Livo想实现的讲故事形态。数字生命快看对AI时代讲故事新范式的命名。需同时满足四个条件:角色真实“活着”(用户下线后仍在自己的世界中)、有主体性(会拒绝、会生气、有边界)、背后有完整运转的虚拟世界观、会进化。Agent工程不涉及底层大模型研发,在应用层搭建智能体系统的工程工作。安妮的判断是:这件事上“大家是平权的”,纯技术壁垒不高,难的是与C端内容产品的巧妙结合。群体智能(Swarm Intelligence)原为AI领域概念,指多Agent协作胜过单一强Agent。安妮将其迁移为一种管理方法:CEO不做独裁决策,让全员脑暴、信息像毛细血管一样汇入,自己只做方向微调。梯度加权/梯度减弱借自大模型训练的术语,指调节参数更新的强弱。在快看内部被用作脑暴机制:CEO不直接拍板,只对讨论方向做“加权”或“减弱”。yes and hope快看内部的创意反馈机制。对每个想法先说yes(对的地方),再说hope(希望改进的方向),全部记录在白板上,成为下一版产品迭代的“数据集”。Harness英文原意为“缰绳”,AI行业热词,指人驾驭AI系统的工具和框架。安妮用“马夫转行成司机,缰绳变成方向盘”来比喻创作者与AI的关系。MVP(Minimum Viable Product)最小可行产品。指先做出跑通核心逻辑的简化版本,再逐步迭代。当前的Livo即被定义为快看漫画数字生命体系的MVP。
-
2
宅男科学家挑战世界模型无人区丨量子位 x 陆弘远
【本期嘉宾】陆弘远,脸谱心智创始人。李根,量子位联合创始人、总编辑。【本期节目介绍】FaceMind创始人陆弘远:一个宅男科学家的世界模型野心——1B参数凭什么叫板百B?从高中卖游戏王卡给喜欢的女生买钻戒,到帝国理工、微软亚洲研究院、港中文PhD,再到All in创业,陆弘远走了一条非典型AI创业之路。本期节目量子位和这位直言“我并不是一个商人”的年轻创始人聊了聊:FaceMind的Looped World Model(循环世界模型)到底新在哪?为什么敢说1B参数媲美百B效果,技术底气从何而来?被Best Paper加持的Adam's Law,从大语言模型到世界模型,为什么能一路通用?“叠叠社”从AI男友女友到弹幕式陪伴,中间经历了怎样的产品妥协?潜空间推理和像素渲染怎么选?世界模型能不能实现“零延迟的主动式AI”?还有一个让人意外的细节:陆弘远的博导决定来FaceMind当他的联创了。【内容提要】00:00:54 陆弘远与FaceMind:一家想让人类“延存”的公司,从哪里起步?00:05:08 具身×叠叠社双线落地:从AI男友女友到弹幕陪伴,中间经历了什么?00:11:43 世界模型解决的核心问题:为什么说数据缺失才是关键?00:16:23 Looped World Model:1B参数媲美百B效果,技术底气从哪来?00:23:22 Adam's Law诞生记:洗澡时的灵感,100种语言验证,为什么能跨赛道通用?00:31:50 世界模型怎么定义?潜空间vs像素渲染怎么选?00:45:02 零延迟的主动式AI:世界模型能不能预判你的下一个问题?00:54:15 宅男科学家创业路:帝国理工、微软亚研院、高中卖游戏王卡买钻戒01:07:57 博导要来当联创:林伟老师从“没有考虑过加入公司”到改变主意01:26:33 融资、竞争与牌桌:世界模型赛道的飞轮怎么转起来?——节目中提到的概念——GUI Agent让AI像人一样看屏幕、点鼠标、操作软件的智能体。FaceMind的“叠叠社”产品属于这一方向。潜空间(Latent Space) AI内部进行推理的高维空间。通俗理解:人在说出一句话之前,大脑里有无数模糊的念头在酝酿——这个酝酿过程就类似在潜空间中推理,最终才输出一个确定的结果。与之相对的是“像素渲染”,即每一步都生成可见的画面。Looped World Model(循环世界模型) FaceMind提出的模型架构。核心思路是用同一套参数反复迭代,根据任务难度自动决定迭代次数,而非像传统模型那样固定堆叠100层。好处是参数更省、数据需求更少、优化更快。Adam's Law 陆弘远提出的关于AI模型中低频数据问题的规律。核心发现:训练数据中出现次数少的词(如生僻人名“马嘉祺”),模型就容易出错。解决思路包括在训练时补充低频数据、在推理时善用高频同义词替换。该规律在100种语言上验证有效。back-propagation(反向传播) 训练AI模型的核心算法。模型做出预测后,通过计算误差并逐层回传来调整参数。模型层数越深,误差越难有效回传——这正是循环世界模型试图解决的问题之一。
-
1
魔法原子:具身大战里做钉子派 | 量子位 x 张涛
【本期嘉宾】张涛,魔法原子具身模型负责人、算法VP。李根,量子位联合创始人、总编辑。【本期节目介绍】魔法原子:具身大战里做钉子派!“不是拿着锤子找钉子,而是场景里已经有很多钉子,技术要不断把锤子打磨得更好。”本期节目我们邀请到了魔法原子具身模型负责人、算法VP,张涛,聊了聊具身行业里最核心的技术问题:具身的大脑和小脑分别指的是什么?VLA和世界模型两条路线有什么不同,又该怎么选?数据金字塔尖上的机器人“错题集”,又是怎么用失败数据逼近99.9%成功?除了我们看到的魔法原子在上交会现场展示出的大脑能力,以及公开发布的Magic-VLA和Magic-Mix WM等架构,在我们看不到的地方魔法原子又做了哪些努力?除了这些硬核回答,张涛博士也爆料很多人关心的魔法原子的招聘条件。【内容提要】00:02:00 张涛与魔法原子00:09:17 具身大脑到底是什么?具身小脑又是什么?00:18:37 VLA or 世界模型? 是什么?怎么选?00:33:23 具身智能的“L0-L5”,又怎么落地?00:40:46 魔法原子的人才&团队:大模型sense靠小登,多元物理世界靠中登,那老登?00:44:00 数据金字塔尖尖是机器人的"错题集”,用失败数据逼近99.9%成功00:50:11 魔法原子冰山之下的数据飞轮00:56:55 在学术界和工业界,具身如何进化?01:05:52 行业洗牌,具身GPT时刻什么时候到来?——节目中提到的具身智能相关的概念——1.LLM到VLA的模态叠加示意图2.Magic-VLA架构图3.Magic-Mix架构图4.数据金字塔示意图5.魔法原子的冰山理论示意图
We're indexing this podcast's transcripts for the first time — this can take a minute or two. We'll show results as soon as they're ready.
No matches for "" in this podcast's transcripts.
No topics indexed yet for this podcast.
Loading reviews...
ABOUT THIS SHOW
欢迎来到量子位会客厅~一起追踪人工智能新趋势,关注科技行业新突破。
HOSTED BY
量子位
CATEGORIES
Loading similar podcasts...