Embodied AI 101 cover art

All Episodes

Embodied AI 101 — 230 episodes

#
Title
1

Imagining Locomotion: Learning a Neural World Model for Legged Robots

2

One Model to See, Plan, and Act: Introducing EO-1 for Embodied AI

3

Video-Action Models for Robot Learning

4

FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control

5

A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation

6

DexNDM: Closing the Reality Gap for Dexterous In-Hand Rotation

7

Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation

8

ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning

9

Let the Body Follow: Coupled Egocentric Control for Whole-Body Robot Teleoperation

10

GigaWorld-Policy-0.5: An Efficient Mixture-of-Transformers Policy for Real-Time Robot Control

11

Xiaomi-Robotics-1: A Scalable Vision-Language-Action Foundation Model for Mobile Manipulation

12

Local Policies Enable Zero-shot Long-Horizon Manipulation

13

Sim-to-Real Reinforcement Learning for Vision-Based Dexterous Manipulation on Humanoids

14

UniTracker: A Universal Motion Tracking Framework for Humanoid Robots

15

ViTacFormer: Dexterous Manipulation via Active Vision and High-Resolution Touch Sensing

16

Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language

17

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

18

RoboTTT: End-to-End Robotic Assembly with Test-Time Training

19

Xiaomi-Robotics-U0: A 38B World-Foundation Model for Unified Embodied Perception and Synthesis

20

SpatialPoint: Spatial-Aware Point Prediction for Embodied Localization

21

Multi-AUV Scene-Adaptive Embodied Intelligence for Multi-Target Tracking

22

Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation

23

R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation

24

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

25

SKooP: Symmetric Koopman Predictions for Legged Robot Reinforcement Learning

26

RobotTT: A Tactile Transformer for Dexterous Manipulation

27

TAC-LOCO: Unified Whole-Body Control for Contact-Aware Locomotion and Manipulation

28

TACTIC: Contact-Centric Control for Whole-Arm Manipulation

29

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLAs

30

DexMachina: RL for Long-Horizon Bimanual Dexterous Policies

31

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

32

RoboTTT: Test-Time Training for Visuomotor Policies

33

HY-Embodied-VLM-1.0: Efficient Physical-World Agents

34

Learning Unified Force and Position Control for Legged Loco-Manipulation

35

HapticVLA: Extending Vision-Language-Action Models to Contact-Rich Tasks Without Touch Sensors

36

AnoleVLA: Lightweight VLA with Deep State Space Models for Mobile Manipulation

37

ABot-N1: Visual Language Navigation Foundation Model

38

ABot-AgentOS: A General-Purpose Robotic Agent Operating System

39

Trust Region Policy Distillation (TOP-D)

40

HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

41

EVA-Client: A Unified Framework for Real-Robot Policy Iteration

42

UniVR-34B: A Vision-Only Foundation Model for Physical Tasks

43

CLAP: Converting Vision-Language Models into Vision-Language-Action Models via Language-Prompted Actions

44

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action

45

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

46

On-Device Diffusion Transformer Policy for Efficient Robot Manipulation

47

Robotic World Model: Neural Dynamics for Locomotion

48

LingBot-Vision: Self-Supervised ViT with Masked Boundary Modeling

49

LaMem-VLA: Latent-Memory-Native VLA Framework

50

LingBot-VA 2.0: Native Video-Action Foundation Model for Robot Control

51

GigaWorld-1: Large-Scale World Model for Robot Policy Evaluation

52

Learning Unified Force and Position Control for Legged Loco-Manipulation

53

Robix: Unified Vision-Language Model for Robotic Reasoning and Planning

54

EmbodiedOneVision (EO-1): A Unified Decoder-Only Transformer for General Robot Control

55

mimic-video: Video-Action Models for Robot Learning

56

Lowering the Barrier: The GEM Open-Source Arm

57

RynnWorld-4D: A 4D Embodied World Model for Bimanual Robot Control

58

RynnWorld-Teleop: Digital Teleoperation via World Model Rendering

59

VLA-Corrector: Adaptive Action Horizons through Latent Visual Monitoring

60

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization

61

Current as Touch: Proprioceptive Contact Feedback for Compliant Dexterous Manipulation

62

DART: One-Shot VLA Policy Adaptation via Weight-Space Arithmetic

63

Does VLA Even Know the Basics? Act2Answer Benchmark

64

Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding

65

Freeform Preference Learning (FPL) for Robotic Manipulation

66

Orca: The World is in Your Mind

67

Qwen-RobotNav: A Scalable Unified Navigation Model for Agentic Robotics

68

Scaling Robot Skills from Cheap Human Videos

69

ABC: An Open Behavior Cloning Stack for Bimanual Manipulation

70

Qwen-RobotManip: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

71

ASPIRE: Automated Skill Discovery for Robotics

72

SERF: 4D Latent Mapping for Long-Horizon Mobile Manipulation

73

ViserDex: Visual Sim-to-Real for Robust Dexterous In-Hand Reorientation

74

DexSkin: A High-Coverage, Conformable "Electronic Skin" for Robot Fingers

75

EBench: A Diagnostic Benchmark for Generalist Manipulation Policies

76

VITRA: A Foundation for Dexterous VLA via Human Video Pretraining

77

DexWM: A Dexterous Manipulation World Model from Human Videos

78

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

79

Continual Robot Policy Learning via Variational Neural Dynamics

80

PhysisForcing: Physics-Reinforced World Models for Robotic Manipulation

81

Translation as a Bridging Action

82

Play2Perfect: Dexterous Play Pretraining for Precise Assembly

83

Dexora: Open-Source VLA for High-DoF Bimanual Dexterity

84

WorldVLA: Towards Autoregressive Action World Model

85

HumDex: Humanoid Dexterous Manipulation Made Easy

86

ForceBand: Learning Forceful Manipulation with sEMG

87

In-Context World Modeling for Robotic Control

88

WOLF-VLA: Vision-Language-Action for Humanoid Walking

89

Motion-Focused Latent Action for Cross-Embodiment VLA from Human Videos

90

ManiFlow: Manipulation via Rectified Flow

91

RL-100: Toward Highly Reliable Real-World Robot Reinforcement Learning

92

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

93

Bi-HIL: Bilateral Control-Based Multimodal Hierarchical Imitation Learning for Long-Horizon Contact-Rich Manipulation

94

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

95

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

96

ConstrainedMimic: Safe Humanoid Robot Motion Tracking

97

REAL: Robust Extreme Agility via Spatio-Temporal Policy Learning and Physics-Guided Filtering

98

HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching

99

Reactive Diffusion Policy: Slow-Fast Visual-Tactile Learning for Contact-Rich Manipulation

100

SARM2 + SPIRAL: Multi-Task Reward Models and RL Refinement for Long-Horizon Dexterous Manipulation

101

Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm VLA Systems

102

ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

103

Playful Agentic Robot Learning

104

Learning Unified Force and Position Control for Legged Loco-Manipulation

105

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies

106

AstraBrain-WBC 0.5: A Humanoid Robot Cerebellum Foundation Model

107

SRL: Combining SLIP Model and Reinforcement Learning for Agile Robotic Jumping

108

DataClaw0: Agentic Tailoring for Raw Multimodal Streams

109

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

110

VERA: Video-to-Action World Model Policy

111

GEN-1: Scaled Dexterous Manipulation Foundation Model

112

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

113

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

114

VisualClaw: A Self-Evolving Wearable Vision Agent

115

Kairos: A Native World Model Stack for Physical AI

116

DragMesh-2: A Contact-Driven Framework for Dexterous Hand–Object Interaction

117

Guava: A Universal Harness for Robot Manipulation

118

Geometric Action Model for Robot Policies

119

ENPIRE: Physical AutoResearch with a Fleet of 8 Robots

120

MolmoAct2: An Open Foundation Model for Real-World Robotics

121

Hy-Embodied-0.5-VLA: A Massive Bimanual Teleoperation Dataset for Vision-Language-Action

122

Q-Guided Flow: Test-Time Gradient Guidance of Flow Policies

123

Flow Reversal Steering: Guiding Diffusion-Based Robot Policies with High-Level Reasoning

124

Test-Time Compute Scaling for Robot Policies (DIRECT)

125

LabVLA: Bringing Vision-Language-Action to the Chemistry Lab

126

Humanoid-GPT: A Foundation Model for Zero-Shot Humanoid Control

127

CHORUS: Decentralized Multi-Robot Collaboration with a Single Shared VLA Model

128

RISE: Self-Improving Robot Policy with Compositional World Model

129

EmbodiedOneVision: Interleaved Vision-Text-Action Pretraining for General Robot Control

130

Robix: A Unified Model for Robot Interaction, Reasoning and Planning

131

Robotic World Model: Learning to Simulate for Robust Robot Control

132

AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization

133

ArtiFixer: Few-Step Diffusion for 3D Scene Reconstruction

134

Deployment-Time Memorization in Foundation-Model Agents

135

Adversarial Machine Learning: Taxonomy, Threat Models, and Mitigation Strategies in Deep Neural Networks

136

SoCRATES: Evaluating LLM Mediators in Conflict Scenarios

137

Unembedding Matrix as a Feature Lens: Unlocking Better Text Embeddings

138

LeanMarathon: Autonomous Formalization of Math Proofs on Erdős Problems

139

Deep Research Agents: Survey and Roadmap for Autonomous AI Research

140

Cosmos 3: Omnimodal World Models for Physical AI

141

Humanoid-GPT: GPT-Style Transformer for Zero-Shot Dynamic Humanoid Control

142

Bending Paper, Shaping Dexterity: The Robotic Origami Challenge

143

GraspGen-X: A Foundation Model for Zero-Shot 6-DoF Grasping

144

When Does Deep RL Beat Calibrated Baselines?

145

Training Deep Networks as Random Effects: An Optimization–Inference Duality

146

Generative Depth Supervision for Embodied Vision-Language Models

147

PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

148

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

149

LT2: Linear-Time Looped Transformers

150

One Learning Rate Doesn't Fit All: Layerwise Spectral Scheduling for Transformers

151

SimToolReal: Procedural Tool Generation and a Universal Objective for Zero-Shot Tool Manipulation

152

Robometer and the Future of Robotic Reward Modeling

153

Qwen-VLA: A Generalist Vision–Language–Action Robot Model

154

EXPO-FT: Sample-Efficient Reinforcement Learning Fine-Tuning for Vision-Language-Action Models

155

RoboMeter: Learning Dense Rewards from Successes and Failures

156

MobileGym: A Controllable, Parallel Sandbox for Mobile GUI Agents

157

ANY2ANY: Efficient Cross-Embodiment Transfer for Humanoid Whole-Body Tracking

158

TriSplat: Feed-Forward 3D Reconstruction with Triangulated Meshes

159

MIKASA-Robo-VLA: A Memory-Intensive Benchmark for Vision-Language-Action Robotics

160

PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

161

Bimanual Pegboard Manipulation: A Benchmark for Vision-Language-Action Models

162

FutureSim: Replaying Real-World Events to Evaluate AI Forecasting Agents

163

AgentFloor: A Benchmark for Long-Horizon Agent Planning

164

AlexNet: The Deep Convolutional Network That Transformed Vision

165

A Few Useful Things to Know About Machine Learning

166

SimToolReal: A Universal Dexterous Tool-Use Policy

167

Mimic-Video: Learning Physics Priors from Web-Scale Video for Robot Dexterity

168

Deep Residual Learning for Image Recognition (ResNet)

169

Attention Is All You Need – The Transformer Revolution

170

NVIDIA Cosmos: World Foundation Models for Physical AI

171

LATENT: Teaching a Humanoid to Play Tennis from Imperfect Data

172

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

173

World Action Models: The Next Frontier in Embodied AI

174

Training a Whole-Body Control Foundation Model

175

DexJoCo: A Unified Benchmark for Task-Oriented Dexterous Manipulation

176

MMSkills: Building Multimodal Skill Libraries for Visual Agents

177

PhysBrain 1.0 VLA (TwinBrainVLA): Dual-Brain Vision-Language-Action with Physics-Grounded Learning

178

MolmoAct2-LIBERO: An Open Vision-Language-Action Model for Robotics

179

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Diffusion Transformers

180

WildClawBench: A Real-World, Long-Horizon Benchmark for AI Agents

181

MCP-Cosmos: Bring Your Own World Model

182

OpenAI o1: Teaching LLMs to Think Slow and Deep

183

The Llama 3 Herd of Models

184

LATENT: Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data

185

AnyFlow: Any-Step Video Diffusion for Predictive World Modeling

186

# Robotics: The Endgame

187

Claw-Eval: Toward Trustworthy and Transparent Evaluation of Autonomous Agents

188

LIBERO-Para: Paraphrase Robustness in Robotic Manipulation

189

YOR: Your Own Mobile Manipulator for Generalizable Robotics

190

EgoSim: Egocentric World Simulator for Embodied Interaction Generation

191

Accelerating Video World Models: From Generative Videos to Real-Time Simulators

192

From Tokens to Thoughts: Continuous Latent Reasoning in Large Models and Robot Control

193

CaP-X: Coding Agents for Physical eXecution

194

DoRA: Weight-Decomposed Low-Rank Adaptation

195

AI Model Collapse: What Happens When AI Trains on Its Own Outputs

196

PhAIL: Benchmarking Vision-Language-Action Models on Real-World Bin-Picking

197

Co-training Large Behavior Models: Data Modalities and Training Strategies for Robot Manipulation

198

HyDRA: Hybrid Memory for Dynamic Video World Models

199

# WildWorld: Dynamic World Modeling with Actions and Explicit State

200

Omni-WorldBench: Evaluating Interactive 4D World Models

201

SIMART: From Static Meshes to Sim-Ready Articulated Models

202

EgoSim: An Egocentric World Simulator for Embodied Interaction

203

Digit's New Motor Cortex: Sim-to-Real RL for Whole-Body Control

204

EgoNav: Diffusion-Based Humanoid Navigation from Human Egocentric Video

205

CaP-X: A Code-as-Policy Framework for Robot Manipulation

206

Embodied Intelligence Breakthrough: Generalist AI’s GEN-1 Robots

207

CaP-X: LMs' First Physical Exam

208

AI Model Collapse: The Danger of Training on AI-Generated Data

209

High-Level Automated Reasoning with Qwen2.5-7B

210

Co-Training Large Behavior Models: Multimodal Data for Robot Manipulation

211

HyDRA: Hybrid Memory for Dynamic Video World Models

212

DexWM: Leveraging Human Videos for Dexterous Robot World Models

213

World Models in Robotics

214

SIMART: Decomposing Monolithic Meshes into Sim-Ready Articulated Assets

215

LeWorldModel: A Stable JEPA World Model from Pixels

216

World Models for Robots: The Next Big Leap?

217

Harnessing Long-Running AI in Embodied Systems

218

HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

219

TurboQuant: Redefining AI Efficiency with Extreme Compression

220

DexWM: Learning Dexterous Object Manipulation from Human Videos

221

FlashAttention-3: Fast & Accurate Attention with Asynchrony & Low-Precision

222

When AI Trains on Its Own Output: The Model Collapse Problem

223

MolmoBot: A Vision-Language Model for Zero-Shot Robot Manipulation

224

LeWorldModel: Stable End-to-End JEPA from Pixels

225

EgoVerse: An Egocentric Data Ecosystem for Scaling Robot Learning

226

HSImul3R: Physics-Driven Reconstruction of Human–Scene Interactions

227

MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation

228

DreamZero: World Action Models Are Zero-Shot Policies

229

Kinema4D: A 4D Generative Simulator for Embodied AI

230

VEGA-3D: Teaching multimodal LLMs spatial reasoning through video generation