Daily Paper Cast cover art

All Episodes

Daily Paper Cast — 1000 episodes

#
Title
1

StudentSim: Training LLM-based Student Simulators

2

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

3

UI-Venus-2 Technical Report

4

Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

5

ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

6

H3-World: Turning Language Understanding into World Control

7

Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering

8

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

9

GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling

10

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

11

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

12

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

13

Normalized Low-Rank Adaptation

14

CogEvol: Towards Efficient and Reliable Learning Environment Generation

15

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

16

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

17

TTPO: Test-Time Policy Optimization

18

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

19

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

20

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

21

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

22

GameWAM: A World Action Model for Video Games

23

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

24

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

25

FrontierChallenge: Evaluating Scientific Workflow Completion

26

VGI-Bench: Probing Visual Intelligence in Video Generation Models

27

WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

28

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

29

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

30

Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

31

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

32

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

33

Agentic Transaction: Towards ACID-Compliant Agent Systems

34

Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

35

Self-Supervised Visual On-Policy Distillation

36

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

37

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

38

Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

39

Marionette: Predicting World States, Rendering Geometry, Painting Appearance

40

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

41

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

42

DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

43

DarwinX: Evolving Agent Harnesses Through Natural Selection

44

Intern-S2-Preview: Scientific Agentic Foundation Model

45

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

46

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

47

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

48

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

49

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

50

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

51

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

52

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

53

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

54

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

55

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

56

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

57

Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

58

Beyond Pixels: From Video Priors to 4D Worlds

59

Articulated Object Reconstruction from Rest-State Observation

60

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

61

Mendel G\"odel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

62

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

63

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

64

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

65

On-Policy Self-Distillation without Any Supervision

66

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

67

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

68

Motif 3: Technical Report

69

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

70

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

71

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

72

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

73

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

74

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

75

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

76

Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval

77

WorldClaw: Agentic 3D Open-World Generation at Scale

78

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

79

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

80

ChronoVision: Temporal Reasoning via Latent State Reconstruction

81

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

82

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

83

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

84

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

85

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

86

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

87

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

88

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

89

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

90

Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation

91

PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

92

Quo Vadis, World Modeling?

93

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

94

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

95

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

96

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

97

DAPD: Dual-Anchored Policy Distillation

98

Progressive Agent Skill Generation via Reinforcement Learning

99

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

100

UEmbed: Unified Sparse and Dense Multimodal Embeddings

101

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

102

CADENA: Stepwise CAD Reverse Engineering

103

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

104

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

105

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

106

Mental World Modeling

107

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

108

Meshy T2: Fast Native Mesh Generation with Flow Matching

109

Weak-to-Strong On-Policy Distillation

110

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

111

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

112

Scaling Properties of Text Conditioning in Visual Generation

113

QQWorld: Quantile-Quantile Matching for World Model Regularization

114

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

115

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

116

Metis: Memory Foundation Model

117

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

118

PhiZero: A World Model Built Around Physical Language

119

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

120

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

121

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

122

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

123

Flux-OPD: On-Policy Distillation with Evolving Contexts

124

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

125

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

126

HumanCLAW: Can Vision-Language Models Act Through a Body?

127

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

128

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

129

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

130

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

131

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

132

CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

133

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

134

Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

135

Pass the Baton: Trajectory-Relayed On-Policy Distillation

136

Kimi K3: Open Frontier Intelligence

137

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

138

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

139

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

140

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

141

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

142

Data Pyramid for Embodied Manipulation

143

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

144

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

145

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

146

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

147

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

148

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

149

AREX: Towards a Recursively Self-Improving Agent for Deep Research

150

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

151

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

152

Visual Contrastive Self-Distillation

153

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

154

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

155

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

156

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

157

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

158

Generative World Renderer at the Speed of Play

159

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

160

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

161

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

162

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

163

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

164

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

165

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

166

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

167

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

168

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

169

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

170

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

171

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

172

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

173

Loop the Loopies!

174

xHC: Expanded Hyper-Connections

175

Cura 1T: Specialized Model for Agentic Healthcare

176

On-Policy Delta Distillation

177

RecGPT-V3 Technical Report

178

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

179

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

180

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

181

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

182

BadWAM: When World-Action Models Dream Right but Act Wrong

183

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

184

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

185

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

186

From Pixels to States: Rethinking Interactive World Models as Game Engines

187

UniVR: Thinking in Visual Space for Unified Visual Reasoning

188

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

189

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

190

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

191

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

192

OvisOCR2 Technical Report

193

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

194

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

195

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

196

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

197

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

198

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

199

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

200

Weak-to-Strong Generalization via Direct On-Policy Distillation

201

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

202

4D Human-Scene Reconstruction from Low-Overlap Captures

203

LightMem-Ego: Your AI Memory for Everyday Life

204

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

205

Scalable Visual Pretraining for Language Intelligence

206

Video Generation Models are General-Purpose Vision Learners

207

Vidu S1: A Real-Time Interactive Video Generation Model

208

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

209

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

210

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

211

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

212

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

213

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

214

Infinite Worlds with Versatile Interactions

215

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

216

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

217

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

218

Vision as Unified Multimodal Generation

219

Gemma 4 Technical Report

220

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

221

UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

222

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

223

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

224

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

225

MANCE: Manifold Aware Concept Erasure

226

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

227

Wan-Streamer v0.2: Higher Resolution, Same Latency

228

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

229

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

230

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

231

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

232

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

233

DataComp-VLM: Improved Open Datasets for Vision-Language Models

234

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

235

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

236

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

237

Morphing into Hybrid Attention Models

238

AgenticDataBench: A Comprehensive Benchmark for Data Agents

239

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

240

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

241

Orca: The World is in Your Mind

242

Dockerless: Environment-Free Program Verifier for Coding Agents

243

DOPD: Dual On-policy Distillation

244

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

245

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

246

GEAR: Guided End-to-End AutoRegression for Image Synthesis

247

Multi-Block Diffusion Language Models

248

Agentic Abstention: Do Agents Know When to Stop Instead of Act?

249

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

250

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

251

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

252

Beyond IID: How General Are Tabular Foundation Models, Really?

253

Trimming the Long-Tail of Visual World Modeling Evaluation

254

AsyncOPD: How Stale Can On-Policy Distillation Be?

255

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

256

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

257

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

258

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

259

Qwen-Image-2.0-RL Technical Report

260

DanceOPD: On-Policy Generative Field Distillation

261

In-Context World Modeling for Robotic Control

262

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

263

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

264

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

265

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

266

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

267

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

268

Fast LeWorldModel

269

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

270

MiniMax Sparse Attention

271

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

272

InterleaveThinker: Reinforcing Agentic Interleaved Generation

273

FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents

274

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

275

MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling

276

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

277

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

278

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

279

ABot-Earth 0.5: Generative 3D Earth Model

280

Kwai Keye-VL-2.0 Technical Report

281

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

282

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference

283

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research

284

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

285

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

286

SCAIL-2: Unifying Controlled Character Animation with End-to-end In-Context Conditioning

287

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

288

Agents' Last Exam

289

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

290

On the Geometry of On-Policy Distillation

291

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

292

Latent Spatial Memory for Video World Models

293

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

294

CoVEBench: Can Video Editing Models Handle Complex Instructions?

295

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

296

Human Psychometric Questionnaires Mischaracterize LLM Behavior

297

Echo-Memory: A Controlled Study of Memory in Action World Models

298

From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain

299

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

300

Trust Region On-Policy Distillation

301

KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks

302

COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation

303

Representation Forcing for Bottleneck-Free Unified Multimodal Models

304

Mellum2 Technical Report

305

Function2Scene: 3D Indoor Scene Layout from Functional Specifications

306

GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

307

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

308

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation

309

Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?

310

DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

311

$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

312

Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps

313

ACC: Compiling Agent Trajectories for Long-Context Training

314

PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects

315

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

316

Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning

317

WorldKV: Efficient World Memory with World Retrieval and Compression

318

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

319

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

320

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

321

IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

322

When Vision Speaks for Sound

323

Active Learners as Efficient PRP Rerankers

324

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

325

AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration

326

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

327

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

328

Process Rewards with Learned Reliability

329

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

330

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

331

Harnessing LLM Agents with Skill Programs

332

Code as Agent Harness

333

SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution

334

LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

335

Lance: Unified Multimodal Modeling by Multi-Task Synergy

336

AI for Auto-Research: Roadmap & User Guide

337

CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?

338

KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration

339

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

340

PhysBrain 1.0 Technical Report

341

MMSkills: Towards Multimodal Skills for General Visual Agents

342

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

343

Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding

344

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation

345

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

346

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

347

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

348

Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

349

Self-Distilled Agentic Reinforcement Learning

350

MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

351

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

352

MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

353

Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning

354

Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems

355

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

356

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

357

MinT: Managed Infrastructure for Training and Serving Millions of LLMs

358

MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image

359

AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation

360

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

361

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

362

Predicting Decisions of AI Agents from Limited Interaction through Text-Tabular Modeling

363

Qwen-Image-VAE-2.0 Technical Report

364

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

365

Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling

366

Many-Shot CoT-ICL: Making In-Context Learning Truly Learn

367

MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents

368

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

369

$δ$-mem: Efficient Online Memory for Large Language Models

370

RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

371

Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics

372

World Action Models: The Next Frontier in Embodied AI

373

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

374

Efficient Pre-Training with Token Superposition

375

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

376

MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments

377

Qwen-Image-2.0 Technical Report

378

Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs

379

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

380

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

381

PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

382

Model Merging Scaling Laws in Large Language Models

383

SEIF: Self-Evolving Reinforcement Learning for Instruction Following

384

WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

385

Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models

386

Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

387

Flow-OPD: On-Policy Distillation for Flow Matching Models

388

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

389

Anisotropic Modality Align

390

Beyond Retrieval: A Multitask Benchmark and Model for Code Search

391

MiA-Signature: Approximating Global Activation for Long-Context Understanding

392

When to Trust Imagination: Adaptive Action Execution for World Action Models

393

Continuous-Time Distribution Matching for Few-Step Diffusion Distillation

394

Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation

395

Stream-T1: Test-Time Scaling for Streaming Video Generation

396

RLDX-1 Technical Report

397

OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents

398

HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

399

PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World

400

ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration

401

OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories

402

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

403

MolmoAct2: Action Reasoning Models for Real-world Deployment

404

From Context to Skills: Can Language Models Learn from Context Skillfully?

405

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

406

Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction

407

Heterogeneous Scientific Foundation Model Collaboration

408

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

409

Co-Evolving Policy Distillation

410

ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control

411

Efficient Training on Multiple Consumer GPUs with RoundPipe

412

GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

413

Large Language Models Explore by Latent Distilling

414

RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments

415

ClawGym: A Scalable Framework for Building Effective Claw Agents

416

Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models

417

Recursive Multi-Agent Systems

418

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

419

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

420

AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery

421

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

422

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

423

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

424

From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company

425

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

426

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

427

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

428

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

429

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

430

Video Analysis and Generation via a Semantic Progress Function

431

DiffNR: Diffusion-Enhanced Neural Representation Optimization for Sparse-View 3D Tomographic Reconstruction

432

LLM Safety From Within: Detecting Harmful Content with Internal Representations

433

LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to Semantics

434

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

435

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

436

LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

437

Near-Future Policy Optimization

438

DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data

439

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

440

DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation

441

Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items

442

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

443

AgentSPEX: An Agent SPecification and EXecution Language

444

AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model

445

TEMPO: Scaling Test-time Training for Large Reasoning Models

446

Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation

447

OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

448

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

449

OpenGame: Open Agentic Coding for Games

450

MultiWorld: Scalable Multi-Agent Multi-View Video World Models

451

EasyVideoR1: Easier RL for Video Understanding

452

Elucidating the SNR-t Bias of Diffusion Probabilistic Models

453

Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips

454

PersonaVLM: Long-Term Personalized Multimodal LLMs

455

Qwen3.5-Omni Technical Report

456

HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds

457

RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework

458

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

459

Seedance 2.0: Advancing Video Generation for World Complexity

460

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

461

RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time

462

SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments

463

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation

464

Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents

465

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

466

Exploration and Exploitation Errors Are Measurable for Language Model Agents

467

ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents

468

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

469

Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization

470

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

471

Toward Autonomous Long-Horizon Engineering for ML Research

472

BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation

473

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

474

The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping

475

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

476

Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation

477

Strips as Tokens: Artist Mesh Generation with Native UV Segmentation

478

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

479

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

480

CocoaBench: Evaluating Unified Digital Agents in the Wild

481

CodeTracer: Towards Traceable Agent States

482

WildDet3D: Scaling Promptable 3D Detection in the Wild

483

FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios

484

EXAONE 4.5 Technical Report

485

RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details

486

Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory

487

Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability

488

SkillClaw: Let Skills Evolve Collectively with Agentic Evolver

489

RAGEN-2: Reasoning Collapse in Agentic RL

490

MARS: Enabling Autoregressive Models Multi-Token Generation

491

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

492

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

493

Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents

494

Learning to Retrieve from Agent Trajectories

495

ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation

496

GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers

497

Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning

498

ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement

499

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

500

MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU

501

Watch Before You Answer: Learning from Visually Grounded Post-Training

502

OpenWorldLib: A Unified Codebase and Definition of Advanced World Models

503

MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale

504

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

505

TriAttention: Efficient Long Reasoning with Trigonometric KV Compression

506

Adam's Law: Textual Frequency Law on Large Language Models

507

AURA: Always-On Understanding and Real-Time Assistance via Video Streams

508

ClawArena: Benchmarking AI Agents in Evolving Information Environments

509

SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing

510

LightThinker++: From Reasoning Compression to Memory Management

511

Self-Distilled RLVR

512

A Simple Baseline for Streaming Video Understanding

513

Token Warping Helps MLLMs Look from Nearby Viewpoints

514

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

515

DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

516

The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook

517

Generative World Renderer

518

SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization

519

Steerable Visual Representations

520

EgoSim: Egocentric World Simulator for Embodied Interaction Generation

521

CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery

522

ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers

523

Terminal Agents Suffice for Enterprise Automation

524

MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome

525

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

526

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

527

QuitoBench: A High-Quality Open Time Series Forecasting Benchmark

528

Reasoning Shift: How Context Silently Shortens LLM Reasoning

529

FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization

530

CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence

531

LongCat-Next: Lexicalizing Modalities as Discrete Tokens

532

Lingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cells

533

GEMS: Agent-Native Multimodal Generation with Memory and Skills

534

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

535

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

536

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

537

CutClaw: Agentic Hours-Long Video Editing via Music Synchronization

538

daVinci-LLM:Towards the Science of Pretraining

539

TAPS: Task Aware Proposal Distributions for Speculative Sampling

540

Towards a Medical AI Scientist

541

Gen-Searcher: Reinforcing Agentic Search for Image Generation

542

Emergent Social Intelligence Risks in Generative Multi-Agent Systems

543

EpochX: Building the Infrastructure for an Emergent Agent Civilization

544

On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

545

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

546

Make Geometry Matter for Spatial Reasoning

547

PRBench: End-to-end Paper Reproduction in Physics Research

548

PixelSmile: Toward Fine-Grained Facial Expression Editing

549

Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale

550

Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration

551

RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models

552

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

553

Voxtral TTS

554

Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

555

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

556

WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG

557

From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents

558

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

559

PEARL: Personalized Streaming Video Understanding Model

560

DA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Models

561

SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

562

UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

563

RealMaster: Lifting Rendered Scenes into Photorealistic Video

564

Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models

565

Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model

566

LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning

567

Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs

568

OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

569

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

570

SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning

571

F4Splat: Feed-Forward Predictive Densification for Feed-Forward 3D Gaussian Splatting

572

mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT

573

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

574

Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models

575

TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation

576

ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

577

FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow

578

The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus

579

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

580

Hyperagents

581

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

582

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

583

FASTER: Rethinking Real-Time Flow VLAs

584

3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model

585

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

586

MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

587

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

588

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

589

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

590

Memento-Skills: Let Agents Design Agents

591

MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild

592

Video-CoE: Reinforcing Video Event Prediction via Chain of Events

593

MosaicMem: Hybrid Spatial Memory for Controllable Video World Models

594

Alignment Makes Language Models Normative, Not Descriptive

595

Complementary Reinforcement Learning

596

When AI Navigates the Fog of War

597

MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification

598

InCoder-32B: Code Foundation Model for Industrial Scenarios

599

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

600

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

601

Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation

602

Demystifing Video Reasoning

603

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

604

TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas

605

Online Experiential Learning for Language Models

606

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

607

AI Can Learn Scientific Taste

608

OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data

609

EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

610

Grounding World Simulation Models in a Real-World Metropolis

611

HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions

612

Attention Residuals

613

Mixture-of-Depths Attention

614

Effective Distillation to Hybrid xLSTM Architectures

615

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

616

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

617

LMEB: Long-horizon Memory Embedding Benchmark

618

Can Vision-Language Models Solve the Shell Game?

619

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

620

daVinci-Env: Open SWE Environment Synthesis at Scale

621

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

622

OpenClaw-RL: Train Any Agent Simply by Talking

623

Flash-KMeans: Fast and Memory-Efficient Exact K-Means

624

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

625

LLM2Vec-Gen: Generative Embeddings from Large Language Models

626

Urban Socio-Semantic Segmentation with Vision-Language Reasoning

627

STEP3-VL-10B Technical Report

628

Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs

629

Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning

630

Controlled Self-Evolution for Algorithmic Code Optimization

631

DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation

632

MAXS: Meta-Adaptive Exploration with LLM Agents

633

Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning

634

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

635

SkinFlow: Efficient Information Transmission for Open Dermatological Diagnosis via Dynamic Visual Encoding and Staged RL

636

OpenDecoder: Open Large Language Model Decoding to Incorporate Document Quality in RAG

637

OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

638

MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences

639

Solar Open Technical Report

640

KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions

641

User-Oriented Multi-Turn Dialogue Generation with Tool Use at scale

642

ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands

643

ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking

644

MemoBrain: Executive Memory as an Agentic Brain for Reasoning

645

Motion Attribution for Video Generation

646

3AM: Segment Anything with Geometric Consistency in Videos

647

BabyVision: Visual Reasoning Beyond Language

648

PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning

649

MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head

650

X-Coder: Advancing Competitive Programming with Fully Synthetic Tasks, Solutions, and Tests

651

GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts

652

Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

653

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

654

Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization

655

MMFormalizer: Multimodal Autoformalization in the Wild

656

CaricatureGS: Exaggerating 3D Gaussian Splatting Faces With Gaussian Curvature

657

The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning

658

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards

659

EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis

660

Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking

661

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

662

Learnable Multipliers: Freeing the Scale of Language Model Matrix Layers

663

RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes

664

Token-Level LLM Collaboration via FusionRoute

665

Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting

666

Evolving Programmatic Skill Networks

667

Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning

668

Benchmark^2: Systematic Evaluation of LLM Benchmarks

669

InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields

670

LTX-2: Efficient Joint Audio-Visual Foundation Model

671

MOSS Transcribe Diarize: Accurate Transcription with Speaker Diarization

672

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

673

NitroGen: An Open Foundation Model for Generalist Gaming Agents

674

Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits

675

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

676

DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer

677

VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation

678

GARDO: Reinforcing Diffusion Models without Reward Hacking

679

InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams

680

VINO: A Unified Visual Generator with Interleaved OmniModal Context

681

Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization

682

NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

683

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

684

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

685

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

686

Deep Delta Learning

687

AdaGaR: Adaptive Gabor Representation for Dynamic Scene Reconstruction

688

Nested Learning: The Illusion of Deep Learning Architectures

689

Improving Multi-step RAG with Hypergraph-based Memory for Long-Context Complex Relational Modeling

690

Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space

691

mHC: Manifold-Constrained Hyper-Connections

692

Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models

693

Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem

694

GaMO: Geometry-aware Multi-view Diffusion Outpainting for Sparse-View 3D Reconstruction

695

Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss

696

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

697

Yume-1.5: A Text-Controlled Interactive World Generation Model

698

SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents

699

Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation

700

Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion

701

Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone

702

SpotEdit: Selective Region Editing in Diffusion Transformers

703

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

704

InsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertion

705

Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding

706

MAI-UI Technical Report: Real-World Centric Foundation GUI Agents

707

Latent Implicit Visual Reasoning

708

Emergent temporal abstractions in autoregressive models enable hierarchical reinforcement learning

709

TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times

710

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

711

DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation

712

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

713

SemanticGen: Video Generation in Semantic Space

714

Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Policies

715

LongVideoAgent: Multi-Agent Reasoning with Long Videos

716

SpatialTree: How Spatial Abilities Branch Out in MLLMs

717

DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI

718

The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding

719

Region-Constraint In-Context Generation for Instructional Video Editing

720

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation

721

Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation

722

Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction

723

Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows

724

PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence

725

When Reasoning Meets Its Laws

726

Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experience

727

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

728

Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing

729

Are We on the Right Way to Assessing LLM-as-a-Judge?

730

Kling-Omni Technical Report

731

Adaptation of Agentic AI

732

LLaDA2.0: Scaling Up Diffusion Language Models to 100B

733

Next-Embedding Prediction Makes Strong Vision Learners

734

StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors

735

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

736

Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

737

Generative Refocusing: Flexible Defocus Control from a Single Image

738

DeContext as Defense: Safe Image Editing in Diffusion Transformers

739

Step-GUI Technical Report

740

DEER: Draft with Diffusion, Verify with Autoregressive Models

741

Fast and Accurate Causal Parallel Decoding using Jacobi Forcing

742

HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices

743

Puzzle Curriculum GRPO for Vision-Centric Reasoning

744

MMGR: Multi-Modal Generative Reasoning

745

Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans?

746

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling

747

Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling

748

RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics

749

OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value

750

ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding

751

Towards Scalable Pre-training of Visual Tokenizers for Generation

752

Memory in the Age of AI Agents

753

QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management

754

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

755

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows

756

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

757

Error-Free Linear Attention is a Free Lunch: Exact Solution from Continuous-Time Dynamics

758

KlingAvatar 2.0 Technical Report

759

MentraSuite: Post-Training Large Language Models for Mental Health Reasoning and Assessment

760

EgoX: Egocentric Video Generation from a Single Exocentric Video

761

DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry

762

SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder

763

V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties

764

T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground

765

Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving

766

Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

767

OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification

768

Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

769

StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

770

BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain

771

OmniPSD: Layered PSD Generation with Diffusion Transformer

772

Composing Concepts from Images and Videos via Concept-prompt Binding

773

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

774

Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Platform

775

Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

776

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

777

Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning

778

Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs

779

Unified Video Editing with Temporal Reasoner

780

Voxify3D: Pixel Art Meets Volumetric Rendering

781

Scaling Zero-Shot Reference-to-Video Generation

782

DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems

783

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

784

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

785

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

786

EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture

787

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

788

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

789

Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction

790

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

791

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

792

Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion

793

PaperDebugger: A Plugin-Based Multi-Agent System for In-Editor Academic Writing, Review, and Editing

794

Qwen3-VL Technical Report

795

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

796

PretrainZero: Reinforcement Active Pretraining

797

ViDiC: Video Difference Captioning

798

DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models

799

ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration

800

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

801

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

802

Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch

803

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

804

Guided Self-Evolving LLMs with Minimal Human Supervision

805

SimScale: Learning to Drive via Real-World Simulation at Scale

806

InnoGym: Benchmarking the Innovation Potential of AI Agents

807

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

808

Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights

809

Stabilizing Reinforcement Learning with LLMs: Formulation and Practices

810

How Far Are We from Genuinely Useful Deep Research Agents?

811

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

812

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

813

The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment

814

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

815

LFM2 Technical Report

816

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

817

REASONEDIT: Towards Reasoning-Enhanced Image Editing Models

818

Vision Bridge Transformer at Scale

819

DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning

820

Architecture Decoupling Is Not All You Need For Unified Multimodal Model

821

Multimodal Evaluation of Russian-language Architectures

822

Latent Collaboration in Multi-Agent Systems

823

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

824

GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Algorithms

825

MedSAM3: Delving into Segment Anything with Medical Concepts

826

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

827

SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation

828

iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

829

Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward

830

GigaWorld-0: World Models as Data Engine to Empower Embodied AI

831

SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space

832

Soft Adaptive Policy Optimization

833

General Agentic Memory Via Deep Research

834

AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning

835

Computer-Use Agents as Judges for Generative User Interface

836

DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation

837

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

838

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

839

In-Video Instructions: Visual Signals as Generative Control

840

OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe

841

Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story

842

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

843

SAM 3: Segment Anything with Concepts

844

Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks

845

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

846

What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity

847

VisPlay: Self-Evolving Vision-Language Models from Images

848

Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

849

VIDEOP2R: Video Understanding from Perception to Reasoning

850

Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models

851

AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models

852

A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space

853

Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark

854

MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs

855

REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding

856

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data

857

P1: Mastering Physics Olympiads with Reinforcement Learning

858

MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling

859

Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance

860

Part-X-MLLM: Part-aware 3D Multimodal Large Language Model

861

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

862

GroupRank: A Groupwise Reranking Paradigm Driven by Reinforcement Learning

863

TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models

864

PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image

865

GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models

866

DoPE: Denoising Rotary Position Embedding

867

WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation

868

UI2Code^N: A Visual Language Model for Test-Time Scalable Interactive UI-to-Code Generation

869

AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery

870

LiteAttention: A Temporal Sparse Attention for Diffusion Transformers

871

Virtual Width Networks

872

One Small Step in Latent, One Giant Leap for Pixels: Fast Latent Upscale Adapter for Your Diffusion Models

873

PAN: A World Model for General, Interactable, and Long-Horizon World Simulation

874

UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist

875

Too Good to be Bad: On the Failure of LLMs to Role-Play Villains

876

DeepEyesV2: Toward Agentic Multimodal Model

877

Visual Spatial Tuning

878

VeriCoT: Neuro-symbolic Chain-of-Thought Validation via Logical Consistency Checks

879

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

880

V-Thinker: Interactive Thinking with Images

881

Scaling Agent Learning via Experience Synthesis

882

Diffusion Language Models are Super Data Learners

883

LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation

884

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

885

Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization

886

VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation

887

When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought

888

Every Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language Foundation

889

Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph

890

The Underappreciated Power of Vision Models for Graph Structural Understanding

891

UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback

892

ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation

893

PHUMA: Physically-Grounded Humanoid Locomotion Dataset

894

UniREditBench: A Unified Reasoning-based Image Editing Benchmark

895

World Simulation with Video Foundation Models for Physical AI

896

ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

897

INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats

898

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

899

The End of Manual Decoding: Towards Truly End-to-End Language Models

900

Kimi Linear: An Expressive, Efficient Attention Architecture

901

Surfer 2: The Next Generation of Cross-Platform Computer Use Agents

902

Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark

903

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

904

Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations

905

Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning

906

BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping

907

LoongRL:Reinforcement Learning for Advanced Reasoning over Long Contexts

908

Language Models are Injective and Hence Invertible

909

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

910

LightMem: Lightweight and Efficient Memory-Augmented Generation

911

Efficient Long-context Language Model Training by Core Attention Disaggregation

912

World-in-World: World Models in a Closed-Loop World

913

UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation

914

Chem-R: Learning to Reason as a Chemist

915

MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation

916

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

917

Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model

918

IF-VidCap: Can Video Caption Models Follow Instructions?

919

DeepAnalyze: Agentic Large Language Models for Autonomous Data Science

920

PICABench: How Far Are We from Physically Realistic Image Editing?

921

Glyph: Scaling Context Windows via Visual-Text Compression

922

FineVision: Open Data Is All You Need

923

TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model

924

Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation

925

When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling

926

A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning

927

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

928

NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks

929

Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs

930

Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset

931

Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery

932

Latent Diffusion Model without Variational Autoencoder

933

When Models Lie, We Learn: Multilingual Span-Level Hallucination Detection with PsiloQA

934

Agentic Entropy-Balanced Policy Optimization

935

WithAnyone: Towards Controllable and ID Consistent Image Generation

936

AI for Service: Proactive Assistance with AI Glasses

937

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

938

ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints

939

Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents

940

LaSeR: Reinforcement Learning with Last-Token Self-Rewarding

941

TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar

942

BitNet Distillation

943

Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model

944

Advancing End-to-End Pixel Space Generative Modeling via Self-supervised Pre-training

945

DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation

946

Scaling Language-Centric Omnimodal Representation Learning

947

Robot Learning: A Tutorial

948

Detect Anything via Next Point Prediction

949

A Survey of Vibe Coding with Large Language Models

950

FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution

951

Dr.LLM: Dynamic Layer Routing in LLMs

952

Temporal Alignment Guidance: On-Manifold Sampling in Diffusion Models

953

QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs

954

Diffusion Transformers with Representation Autoencoders

955

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

956

Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States

957

Spotlight on Token Perception for Multimodal Reinforcement Learning

958

RLFR: Extending Reinforcement Learning for LLMs with Flow Environment

959

DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training

960

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

961

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

962

BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions

963

D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI

964

Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation

965

TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling

966

AutoPR: Let's Automate Your Academic Promotion!

967

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

968

BEAR: Benchmarking and Enhancing Multimodal Language Models for Atomic Embodied Capabilities

969

StreamingVLM: Real-Time Understanding for Infinite Video Streams

970

Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels

971

BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution

972

R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?

973

Agent Learning via Early Experience

974

MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization

975

MemMamba: Rethinking Memory Patterns in State Space Model

976

UniVideo: Unified Understanding, Generation, and Editing for Videos

977

From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning

978

When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs

979

Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learning

980

VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning

981

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

982

Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense

983

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

984

Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer

985

Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding

986

SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models

987

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

988

RLinf-VLA: A Unified and Efficient Framework for VLA+RL Training

989

Vibe Checker: Aligning Code Evaluation with Human Preference

990

Less is More: Recursive Reasoning with Tiny Networks

991

TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning

992

Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs

993

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

994

Fast-dLLM v2: Efficient Block-Diffusion LLM

995

CoDA: Coding LM via Diffusion Adaptation

996

Drax: Speech Recognition with Discrete Flow Matching

997

Paper2Video: Automatic Video Generation from Scientific Papers

998

MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information

999

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

1000

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation