All Episodes
Daily Paper Cast — 1000 episodes
StudentSim: Training LLM-based Student Simulators
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
UI-Venus-2 Technical Report
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
H3-World: Turning Language Understanding into World Control
Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering
DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling
Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
PaperGym: Rubric-Centered Evolution for Research-Plan Generation
Normalized Low-Rank Adaptation
CogEvol: Towards Efficient and Reliable Learning Environment Generation
Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
TTPO: Test-Time Policy Optimization
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
GameWAM: A World Action Model for Video Games
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
FrontierChallenge: Evaluating Scientific Workflow Completion
VGI-Bench: Probing Visual Intelligence in Video Generation Models
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
Towards a Densing Law for User Representation Learning at Billion-Scale Capacity
Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs
An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models
Agentic Transaction: Towards ACID-Compliant Agent Systems
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
Self-Supervised Visual On-Policy Distillation
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence
Marionette: Predicting World States, Rendering Geometry, Painting Appearance
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data
Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
DarwinX: Evolving Agent Harnesses Through Natural Selection
Intern-S2-Preview: Scientific Agentic Foundation Model
How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review
PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization
ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
Beyond Pixels: From Video Priors to 4D Worlds
Articulated Object Reconstruction from Rest-State Observation
AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss
Mendel G\"odel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
On-Policy Self-Distillation without Any Supervision
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
Motif 3: Technical Report
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval
WorldClaw: Agentic 3D Open-World Generation at Scale
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
ChronoVision: Temporal Reasoning via Latent State Reconstruction
Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
Quo Vadis, World Modeling?
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
DAPD: Dual-Anchored Policy Distillation
Progressive Agent Skill Generation via Reinforcement Learning
VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
UEmbed: Unified Sparse and Dense Multimodal Embeddings
Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
CADENA: Stepwise CAD Reverse Engineering
WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
Mental World Modeling
$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
Meshy T2: Fast Native Mesh Generation with Flow Matching
Weak-to-Strong On-Policy Distillation
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
Scaling Properties of Text Conditioning in Visual Generation
QQWorld: Quantile-Quantile Matching for World Model Regularization
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Metis: Memory Foundation Model
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
PhiZero: A World Model Built Around Physical Language
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
Beacon: Knowing When and How to Perform Agentic Visual Reasoning
BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
Flux-OPD: On-Policy Distillation with Evolving Contexts
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
HumanCLAW: Can Vision-Language Models Act Through a Body?
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
CAST: Game Solvers as Turn-Level Teachers for LLM Agents
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents
ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition
Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
Pass the Baton: Trajectory-Relayed On-Policy Distillation
Kimi K3: Open Frontier Intelligence
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Data Pyramid for Embodied Manipulation
Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
AREX: Towards a Recursively Self-Improving Agent for Deep Research
ReferTrack: Referring Then Tracking for Embodied Visual Tracking
K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
Visual Contrastive Self-Distillation
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
Generative World Renderer at the Speed of Play
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report
AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Loop the Loopies!
xHC: Expanded Hyper-Connections
Cura 1T: Specialized Model for Agentic Healthcare
On-Policy Delta Distillation
RecGPT-V3 Technical Report
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
BadWAM: When World-Action Models Dream Right but Act Wrong
KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes
From Pixels to States: Rethinking Interactive World Models as Game Engines
UniVR: Thinking in Visual Space for Unified Visual Reasoning
Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
OvisOCR2 Technical Report
PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
Weak-to-Strong Generalization via Direct On-Policy Distillation
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
4D Human-Scene Reconstruction from Low-Overlap Captures
LightMem-Ego: Your AI Memory for Everyday Life
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
Scalable Visual Pretraining for Language Intelligence
Video Generation Models are General-Purpose Vision Learners
Vidu S1: A Real-Time Interactive Video Generation Model
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
Infinite Worlds with Versatile Interactions
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
Vision as Unified Multimodal Generation
Gemma 4 Technical Report
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes
MANCE: Manifold Aware Concept Erasure
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
Wan-Streamer v0.2: Higher Resolution, Same Latency
EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers
VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
DataComp-VLM: Improved Open Datasets for Vision-Language Models
Program-as-Weights: A Programming Paradigm for Fuzzy Functions
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
Morphing into Hybrid Attention Models
AgenticDataBench: A Comprehensive Benchmark for Data Agents
Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
Orca: The World is in Your Mind
Dockerless: Environment-Free Program Verifier for Coding Agents
DOPD: Dual On-policy Distillation
Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views
GEAR: Guided End-to-End AutoRegression for Image Synthesis
Multi-Block Diffusion Language Models
Agentic Abstention: Do Agents Know When to Stop Instead of Act?
LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
Beyond IID: How General Are Tabular Foundation Models, Really?
Trimming the Long-Tail of Visual World Modeling Evaluation
AsyncOPD: How Stale Can On-Policy Distillation Be?
Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning
Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation
Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
Qwen-Image-2.0-RL Technical Report
DanceOPD: On-Policy Generative Field Distillation
In-Context World Modeling for Robotic Control
Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
The Verification Horizon: No Silver Bullet for Coding Agent Rewards
ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting
GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents
Fast LeWorldModel
EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments
MiniMax Sparse Attention
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
InterleaveThinker: Reinforcing Agentic Interleaved Generation
FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents
Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?
MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling
WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces
LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories
HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers
ABot-Earth 0.5: Generative 3D Earth Model
Kwai Keye-VL-2.0 Technical Report
Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution
Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning
Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models
SCAIL-2: Unifying Controlled Character Animation with End-to-end In-Context Conditioning
Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization
Agents' Last Exam
SWE-Explore: Benchmarking How Coding Agents Explore Repositories
On the Geometry of On-Policy Distillation
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
Latent Spatial Memory for Video World Models
FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention
CoVEBench: Can Video Editing Models Handle Complex Instructions?
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks
Human Psychometric Questionnaires Mischaracterize LLM Behavior
Echo-Memory: A Controlled Study of Memory in Action World Models
From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain
Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking
Trust Region On-Policy Distillation
KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks
COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation
Representation Forcing for Bottleneck-Free Unified Multimodal Models
Mellum2 Technical Report
Function2Scene: 3D Indoor Scene Layout from Functional Specifications
GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps
ACC: Compiling Agent Trajectories for Long-Context Training
PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning
WorldKV: Efficient World Memory with World Retrieval and Compression
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools
When Vision Speaks for Sound
Active Learners as Efficient PRP Rerankers
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
Process Rewards with Learned Reliability
EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition
Harnessing LLM Agents with Skill Programs
Code as Agent Harness
SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution
LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
Lance: Unified Multimodal Modeling by Multi-Task Synergy
AI for Auto-Research: Roadmap & User Guide
CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
PhysBrain 1.0 Technical Report
MMSkills: Towards Multimodal Skills for General Visual Agents
DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
Self-Distilled Agentic Reinforcement Learning
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning
Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems
STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
MinT: Managed Infrastructure for Training and Serving Millions of LLMs
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
Predicting Decisions of AI Agents from Limited Interaction through Text-Tabular Modeling
Qwen-Image-VAE-2.0 Technical Report
TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
Many-Shot CoT-ICL: Making In-Context Learning Truly Learn
MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
$δ$-mem: Efficient Online Memory for Large Language Models
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics
World Action Models: The Next Frontier in Embodied AI
Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
Efficient Pre-Training with Token Superposition
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments
Qwen-Image-2.0 Technical Report
Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
TMAS: Scaling Test-Time Compute via Multi-Agent Synergy
PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents
Model Merging Scaling Laws in Large Language Models
SEIF: Self-Evolving Reinforcement Learning for Instruction Following
WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors
Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models
Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers
Flow-OPD: On-Policy Distillation for Flow Matching Models
HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
Anisotropic Modality Align
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
MiA-Signature: Approximating Global Activation for Long-Context Understanding
When to Trust Imagination: Adaptive Action Execution for World Action Models
Continuous-Time Distribution Matching for Few-Step Diffusion Distillation
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
Stream-T1: Test-Time Scaling for Streaming Video Generation
RLDX-1 Technical Report
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World
ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
MolmoAct2: Action Reasoning Models for Real-world Deployment
From Context to Skills: Can Language Models Learn from Context Skillfully?
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction
Heterogeneous Scientific Foundation Model Collaboration
Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling
Co-Evolving Policy Distillation
ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control
Efficient Training on Multiple Consumer GPUs with RoundPipe
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
Large Language Models Explore by Latent Distilling
RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments
ClawGym: A Scalable Framework for Building Effective Claw Agents
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
Recursive Multi-Agent Systems
Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
Meta-CoT: Enhancing Granularity and Generalization in Image Editing
Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company
ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
SketchVLM: Vision language models can annotate images to explain thoughts and guide users
Video Analysis and Generation via a Semantic Progress Function
DiffNR: Diffusion-Enhanced Neural Representation Optimization for Sparse-View 3D Tomographic Reconstruction
LLM Safety From Within: Detecting Harmful Content with Internal Representations
LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to Semantics
WorldMark: A Unified Benchmark Suite for Interactive Video World Models
UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
Near-Future Policy Optimization
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation
Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items
CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation
AgentSPEX: An Agent SPecification and EXecution Language
AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model
TEMPO: Scaling Test-time Training for Large Reasoning Models
Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation
OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence
OpenGame: Open Agentic Coding for Games
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
EasyVideoR1: Easier RL for Video Understanding
Elucidating the SNR-t Bias of Diffusion Probabilistic Models
Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips
PersonaVLM: Long-Term Personalized Multimodal LLMs
Qwen3.5-Omni Technical Report
HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework
DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
Seedance 2.0: Advancing Video Generation for World Complexity
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents
From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space
Exploration and Exploitation Errors Are Measurable for Language Model Agents
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
Toward Autonomous Long-Horizon Engineering for ML Research
BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation
QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation
Strips as Tokens: Artist Mesh Generation with Native UV Segmentation
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
CocoaBench: Evaluating Unified Digital Agents in the Wild
CodeTracer: Towards Traceable Agent States
WildDet3D: Scaling Promptable 3D Detection in the Wild
FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios
EXAONE 4.5 Technical Report
RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details
Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
RAGEN-2: Reasoning Collapse in Agentic RL
MARS: Enabling Autoregressive Models Multi-Token Generation
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents
Learning to Retrieve from Agent Trajectories
ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation
GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers
Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
Watch Before You Answer: Learning from Visually Grounded Post-Training
OpenWorldLib: A Unified Codebase and Definition of Advanced World Models
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
Adam's Law: Textual Frequency Law on Large Language Models
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
ClawArena: Benchmarking AI Agents in Evolving Information Environments
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
LightThinker++: From Reasoning Compression to Memory Management
Self-Distilled RLVR
A Simple Baseline for Streaming Video Understanding
Token Warping Helps MLLMs Look from Nearby Viewpoints
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models
The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook
Generative World Renderer
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
Steerable Visual Representations
EgoSim: Egocentric World Simulator for Embodied Interaction Generation
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
Terminal Agents Suffice for Enterprise Automation
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
QuitoBench: A High-Quality Open Time Series Forecasting Benchmark
Reasoning Shift: How Context Silently Shortens LLM Reasoning
FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence
LongCat-Next: Lexicalizing Modalities as Discrete Tokens
Lingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cells
GEMS: Agent-Native Multimodal Generation with Memory and Skills
Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development
VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
CutClaw: Agentic Hours-Long Video Editing via Music Synchronization
daVinci-LLM:Towards the Science of Pretraining
TAPS: Task Aware Proposal Distributions for Speculative Sampling
Towards a Medical AI Scientist
Gen-Searcher: Reinforcing Agentic Search for Image Generation
Emergent Social Intelligence Risks in Generative Multi-Agent Systems
EpochX: Building the Infrastructure for an Emergent Agent Civilization
On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
GEditBench v2: A Human-Aligned Benchmark for General Image Editing
Make Geometry Matter for Spatial Reasoning
PRBench: End-to-end Paper Reproduction in Physics Research
PixelSmile: Toward Fine-Grained Facial Expression Editing
Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale
Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models
MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data
Voxtral TTS
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
PEARL: Personalized Streaming Video Understanding Model
DA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Models
SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
RealMaster: Lifting Rendered Scenes into Photorealistic Video
Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models
Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
F4Splat: Feed-Forward Predictive Densification for Feed-Forward 3D Gaussian Splatting
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow
The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus
LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation
Hyperagents
Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
FASTER: Rethinking Real-Time Flow VLAs
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
Memento-Skills: Let Agents Design Agents
MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild
Video-CoE: Reinforcing Video Event Prediction via Chain of Events
MosaicMem: Hybrid Spatial Memory for Controllable Video World Models
Alignment Makes Language Models Normative, Not Descriptive
Complementary Reinforcement Learning
When AI Navigates the Fog of War
MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification
InCoder-32B: Code Foundation Model for Industrial Scenarios
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding
Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation
Demystifing Video Reasoning
WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation
TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas
Online Experiential Learning for Language Models
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
AI Can Learn Scientific Taste
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
Grounding World Simulation Models in a Real-World Metropolis
HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions
Attention Residuals
Mixture-of-Depths Attention
Effective Distillation to Hybrid xLSTM Architectures
Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
LMEB: Long-horizon Memory Embedding Benchmark
Can Vision-Language Models Solve the Shell Game?
Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation
daVinci-Env: Open SWE Environment Synthesis at Scale
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
OpenClaw-RL: Train Any Agent Simply by Talking
Flash-KMeans: Fast and Memory-Efficient Exact K-Means
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
LLM2Vec-Gen: Generative Embeddings from Large Language Models
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
STEP3-VL-10B Technical Report
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning
Controlled Self-Evolution for Algorithmic Code Optimization
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
MAXS: Meta-Adaptive Exploration with LLM Agents
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
SkinFlow: Efficient Information Transmission for Open Dermatological Diagnosis via Dynamic Visual Encoding and Staged RL
OpenDecoder: Open Large Language Model Decoding to Incorporate Document Quality in RAG
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences
Solar Open Technical Report
KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions
User-Oriented Multi-Turn Dialogue Generation with Tool Use at scale
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
MemoBrain: Executive Memory as an Agentic Brain for Reasoning
Motion Attribution for Video Generation
3AM: Segment Anything with Geometric Consistency in Videos
BabyVision: Visual Reasoning Beyond Language
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head
X-Coder: Advancing Competitive Programming with Fully Synthetic Tasks, Solutions, and Tests
GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts
Lost in the Noise: How Reasoning Models Fail with Contextual Distractors
OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent
Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization
MMFormalizer: Multimodal Autoformalization in the Wild
CaricatureGS: Exaggerating 3D Gaussian Splatting Faces With Gaussian Curvature
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
Learnable Multipliers: Freeing the Scale of Language Model Matrix Layers
RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes
Token-Level LLM Collaboration via FusionRoute
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
Evolving Programmatic Skill Networks
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
Benchmark^2: Systematic Evaluation of LLM Benchmarks
InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields
LTX-2: Efficient Joint Audio-Visual Foundation Model
MOSS Transcribe Diarize: Accurate Transcription with Speaker Diarization
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
NitroGen: An Open Foundation Model for Generalist Gaming Agents
Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation
GARDO: Reinforcing Diffusion Models without Reward Hacking
InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
VINO: A Unified Visual Generator with Interleaved OmniModal Context
Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization
NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
Deep Delta Learning
AdaGaR: Adaptive Gabor Representation for Dynamic Scene Reconstruction
Nested Learning: The Illusion of Deep Learning Architectures
Improving Multi-step RAG with Hypergraph-based Memory for Long-Context Complex Relational Modeling
Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space
mHC: Manifold-Constrained Hyper-Connections
Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models
Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem
GaMO: Geometry-aware Multi-view Diffusion Outpainting for Sparse-View 3D Reconstruction
Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss
LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation
Yume-1.5: A Text-Controlled Interactive World Generation Model
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation
Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
SpotEdit: Selective Region Editing in Diffusion Transformers
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
InsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertion
Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
Latent Implicit Visual Reasoning
Emergent temporal abstractions in autoregressive models enable hierarchical reinforcement learning
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
SemanticGen: Video Generation in Semantic Space
Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Policies
LongVideoAgent: Multi-Agent Reasoning with Long Videos
SpatialTree: How Spatial Abilities Branch Out in MLLMs
DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
Region-Constraint In-Context Generation for Instructional Video Editing
QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation
Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation
Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction
Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows
PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence
When Reasoning Meets Its Laws
Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experience
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing
Are We on the Right Way to Assessing LLM-as-a-Judge?
Kling-Omni Technical Report
Adaptation of Agentic AI
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
Next-Embedding Prediction Makes Strong Vision Learners
StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation
Generative Refocusing: Flexible Defocus Control from a Single Image
DeContext as Defense: Safe Image Editing in Diffusion Transformers
Step-GUI Technical Report
DEER: Draft with Diffusion, Verify with Autoregressive Models
Fast and Accurate Causal Parallel Decoding using Jacobi Forcing
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
Puzzle Curriculum GRPO for Vision-Centric Reasoning
MMGR: Multi-Modal Generative Reasoning
Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans?
WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
Towards Scalable Pre-training of Visual Tokenizers for Generation
Memory in the Age of AI Agents
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
LongVie 2: Multimodal Controllable Ultra-Long Video World Model
Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
Error-Free Linear Attention is a Free Lunch: Exact Solution from Continuous-Time Dynamics
KlingAvatar 2.0 Technical Report
MentraSuite: Post-Training Large Language Models for Mental Health Reasoning and Assessment
EgoX: Egocentric Video Generation from a Single Exocentric Video
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification
Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning
StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain
OmniPSD: Layered PSD Generation with Diffusion Transformer
Composing Concepts from Images and Videos via Concept-prompt Binding
Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Platform
Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs
Unified Video Editing with Temporal Reasoner
Voxify3D: Pixel Art Meets Volumetric Rendering
Scaling Zero-Shot Reference-to-Video Generation
DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
EditThinker: Unlocking Iterative Reasoning for Any Image Editor
From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks
EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
PaperDebugger: A Plugin-Based Multi-Agent System for In-Editor Academic Writing, Review, and Editing
Qwen3-VL Technical Report
Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach
PretrainZero: Reinforcement Active Pretraining
ViDiC: Video Difference Captioning
DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch
DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
Guided Self-Evolving LLMs with Minimal Human Supervision
SimScale: Learning to Drive via Real-World Simulation at Scale
InnoGym: Benchmarking the Innovation Potential of AI Agents
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
How Far Are We from Genuinely Useful Deep Research Agents?
What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards
Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout
The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
LFM2 Technical Report
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
REASONEDIT: Towards Reasoning-Enhanced Image Editing Models
Vision Bridge Transformer at Scale
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
Architecture Decoupling Is Not All You Need For Unified Multimodal Model
Multimodal Evaluation of Russian-language Architectures
Latent Collaboration in Multi-Agent Systems
Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation
GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Algorithms
MedSAM3: Delving into Segment Anything with Medical Concepts
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation
iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space
Soft Adaptive Policy Optimization
General Agentic Memory Via Deep Research
AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning
Computer-Use Agents as Judges for Generative User Interface
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
In-Video Instructions: Visual Signals as Generative Control
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
SAM 3: Segment Anything with Concepts
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity
VisPlay: Self-Evolving Vision-Language Models from Images
Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset
VIDEOP2R: Video Understanding from Perception to Reasoning
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark
MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
P1: Mastering Physics Olympiads with Reinforcement Learning
MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling
Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
GroupRank: A Groupwise Reranking Paradigm Driven by Reinforcement Learning
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image
GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
DoPE: Denoising Rotary Position Embedding
WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
UI2Code^N: A Visual Language Model for Test-Time Scalable Interactive UI-to-Code Generation
AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery
LiteAttention: A Temporal Sparse Attention for Diffusion Transformers
Virtual Width Networks
One Small Step in Latent, One Giant Leap for Pixels: Fast Latent Upscale Adapter for Your Diffusion Models
PAN: A World Model for General, Interactable, and Long-Horizon World Simulation
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
Too Good to be Bad: On the Failure of LLMs to Role-Play Villains
DeepEyesV2: Toward Agentic Multimodal Model
Visual Spatial Tuning
VeriCoT: Neuro-symbolic Chain-of-Thought Validation via Logical Consistency Checks
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
V-Thinker: Interactive Thinking with Images
Scaling Agent Learning via Experience Synthesis
Diffusion Language Models are Super Data Learners
LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
Every Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language Foundation
Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
The Underappreciated Power of Vision Models for Graph Structural Understanding
UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation
PHUMA: Physically-Grounded Humanoid Locomotion Dataset
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
World Simulation with Video Foundation Models for Physical AI
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
The End of Manual Decoding: Towards Truly End-to-End Language Models
Kimi Linear: An Expressive, Efficient Attention Architecture
Surfer 2: The Next Generation of Cross-Platform Computer Use Agents
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations
Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
LoongRL:Reinforcement Learning for Advanced Reasoning over Long Contexts
Language Models are Injective and Hence Invertible
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
LightMem: Lightweight and Efficient Memory-Augmented Generation
Efficient Long-context Language Model Training by Core Attention Disaggregation
World-in-World: World Models in a Closed-Loop World
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
Chem-R: Learning to Reason as a Chemist
MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
IF-VidCap: Can Video Caption Models Follow Instructions?
DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
PICABench: How Far Are We from Physically Realistic Image Editing?
Glyph: Scaling Context Windows via Visual-Text Compression
FineVision: Open Data Is All You Need
TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model
Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation
When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs
Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
Latent Diffusion Model without Variational Autoencoder
When Models Lie, We Learn: Multilingual Span-Level Hallucination Detection with PsiloQA
Agentic Entropy-Balanced Policy Optimization
WithAnyone: Towards Controllable and ID Consistent Image Generation
AI for Service: Proactive Assistance with AI Glasses
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar
BitNet Distillation
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
Advancing End-to-End Pixel Space Generative Modeling via Self-supervised Pre-training
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation
Scaling Language-Centric Omnimodal Representation Learning
Robot Learning: A Tutorial
Detect Anything via Next Point Prediction
A Survey of Vibe Coding with Large Language Models
FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution
Dr.LLM: Dynamic Layer Routing in LLMs
Temporal Alignment Guidance: On-Manifold Sampling in Diffusion Models
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
Diffusion Transformers with Representation Autoencoders
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States
Spotlight on Token Perception for Multimodal Reinforcement Learning
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions
D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI
Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling
AutoPR: Let's Automate Your Academic Promotion!
Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
BEAR: Benchmarking and Enhancing Multimodal Language Models for Atomic Embodied Capabilities
StreamingVLM: Real-Time Understanding for Infinite Video Streams
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
Agent Learning via Early Experience
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization
MemMamba: Rethinking Memory Patterns in State Space Model
UniVideo: Unified Understanding, Generation, and Editing for Videos
From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning
When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs
Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learning
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
MATRIX: Mask Track Alignment for Interaction-aware Video Generation
RLinf-VLA: A Unified and Efficient Framework for VLA+RL Training
Vibe Checker: Aligning Code Evaluation with Human Preference
Less is More: Recursive Reasoning with Tiny Networks
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
Fast-dLLM v2: Efficient Block-Diffusion LLM
CoDA: Coding LM via Diffusion Adaptation
Drax: Speech Recognition with Discrete Flow Matching
Paper2Video: Automatic Video Generation from Scientific Papers
MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
VChain: Chain-of-Visual-Thought for Reasoning in Video Generation