Unzip cover art

All Episodes

Unzip — 115 episodes

#
Title
1

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

2

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

3

AutoMem: Automated Learning of Memory as a Cognitive Skill

4

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

5

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

6

Hierarchical Experimentalist Agents

7

Beyond IID: How General Are Tabular Foundation Models, Really?

8

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

9

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

10

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

11

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

12

Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints

13

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning

14

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

15

CalTennis: Large Multi-View Tennis Video Dataset and Benchmark of Monocular-to-3D Pose Estimation

16

Current World Models Lack a Persistent State Core

17

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

18

DragMesh-2: Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects

19

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

20

Operadic consistency: a label-free signal for compositional reasoning failures in LLMs

21

WebChallenger: A Reliable and Efficient Generalist Web Agent

22

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

23

TAHOE: Text-to-SQL with Automated Hint Optimization from Experience

24

Kwai Keye-VL-2.0 Technical Report

25

EmpiriGraph-Psy: A Dataset and LLM Pipeline for Extracting Empirical Relation Graphs from Psychology Abstracts

26

Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

27

Operation-Guided Progressive Human-to-AI Text Transformation Benchmark for Multi-Granularity AI-Text Detection

28

MAOAM: Unified Object and Material Selection with Vision-Language Models

29

AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

30

Probing Outcome-Level Resemblance and Mechanism-Level Alignment in LLM Risk Decisions: Evidence from the St. Petersburg Game

31

MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation

32

The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure

33

Mellum2 Technical Report

34

PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

35

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

36

Forecasting Downstream Performance of LLMs With Proxy Metrics

37

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

38

Efficient Agentic Reasoning Through Self-Regulated Simulative Planning

39

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

40

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

41

Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

42

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

43

Long Context Pre-Training with Lighthouse Attention

44

SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies

45

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

46

HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

47

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

48

Co-Evolving Policy Distillation

49

LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

50

FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption

51

Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

52

Co-Director: Agentic Generative Video Storytelling

53

PageGuide: Browser extension to assist users in navigating a webpage and locating information

54

DiffNR: Diffusion-Enhanced Neural Representation Optimization for Sparse-View 3D Tomographic Reconstruction

55

Temporal Taskification in Streaming Continual Learning: A Source of Evaluation Instability

56

Coevolving Representations in Joint Image-Feature Diffusion

57

Seeing Fast and Slow: Learning the Flow of Time in Videos

58

Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts

59

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

60

MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

61

Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips

62

Boosting Visual Instruction Tuning with Self-Supervised Guidance

63

Three-Phase Transformer

64

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

65

VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

66

Therefore I am. I Think

67

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

68

When Users Change Their Mind: Evaluating Interruptible Agents in Long-Horizon Web Navigation

69

BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

70

A Comparative Study in Surgical AI: Datasets, Foundation Models, and Barriers to Med-AGI

71

ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling

72

Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes

73

AVControl: Efficient Framework for Training Audio-Visual Controls

74

Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models

75

EVA: Efficient Reinforcement Learning for End-to-End Video Agent

76

Abstraction as a Memory-Efficient Inductive Bias for Continual Learning

77

Repurposing Geometric Foundation Models for Multi-view Diffusion

78

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

79

Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation

80

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

81

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

82

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

83

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

84

POLCA: Stochastic Generative Optimization with LLM

85

VoXtream2: Full-stream TTS with dynamic speaking rate control

86

Autonomous Agents Coordinating Distributed Discovery Through Emergent Artifact Exchange

87

SciMDR: Benchmarking and Advancing Scientific Multimodal Document Reasoning

88

COMIC: Agentic Sketch Comedy Generation

89

Do What I Say: A Spoken Prompt Dataset for Instruction-Following

90

Variational Flow Maps: Make Some Noise for One-Step Conditional Generation

91

Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation

92

SkillNet: Create, Evaluate, and Connect AI Skills

93

SageBwd: A Trainable Low-bit Attention

94

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

95

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

96

ParEVO: Synthesizing Code for Irregular Data: High-Performance Parallelism through Agentic Evolution

97

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

98

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

99

SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

100

Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning

101

MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios

102

ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?

103

Benchmark Test-Time Scaling of General LLM Agents

104

Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations

105

ReIn: Conversational Error Recovery with Reasoning Inception

106

"What Are You Doing?": Effects of Intermediate Feedback from Agentic LLM In-Car Assistants During Multi-Step Processing

107

"What Are You Doing?": Effects of Intermediate Feedback from Agentic LLM In-Car Assistants During Multi-Step Processing

108

"What Are You Doing?": Effects of Intermediate Feedback from Agentic LLM In-Car Assistants During Multi-Step Processing

109

BiManiBench: A Hierarchical Benchmark for Evaluating Bimanual Coordination of Multimodal Large Language Models

110

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

111

VisPhyWorld: Probing Physical Reasoning via Code-Driven Video Reconstruction

112

SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise

113

Thinking with Drafting: Optical Decompression via Logical Reconstruction

114

Thinking with Drafting: Optical Decompression via Logical Reconstruction

115

CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty