OuroWorld: Bringing Any 3D World Alive as Diverse, Endlessly Looping 3D Cinemagraphs Paper • 2610.12461 • Published 3 days ago • 37
MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers Paper • 2610.06801 • Published 6 days ago • 33
LEGO: A Lifting-Free Approach for Exocentric-to-Egocentric Video Generation Paper • 2610.12442 • Published 3 days ago • 20
SPW-Nav: A Streaming Panoramic World Model for Language-Guided Navigation Paper • 2610.08941 • Published 5 days ago • 1
In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks Paper • 2609.38173 • Published 12 days ago • 44
CtrlCache: Accelerating Interactive Video World Models with Control-Aware Caching Paper • 2610.08777 • Published 5 days ago • 4
DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency Paper • 2609.39096 • Published 6 days ago • 7
DuoMatching: Joint-Marginal Distribution Matching for Few-Step Video Generation Paper • 2610.03543 • Published 9 days ago • 93
Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation Paper • 2609.36995 • Published 12 days ago • 4
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence Paper • 2607.07675 • Published Jul 8 • 64
CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing Paper • 2605.19484 • Published May 19 • 21
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation Paper • 2604.24764 • Published Apr 27 • 122
FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing Paper • 2604.22586 • Published Apr 24 • 15
FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing Paper • 2604.22586 • Published Apr 24 • 15
HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds Paper • 2604.14268 • Published Apr 15 • 128