Scaling Properties of Text Conditioning in Visual Generation
Paper • 2607.29679 • Published • 23
Computer Vision
Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction
RIVER: A Real-Time Interaction Benchmark for Video LLMs