Are current video models ready for zero-shot visual reasoning? A comprehensive empirical study on Veo-3 across 12 reasoning dimensions shows a mixed picture. These models handle short-horizon spatial coherence, local grounding, and simple dynamics, yet fail on long-horizon
Video Models Zero-Shot Visual Reasoning Capabilities Study
By
–
