Highlights

Each video shows the full analogy canvas: demonstration pair (top) and query input → generated output (bottom).

Modal-Guided Generation

Tasks using structured visual signals (depth, flow, events, points) as conditions for generation.

Video Manipulation

Held-out manipulation tasks requiring temporal coherence and transformation reasoning.

Camera Control

Camera motion and view transfer between demonstration and query scenes.