Picture for Lorenzo Torresani

Lorenzo Torresani

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

Add code
May 29, 2026
Viaarxiv icon

How You Move Tells What You'll Do: Trajectory-Conditioned Egocentric Prediction

Add code
May 19, 2026
Viaarxiv icon

RECIPE: Procedural Planning via Grounding in Instructional Video

Add code
May 19, 2026
Viaarxiv icon

EvoGround: Self-Evolving Video Agents for Video Temporal Grounding

Add code
May 13, 2026
Viaarxiv icon

PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding

Add code
Apr 17, 2025
Figure 1 for PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
Figure 2 for PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
Figure 3 for PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
Figure 4 for PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
Viaarxiv icon

Learning Activity View-invariance Under Extreme Viewpoint Changes via Curriculum Knowledge Distillation

Add code
Apr 07, 2025
Figure 1 for Learning Activity View-invariance Under Extreme Viewpoint Changes via Curriculum Knowledge Distillation
Figure 2 for Learning Activity View-invariance Under Extreme Viewpoint Changes via Curriculum Knowledge Distillation
Figure 3 for Learning Activity View-invariance Under Extreme Viewpoint Changes via Curriculum Knowledge Distillation
Figure 4 for Learning Activity View-invariance Under Extreme Viewpoint Changes via Curriculum Knowledge Distillation
Viaarxiv icon

VITED: Video Temporal Evidence Distillation

Add code
Mar 17, 2025
Viaarxiv icon

BIMBA: Selective-Scan Compression for Long-Range Video Question Answering

Add code
Mar 13, 2025
Viaarxiv icon

TimeRefine: Temporal Grounding with Time Refining Video LLM

Add code
Dec 12, 2024
Figure 1 for TimeRefine: Temporal Grounding with Time Refining Video LLM
Figure 2 for TimeRefine: Temporal Grounding with Time Refining Video LLM
Figure 3 for TimeRefine: Temporal Grounding with Time Refining Video LLM
Figure 4 for TimeRefine: Temporal Grounding with Time Refining Video LLM
Viaarxiv icon

Semantic Compositions Enhance Vision-Language Contrastive Learning

Add code
Jul 01, 2024
Figure 1 for Semantic Compositions Enhance Vision-Language Contrastive Learning
Figure 2 for Semantic Compositions Enhance Vision-Language Contrastive Learning
Figure 3 for Semantic Compositions Enhance Vision-Language Contrastive Learning
Figure 4 for Semantic Compositions Enhance Vision-Language Contrastive Learning
Viaarxiv icon