Picture for Jinyi Huang

Jinyi Huang

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

Add code
Jul 12, 2026
Viaarxiv icon