Picture for Tiantian Zheng

Tiantian Zheng

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

Add code
Jul 12, 2026
Viaarxiv icon

Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

Add code
May 29, 2026
Viaarxiv icon