Picture for Jie Qin

Jie Qin

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

Add code
Aug 09, 2026
Viaarxiv icon

GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors

Add code
Jul 15, 2026
Viaarxiv icon

Explainable Forensics of Manipulated Segments in Untrimmed Long Videos

Add code
Jun 01, 2026
Viaarxiv icon

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

Add code
Apr 22, 2026
Viaarxiv icon

HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation

Add code
Apr 10, 2026
Viaarxiv icon

AgentVLN: Towards Agentic Vision-and-Language Navigation

Add code
Mar 18, 2026
Viaarxiv icon

DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation

Add code
Mar 13, 2026
Viaarxiv icon

History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation

Add code
Dec 17, 2025
Figure 1 for History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
Figure 2 for History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
Figure 3 for History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
Figure 4 for History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
Viaarxiv icon

STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning

Add code
Dec 15, 2025
Figure 1 for STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
Figure 2 for STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
Figure 3 for STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
Figure 4 for STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
Viaarxiv icon

LoFA: Learning to Predict Personalized Priors for Fast Adaptation of Visual Generative Models

Add code
Dec 09, 2025
Viaarxiv icon