Picture for You Qin

You Qin

ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

Add code
Jul 31, 2026
Viaarxiv icon

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

Add code
Jul 30, 2026
Viaarxiv icon

Audio-Visual Intelligence in Large Foundation Models

Add code
May 05, 2026
Viaarxiv icon

Geometry over Density: Few-Shot Cross-Domain OOD Detection

Add code
May 05, 2026
Viaarxiv icon

SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models

Add code
Apr 14, 2026
Viaarxiv icon

Secure On-Device Video OOD Detection Without Backpropagation

Add code
Mar 08, 2025
Viaarxiv icon

Grounding is All You Need? Dual Temporal Grounding for Video Dialog

Add code
Oct 08, 2024
Figure 1 for Grounding is All You Need? Dual Temporal Grounding for Video Dialog
Figure 2 for Grounding is All You Need? Dual Temporal Grounding for Video Dialog
Figure 3 for Grounding is All You Need? Dual Temporal Grounding for Video Dialog
Figure 4 for Grounding is All You Need? Dual Temporal Grounding for Video Dialog
Viaarxiv icon

Described Spatial-Temporal Video Detection

Add code
Jul 08, 2024
Figure 1 for Described Spatial-Temporal Video Detection
Figure 2 for Described Spatial-Temporal Video Detection
Figure 3 for Described Spatial-Temporal Video Detection
Figure 4 for Described Spatial-Temporal Video Detection
Viaarxiv icon

Domain-wise Invariant Learning for Panoptic Scene Graph Generation

Add code
Oct 09, 2023
Viaarxiv icon

Causal SAR ATR with Limited Data via Dual Invariance

Add code
Aug 18, 2023
Figure 1 for Causal SAR ATR with Limited Data via Dual Invariance
Figure 2 for Causal SAR ATR with Limited Data via Dual Invariance
Figure 3 for Causal SAR ATR with Limited Data via Dual Invariance
Figure 4 for Causal SAR ATR with Limited Data via Dual Invariance
Viaarxiv icon