Picture for Junjie Zhu

Junjie Zhu

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

Add code
Aug 06, 2026
Viaarxiv icon

Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training

Add code
Jul 22, 2026
Viaarxiv icon

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Add code
Jun 25, 2026
Viaarxiv icon

A Utility-preserving De-identification Pipeline for Cross-hospital Radiology Data Sharing

Add code
Apr 08, 2026
Viaarxiv icon

HyperLoad: A Cross-Modality Enhanced Large Language Model-Based Framework for Green Data Center Cooling Load Prediction

Add code
Dec 22, 2025
Viaarxiv icon

Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation

Add code
Mar 04, 2025
Figure 1 for Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation
Figure 2 for Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation
Figure 3 for Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation
Figure 4 for Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation
Viaarxiv icon

Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval

Add code
Jan 25, 2025
Figure 1 for Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
Figure 2 for Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
Figure 3 for Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
Figure 4 for Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
Viaarxiv icon

Hypergraph-Guided Disentangled Spectrum Transformer Networks for Near-Infrared Facial Expression Recognition

Add code
Dec 10, 2023
Figure 1 for Hypergraph-Guided Disentangled Spectrum Transformer Networks for Near-Infrared Facial Expression Recognition
Figure 2 for Hypergraph-Guided Disentangled Spectrum Transformer Networks for Near-Infrared Facial Expression Recognition
Figure 3 for Hypergraph-Guided Disentangled Spectrum Transformer Networks for Near-Infrared Facial Expression Recognition
Figure 4 for Hypergraph-Guided Disentangled Spectrum Transformer Networks for Near-Infrared Facial Expression Recognition
Viaarxiv icon

Multi-Energy Guided Image Translation with Stochastic Differential Equations for Near-Infrared Facial Expression Recognition

Add code
Dec 10, 2023
Figure 1 for Multi-Energy Guided Image Translation with Stochastic Differential Equations for Near-Infrared Facial Expression Recognition
Figure 2 for Multi-Energy Guided Image Translation with Stochastic Differential Equations for Near-Infrared Facial Expression Recognition
Figure 3 for Multi-Energy Guided Image Translation with Stochastic Differential Equations for Near-Infrared Facial Expression Recognition
Figure 4 for Multi-Energy Guided Image Translation with Stochastic Differential Equations for Near-Infrared Facial Expression Recognition
Viaarxiv icon

MVP: Meta Visual Prompt Tuning for Few-Shot Remote Sensing Image Scene Classification

Add code
Sep 17, 2023
Figure 1 for MVP: Meta Visual Prompt Tuning for Few-Shot Remote Sensing Image Scene Classification
Figure 2 for MVP: Meta Visual Prompt Tuning for Few-Shot Remote Sensing Image Scene Classification
Figure 3 for MVP: Meta Visual Prompt Tuning for Few-Shot Remote Sensing Image Scene Classification
Figure 4 for MVP: Meta Visual Prompt Tuning for Few-Shot Remote Sensing Image Scene Classification
Viaarxiv icon