Picture for Shuo Ye

Shuo Ye

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

Add code
Jul 22, 2026
Viaarxiv icon

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

Add code
Jun 26, 2026
Viaarxiv icon

DeceptionX: Explainable Deception Detection with Multimodal Large Language Models

Add code
Jun 09, 2026
Viaarxiv icon

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

Add code
May 13, 2026
Viaarxiv icon

Text-Guided Multimodal Unified Industrial Anomaly Detection

Add code
Apr 24, 2026
Viaarxiv icon

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

Add code
Apr 14, 2026
Viaarxiv icon

YUV20K: A Complexity-Driven Benchmark and Trajectory-Aware Alignment Model for Video Camouflaged Object Detection

Add code
Apr 11, 2026
Viaarxiv icon

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

Add code
Apr 07, 2026
Viaarxiv icon

High-Resolution Underwater Camouflaged Object Detection: GBU-UCOD Dataset and Topology-Aware and Frequency-Decoupled Networks

Add code
Feb 03, 2026
Viaarxiv icon

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Add code
Jan 10, 2026
Viaarxiv icon