Picture for Zitong Yu

Zitong Yu

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

Add code
Jul 29, 2026
Viaarxiv icon

PhysAgent: A Multi-Agent Framework for Reliable Remote Heart Rate Estimation

Add code
Jul 29, 2026
Viaarxiv icon

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

Add code
Jul 22, 2026
Viaarxiv icon

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

Add code
Jun 26, 2026
Viaarxiv icon

OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

Add code
Jun 24, 2026
Viaarxiv icon

DeceptionX: Explainable Deception Detection with Multimodal Large Language Models

Add code
Jun 09, 2026
Viaarxiv icon

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

Add code
May 13, 2026
Viaarxiv icon

Text-Guided Multimodal Unified Industrial Anomaly Detection

Add code
Apr 24, 2026
Viaarxiv icon

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

Add code
Apr 14, 2026
Viaarxiv icon

AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition

Add code
Apr 14, 2026
Viaarxiv icon