Picture for Shouhong Ding

Shouhong Ding

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Add code
Jul 30, 2026
Viaarxiv icon

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

Add code
Jul 22, 2026
Viaarxiv icon

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

Add code
Jul 09, 2026
Viaarxiv icon

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

Add code
Jun 14, 2026
Viaarxiv icon

VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection

Add code
Apr 16, 2026
Viaarxiv icon

Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

Add code
Mar 21, 2026
Viaarxiv icon

TranX-Adapter: Bridging Artifacts and Semantics within MLLMs for Robust AI-generated Image Detection

Add code
Feb 25, 2026
Viaarxiv icon

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

Add code
Feb 15, 2026
Viaarxiv icon

D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning

Add code
Dec 22, 2025
Figure 1 for D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
Figure 2 for D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
Figure 3 for D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
Figure 4 for D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
Viaarxiv icon

GloTok: Global Perspective Tokenizer for Image Reconstruction and Generation

Add code
Nov 19, 2025
Viaarxiv icon