Picture for Xin Zou

Xin Zou

AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval

Add code
Aug 09, 2026
Viaarxiv icon

Factorized AdaBoost.MH Achieves the Same Convergence Rate as AdaBoost.MH

Add code
Aug 02, 2026
Viaarxiv icon

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

Add code
Jun 30, 2026
Viaarxiv icon

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning

Add code
Jun 29, 2026
Viaarxiv icon

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

Add code
May 29, 2026
Viaarxiv icon

When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

Add code
May 12, 2026
Viaarxiv icon

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

Add code
Apr 14, 2026
Viaarxiv icon

Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval

Add code
Apr 11, 2026
Viaarxiv icon

Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation

Add code
Apr 04, 2026
Viaarxiv icon

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

Add code
Mar 18, 2026
Viaarxiv icon