Picture for Xuming Hu

Xuming Hu

May

AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval

Add code
Aug 09, 2026
Viaarxiv icon

Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns

Add code
Jul 28, 2026
Viaarxiv icon

Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?

Add code
Jul 19, 2026
Viaarxiv icon

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

Add code
Jul 16, 2026
Viaarxiv icon

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

Add code
Jun 30, 2026
Viaarxiv icon

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning

Add code
Jun 29, 2026
Viaarxiv icon

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

Add code
Jun 29, 2026
Viaarxiv icon

Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

Add code
Jun 24, 2026
Viaarxiv icon

Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs

Add code
May 31, 2026
Viaarxiv icon

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

Add code
May 29, 2026
Viaarxiv icon