Picture for Yihao Ding

Yihao Ding

Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution

Add code
Aug 08, 2026
Viaarxiv icon

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

Add code
Jul 15, 2026
Viaarxiv icon

STIndex: A Context-Aware Multi-Dimensional Spatiotemporal Information Extraction System

Add code
Apr 07, 2026
Viaarxiv icon

ToolTree: Efficient LLM Agent Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning

Add code
Mar 13, 2026
Viaarxiv icon

GeoChemAD: Benchmarking Unsupervised Geochemical Anomaly Detection for Mineral Exploration

Add code
Mar 13, 2026
Viaarxiv icon

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

Add code
Mar 09, 2026
Viaarxiv icon

Diagnosing Causal Reasoning in Vision-Language Models via Structured Relevance Graphs

Add code
Feb 24, 2026
Viaarxiv icon

Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding

Add code
Jan 18, 2026
Viaarxiv icon

A Disease-Aware Dual-Stage Framework for Chest X-ray Report Generation

Add code
Nov 15, 2025
Viaarxiv icon

PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning

Add code
Nov 13, 2025
Viaarxiv icon