Picture for Yuqi Tang

Yuqi Tang

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

Add code
Jul 30, 2026
Viaarxiv icon

SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition

Add code
Jul 30, 2026
Viaarxiv icon

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Add code
Jul 30, 2026
Viaarxiv icon

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

Add code
Jul 15, 2026
Viaarxiv icon

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

Add code
Jul 15, 2026
Viaarxiv icon

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

Add code
May 25, 2026
Viaarxiv icon

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

Add code
May 18, 2026
Viaarxiv icon

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Add code
Apr 03, 2026
Viaarxiv icon

Graph-Structured Deep Learning Framework for Multi-task Contention Identification with High-dimensional Metrics

Add code
Jan 28, 2026
Viaarxiv icon

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

Add code
Jan 08, 2026
Viaarxiv icon