Picture for Tingyu Song

Tingyu Song

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Add code
Aug 10, 2026
Viaarxiv icon

UEmbed: Unified Sparse and Dense Multimodal Embeddings

Add code
Aug 03, 2026
Viaarxiv icon

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

Add code
Jun 22, 2026
Viaarxiv icon

VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding

Add code
Jun 03, 2026
Viaarxiv icon

Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems

Add code
May 05, 2026
Viaarxiv icon

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing

Add code
Jan 22, 2026
Viaarxiv icon

MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval

Add code
Oct 10, 2025
Viaarxiv icon

Efficiency-Effectiveness Reranking FLOPs for LLM-based Rerankers

Add code
Jul 08, 2025
Viaarxiv icon

VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos

Add code
May 29, 2025
Viaarxiv icon

IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval

Add code
Mar 06, 2025
Figure 1 for IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval
Figure 2 for IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval
Figure 3 for IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval
Figure 4 for IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval
Viaarxiv icon