Picture for Yilun Zhao

Yilun Zhao

UEmbed: Unified Sparse and Dense Multimodal Embeddings

Add code
Aug 03, 2026
Viaarxiv icon

Measuring the Gap Between Human and LLM Research Ideas

Add code
Jul 01, 2026
Viaarxiv icon

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

Add code
Jun 22, 2026
Viaarxiv icon

VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding

Add code
Jun 03, 2026
Viaarxiv icon

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

Add code
May 19, 2026
Viaarxiv icon

Herculean: An Agentic Benchmark for Financial Intelligence

Add code
May 14, 2026
Viaarxiv icon

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

Add code
May 07, 2026
Viaarxiv icon

Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems

Add code
May 05, 2026
Viaarxiv icon

TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction

Add code
Apr 24, 2026
Viaarxiv icon

SciMDR: Benchmarking and Advancing Scientific Multimodal Document Reasoning

Add code
Mar 12, 2026
Viaarxiv icon