Picture for Qin Liu

Qin Liu

University of California Davis

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

Add code
Jun 30, 2026
Viaarxiv icon

Building Agent Harnesses for Scientific Curation from Multimodal Sources

Add code
Jun 19, 2026
Viaarxiv icon

ReA-OVCD: Reliability-Aware Open-Vocabulary Change Detection via Semantic and Spatial Refinement

Add code
Jun 18, 2026
Viaarxiv icon

ESAM++: Efficient Online 3D Perception on the Edge

Add code
May 28, 2026
Viaarxiv icon

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

Add code
May 12, 2026
Viaarxiv icon

Fine-Grained Action Segmentation for Renorrhaphy in Robot-Assisted Partial Nephrectomy

Add code
Apr 10, 2026
Viaarxiv icon

DebugLM: Learning Traceable Training Data Provenance for LLMs

Add code
Mar 18, 2026
Viaarxiv icon

Human-LLM Collaborative Feature Engineering for Tabular Data

Add code
Jan 28, 2026
Viaarxiv icon

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

Add code
Dec 08, 2025
Viaarxiv icon

ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation

Add code
Oct 09, 2025
Figure 1 for ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
Figure 2 for ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
Figure 3 for ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
Figure 4 for ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
Viaarxiv icon