Picture for Xun Zhu

Xun Zhu

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

Add code
Aug 09, 2026
Viaarxiv icon

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

Add code
Jul 11, 2026
Viaarxiv icon

ReportQA: QA-Based Radiology Report Evaluation

Add code
Jun 13, 2026
Viaarxiv icon

The 1st PortraitCraft Challenge: A CVPR 2026 Workshop Competition on Portrait Composition Understanding and Generation

Add code
Jun 09, 2026
Viaarxiv icon

The Shape of Addition: Geometric Structures of Arithmetic in Large Language Models

Add code
May 29, 2026
Viaarxiv icon

InterMesh: Explicit Interaction-Aware End-to-End Multi-Person Human Mesh Recovery

Add code
May 06, 2026
Viaarxiv icon

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

Add code
Apr 09, 2026
Viaarxiv icon

MIPS: a Multimodal Infinite Polymer Sequence Pre-training Framework for Polymer Property Prediction

Add code
Jul 27, 2025
Viaarxiv icon

Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data

Add code
Apr 14, 2025
Figure 1 for Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
Figure 2 for Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
Figure 3 for Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
Figure 4 for Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
Viaarxiv icon

MedM-VL: What Makes a Good Medical LVLM?

Add code
Apr 06, 2025
Viaarxiv icon