Picture for Bohao Li

Bohao Li

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

Add code
Aug 07, 2026
Viaarxiv icon

Twins: Learn to Predict Unified Representations with Focal Loss

Add code
Jul 24, 2026
Viaarxiv icon

Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings

Add code
Jul 14, 2026
Viaarxiv icon

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

Add code
Jul 09, 2026
Viaarxiv icon

A Clinical Point Cloud Paradigm for In-Hospital Mortality Prediction from Multi-Level Incomplete Multimodal EHRs

Add code
Apr 06, 2026
Viaarxiv icon

CIGPose: Causal Intervention Graph Neural Network for Whole-Body Pose Estimation

Add code
Mar 10, 2026
Viaarxiv icon

Incident-Guided Spatiotemporal Traffic Forecasting

Add code
Jan 27, 2026
Viaarxiv icon

Video-R1: Reinforcing Video Reasoning in MLLMs

Add code
Mar 27, 2025
Figure 1 for Video-R1: Reinforcing Video Reasoning in MLLMs
Figure 2 for Video-R1: Reinforcing Video Reasoning in MLLMs
Figure 3 for Video-R1: Reinforcing Video Reasoning in MLLMs
Figure 4 for Video-R1: Reinforcing Video Reasoning in MLLMs
Viaarxiv icon

AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?

Add code
Dec 03, 2024
Figure 1 for AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
Figure 2 for AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
Figure 3 for AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
Figure 4 for AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
Viaarxiv icon

VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI

Add code
Oct 15, 2024
Viaarxiv icon