Picture for Mingqi Gao

Mingqi Gao

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

Add code
Jul 21, 2026
Viaarxiv icon

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Add code
Jul 14, 2026
Viaarxiv icon

DeSeG: Decoupling Semantic Intent and Geometric Constraints for Physically Plausible Human-Scene Interaction

Add code
Jul 07, 2026
Viaarxiv icon

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

Add code
Jul 06, 2026
Viaarxiv icon

Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners

Add code
Jun 01, 2026
Viaarxiv icon

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

Add code
May 05, 2026
Viaarxiv icon

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

Add code
Apr 23, 2026
Viaarxiv icon

UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation

Add code
Apr 04, 2026
Viaarxiv icon

Re-Prompting SAM 3 via Object Retrieval: 3rd of the 5th PVUW MOSE Track

Add code
Mar 24, 2026
Viaarxiv icon

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

Add code
Mar 23, 2026
Viaarxiv icon