Picture for Jiahao Xie

Jiahao Xie

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

Add code
Aug 14, 2026
Viaarxiv icon

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

Add code
Aug 12, 2026
Viaarxiv icon

PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis

Add code
Aug 07, 2026
Viaarxiv icon

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

Add code
Jul 27, 2026
Viaarxiv icon

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Add code
Jun 26, 2026
Viaarxiv icon

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

Add code
Jun 05, 2026
Viaarxiv icon

SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

Add code
Apr 22, 2026
Viaarxiv icon

R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs

Add code
Apr 22, 2026
Viaarxiv icon

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

Add code
Mar 27, 2026
Viaarxiv icon

SemanticNVS: Improving Semantic Scene Understanding in Generative Novel View Synthesis

Add code
Feb 23, 2026
Viaarxiv icon