Picture for Hang Su

Hang Su

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

Add code
Jul 27, 2026
Viaarxiv icon

Robust Activation Map Rectification for Weakly Supervised Volumetric Segmentation: Temporal Coherence as a Free Lunch

Add code
Jul 22, 2026
Viaarxiv icon

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

Add code
Jun 28, 2026
Viaarxiv icon

ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

Add code
Jun 27, 2026
Viaarxiv icon

DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

Add code
Jun 25, 2026
Viaarxiv icon

Vesta: A Generalist Embodied Reasoning Model

Add code
Jun 18, 2026
Viaarxiv icon

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

Add code
Jun 11, 2026
Viaarxiv icon

4DP-QA: Scalable QA for 4D Perception in Vision Language Models

Add code
Jun 10, 2026
Viaarxiv icon

SpeakerCard-1M: An Evidence-Grounded Speaker Card Corpus for In-the-Wild Speaker Verification

Add code
Jun 03, 2026
Viaarxiv icon

WALL-WM: Carving World Action Modeling at the Event Joints

Add code
Jun 01, 2026
Viaarxiv icon