Picture for Ling Li

Ling Li

DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

Add code
Jul 29, 2026
Viaarxiv icon

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

Add code
Jun 23, 2026
Viaarxiv icon

VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection

Add code
Jun 23, 2026
Viaarxiv icon

Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control

Add code
Jun 22, 2026
Viaarxiv icon

CODEBLOCK: Learning to Supervise Code at the Right Granularity

Add code
Jun 10, 2026
Viaarxiv icon

Cosmos 3: Omnimodal World Models for Physical AI

Add code
Jun 01, 2026
Viaarxiv icon

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

Add code
May 27, 2026
Viaarxiv icon

From Sparse to Dense: Spatio-Temporal Fusion for Multi-View 3D Human Pose Estimation with DenseWarper

Add code
May 14, 2026
Viaarxiv icon

Autonomous Laparoscope Control through Unified Mechanics-Based Representation of Multimodal Intraoperative Information

Add code
May 06, 2026
Viaarxiv icon

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

Add code
Mar 27, 2026
Viaarxiv icon