Picture for Jin Wang

Jin Wang

University of California, Los Angeles, USA

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

Add code
Jul 27, 2026
Viaarxiv icon

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

Add code
Jul 26, 2026
Viaarxiv icon

Constraint-Bound Agnostic Bayesian Optimization: One Model for All Thresholds

Add code
Jul 26, 2026
Viaarxiv icon

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

Add code
Jul 24, 2026
Viaarxiv icon

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

Add code
Jul 24, 2026
Viaarxiv icon

Handwritten and Printed Text Segmentation via Region-Aware Human-Writing Descriptor Engineering

Add code
Jul 17, 2026
Viaarxiv icon

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Add code
Jul 07, 2026
Viaarxiv icon

ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation

Add code
Jun 21, 2026
Viaarxiv icon

UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data

Add code
Jun 09, 2026
Viaarxiv icon

GUIDE: Goal-Initialized Directional Understanding for End-to-End Visual Navigation

Add code
Jun 09, 2026
Viaarxiv icon