Picture for Dong Yang

Dong Yang

Token-Based Affordance Grounding with Large Vision-Language Models

Add code
Jul 03, 2026
Viaarxiv icon

CraBERT: Efficient Phoneme Encoder Pre-Training via Cascade Fusion of Subword Representations for Text-to-Speech

Add code
Jun 15, 2026
Viaarxiv icon

MusaCoder: Native GPU Kernel Generation with Full-Stack Training on Moore Threads GPU

Add code
Jun 03, 2026
Viaarxiv icon

Cosmos 3: Omnimodal World Models for Physical AI

Add code
Jun 01, 2026
Viaarxiv icon

AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

Add code
Jun 01, 2026
Viaarxiv icon

CmIVTP: Cross-modal Interaction-based Vessel Trajectory Prediction for Maritime Intelligence

Add code
May 26, 2026
Viaarxiv icon

Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech

Add code
May 10, 2026
Viaarxiv icon

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Add code
Mar 17, 2026
Viaarxiv icon

LUMEN: Longitudinal Multi-Modal Radiology Model for Prognosis and Diagnosis

Add code
Feb 24, 2026
Viaarxiv icon

Improved Evidence Extraction for Document Inconsistency Detection with LLMs

Add code
Jan 06, 2026
Viaarxiv icon