Picture for Xu Tan

Xu Tan

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Add code
Jul 14, 2026
Viaarxiv icon

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

Add code
Jun 10, 2026
Viaarxiv icon

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

Add code
Jun 10, 2026
Viaarxiv icon

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Add code
Apr 26, 2026
Viaarxiv icon

Pause or Fabricate? Training Language Models for Grounded Reasoning

Add code
Apr 21, 2026
Viaarxiv icon

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

Add code
Apr 16, 2026
Viaarxiv icon

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

Add code
Apr 15, 2026
Viaarxiv icon

UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization

Add code
Apr 15, 2026
Viaarxiv icon

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

Add code
Apr 09, 2026
Viaarxiv icon

Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training

Add code
Jan 06, 2026
Viaarxiv icon