Picture for Zhehuai Chen

Zhehuai Chen

JarvisBench: Always-on Intelligence Between Humans and Agents

Add code
Aug 14, 2026
Viaarxiv icon

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

Add code
Aug 13, 2026
Viaarxiv icon

Voice Memory for Agentic Speech Recognition

Add code
Jul 29, 2026
Viaarxiv icon

Just A Rather Very Intelligent Spoken Agent

Add code
Jul 18, 2026
Viaarxiv icon

Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning

Add code
Jul 08, 2026
Viaarxiv icon

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Add code
Apr 27, 2026
Viaarxiv icon

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

Add code
Apr 06, 2026
Viaarxiv icon

How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

Add code
Mar 19, 2026
Viaarxiv icon

Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception

Add code
Jan 14, 2026
Viaarxiv icon

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

Add code
Jul 03, 2025
Figure 1 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Figure 2 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Figure 3 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Figure 4 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Viaarxiv icon