Picture for Yanqiao Zhu

Yanqiao Zhu

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

Add code
Jul 30, 2026
Viaarxiv icon

X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System

Add code
Jul 20, 2026
Viaarxiv icon

RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning

Add code
Jul 16, 2026
Viaarxiv icon

GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark

Add code
Jun 27, 2026
Viaarxiv icon

Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

Add code
May 28, 2026
Viaarxiv icon

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

Add code
Apr 14, 2026
Viaarxiv icon

ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

Add code
Feb 25, 2026
Viaarxiv icon

SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

Add code
Jan 14, 2026
Viaarxiv icon

MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Add code
May 19, 2025
Figure 1 for MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
Figure 2 for MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
Figure 3 for MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
Figure 4 for MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
Viaarxiv icon

Large Language Models Are Innate Crystal Structure Generators

Add code
Feb 28, 2025
Figure 1 for Large Language Models Are Innate Crystal Structure Generators
Figure 2 for Large Language Models Are Innate Crystal Structure Generators
Figure 3 for Large Language Models Are Innate Crystal Structure Generators
Figure 4 for Large Language Models Are Innate Crystal Structure Generators
Viaarxiv icon