Picture for Zhengyang Li

Zhengyang Li

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

Add code
Aug 12, 2026
Viaarxiv icon

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

Add code
Aug 05, 2026
Viaarxiv icon

Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

Add code
Jun 18, 2026
Viaarxiv icon

CASTLE2026 Team WDL Technical Report

Add code
May 30, 2026
Viaarxiv icon

LoViF 2026 The First Challenge on Holistic Quality Assessment for 4D World Model (PhyScore)

Add code
May 06, 2026
Viaarxiv icon

Noise-Robust AV-ASR Using Visual Features Both in the Whisper Encoder and Decoder

Add code
Jan 26, 2026
Viaarxiv icon

OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data

Add code
Sep 18, 2025
Figure 1 for OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data
Figure 2 for OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data
Figure 3 for OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data
Figure 4 for OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data
Viaarxiv icon

MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook

Add code
Sep 17, 2025
Figure 1 for MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
Figure 2 for MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
Figure 3 for MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
Figure 4 for MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
Viaarxiv icon

A Comprehensive Review of Multi-Agent Reinforcement Learning in Video Games

Add code
Sep 03, 2025
Viaarxiv icon

Integrated Snapshot Near-infrared Hypersepctral Imaging Framework with Diffractive Optics

Add code
Aug 20, 2025
Figure 1 for Integrated Snapshot Near-infrared Hypersepctral Imaging Framework with Diffractive Optics
Figure 2 for Integrated Snapshot Near-infrared Hypersepctral Imaging Framework with Diffractive Optics
Figure 3 for Integrated Snapshot Near-infrared Hypersepctral Imaging Framework with Diffractive Optics
Figure 4 for Integrated Snapshot Near-infrared Hypersepctral Imaging Framework with Diffractive Optics
Viaarxiv icon