Picture for Sheng Li

Sheng Li

Peking University

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

Add code
Aug 17, 2026
Viaarxiv icon

Cached LLM Probability Retrieval for Speech Recognition

Add code
Aug 17, 2026
Viaarxiv icon

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

Add code
Aug 03, 2026
Viaarxiv icon

Attention-Steered Vision-Language Models for Sign Language Translation

Add code
Jul 31, 2026
Viaarxiv icon

Occlusion-Point Reuse for Ray-Traced Ambient Occlusion and Shadow

Add code
Jul 25, 2026
Viaarxiv icon

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

Add code
Jul 14, 2026
Viaarxiv icon

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

Add code
Jul 13, 2026
Viaarxiv icon

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

Add code
Jul 13, 2026
Viaarxiv icon

OctaOctree Neural Radiosity for Real-time Glossy Material Rendering

Add code
Jun 07, 2026
Viaarxiv icon

PACT: Proactive Asking for Continual Task Assistance in Human-Robot Collaboration

Add code
May 23, 2026
Viaarxiv icon