Picture for Linjun Li

Linjun Li

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

Add code
Aug 09, 2026
Viaarxiv icon

Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

Add code
Jul 23, 2026
Viaarxiv icon

One-step lowest-variance selection in a Gaussian random-field model motivated by masked diffusion: Total correlation and a square root collision threshold

Add code
Jul 20, 2026
Viaarxiv icon

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

Add code
Apr 15, 2026
Viaarxiv icon

Towards Realistic 3D Emission Materials: Dataset, Baseline, and Evaluation for Emission Texture Generation

Add code
Apr 13, 2026
Viaarxiv icon

OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios

Add code
Jan 02, 2025
Figure 1 for OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
Figure 2 for OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
Figure 3 for OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
Figure 4 for OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
Viaarxiv icon

EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration

Add code
Jun 20, 2024
Figure 1 for EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration
Figure 2 for EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration
Figure 3 for EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration
Figure 4 for EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration
Viaarxiv icon

TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation

Add code
Dec 23, 2023
Figure 1 for TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
Figure 2 for TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
Figure 3 for TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
Figure 4 for TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
Viaarxiv icon

3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding

Add code
Jul 25, 2023
Figure 1 for 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding
Figure 2 for 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding
Figure 3 for 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding
Figure 4 for 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding
Viaarxiv icon

Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding

Add code
Jul 18, 2023
Figure 1 for Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding
Figure 2 for Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding
Figure 3 for Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding
Figure 4 for Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding
Viaarxiv icon