Picture for Linhao Zhang

Linhao Zhang

Depth-Guided Video Object Counting in Crowded Scenes

Add code
Aug 06, 2026
Viaarxiv icon

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

Add code
Jul 09, 2026
Viaarxiv icon

UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

Add code
May 29, 2026
Viaarxiv icon

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

Add code
May 28, 2026
Viaarxiv icon

Heterogeneous Multi-Agent Modeling for Measurement and Network Analysis of the Data Service Market

Add code
May 22, 2026
Viaarxiv icon

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

Add code
Apr 14, 2026
Viaarxiv icon

WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference

Add code
Dec 28, 2025
Viaarxiv icon

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

Add code
Sep 26, 2025
Figure 1 for StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
Figure 2 for StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
Figure 3 for StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
Figure 4 for StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
Viaarxiv icon

Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving

Add code
Apr 03, 2025
Viaarxiv icon

CodeV: Issue Resolving with Visual Data

Add code
Dec 23, 2024
Figure 1 for CodeV: Issue Resolving with Visual Data
Figure 2 for CodeV: Issue Resolving with Visual Data
Figure 3 for CodeV: Issue Resolving with Visual Data
Figure 4 for CodeV: Issue Resolving with Visual Data
Viaarxiv icon