Picture for Guihai Chen

Guihai Chen

Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs

Add code
Jul 25, 2026
Viaarxiv icon

C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

Add code
Jul 20, 2026
Viaarxiv icon

CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling

Add code
Jul 20, 2026
Viaarxiv icon

Scalable LLM Agent Tool Access in the Cloud

Add code
Jul 17, 2026
Viaarxiv icon

UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods

Add code
Jul 08, 2026
Viaarxiv icon

Learning to Seek Help: Dynamic Collaboration Between Small and Large Language Models

Add code
Apr 20, 2026
Viaarxiv icon

From Myopic Selection to Long-Horizon Awareness: Sequential LLM Routing for Multi-Turn Dialogue

Add code
Apr 14, 2026
Viaarxiv icon

Optimizing Feature Extraction for On-device Model Inference with User Behavior Sequences

Add code
Mar 23, 2026
Viaarxiv icon

AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization

Add code
Mar 12, 2026
Viaarxiv icon

SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning

Add code
Mar 09, 2026
Viaarxiv icon