Picture for Guanghua Yu

Guanghua Yu

FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

Add code
Aug 03, 2026
Viaarxiv icon

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

Add code
Jul 29, 2026
Viaarxiv icon

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

Add code
Jul 28, 2026
Viaarxiv icon

PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention

Add code
Jul 27, 2026
Viaarxiv icon

D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding

Add code
Jul 16, 2026
Viaarxiv icon

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

Add code
Jul 06, 2026
Viaarxiv icon

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

Add code
Jun 01, 2026
Viaarxiv icon

Hy-MT2: A Family of Fast, Efficient and Powerful Multilingual Translation Models in the Wild

Add code
May 21, 2026
Viaarxiv icon

SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

Add code
May 12, 2026
Viaarxiv icon

IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs

Add code
Feb 10, 2026
Viaarxiv icon