Picture for Yanxuan Yu

Yanxuan Yu

HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers

Add code
Aug 11, 2026
Viaarxiv icon

RUBRIC: Realism--Utility Balanced Ranking for Imbalanced Classification

Add code
Jul 10, 2026
Viaarxiv icon

OLIVE: Online Low-Rank Incremental Learning for Efficient Adaptive Exoskeletons

Add code
Jun 03, 2026
Viaarxiv icon

Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching

Add code
Apr 24, 2026
Viaarxiv icon

MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning

Add code
Mar 21, 2026
Viaarxiv icon

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

Add code
Feb 13, 2026
Viaarxiv icon

CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving

Add code
Dec 11, 2025
Figure 1 for CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving
Figure 2 for CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving
Figure 3 for CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving
Figure 4 for CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving
Viaarxiv icon

$π$-Attention: Periodic Sparse Transformers for Efficient Long-Context Modeling

Add code
Nov 12, 2025
Viaarxiv icon

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling

Add code
Aug 21, 2025
Figure 1 for SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling
Figure 2 for SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling
Figure 3 for SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling
Figure 4 for SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling
Viaarxiv icon

FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation

Add code
May 26, 2025
Viaarxiv icon