Picture for Wenyong Zhou

Wenyong Zhou

Hybrid-LUT: Channel-Aware Hybrid Lookup Table and Filtering for Efficient Image Denoising

Add code
Aug 12, 2026
Viaarxiv icon

Approximate Speculative Decoding

Add code
Aug 04, 2026
Viaarxiv icon

NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory

Add code
Aug 03, 2026
Viaarxiv icon

Recall Before You Rank: Similarity-Guided Top-$K$ Reuse for Efficient Long-Context Attention

Add code
Jul 30, 2026
Viaarxiv icon

PatchINR: Patch-Based Implicit Neural Representations for Efficient and Scalable Inference

Add code
Jun 24, 2026
Viaarxiv icon

ROMER: Expert Replacement and Router Calibration for Robust MoE LLMs on Analog Compute-in-Memory Systems

Add code
May 12, 2026
Viaarxiv icon

Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality

Add code
Mar 14, 2026
Viaarxiv icon

Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators

Add code
Aug 29, 2025
Figure 1 for Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
Figure 2 for Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
Figure 3 for Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
Figure 4 for Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
Viaarxiv icon

QuadINR: Hardware-Efficient Implicit Neural Representations Through Quadratic Activation

Add code
Aug 20, 2025
Viaarxiv icon

HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture

Add code
Feb 27, 2025
Figure 1 for HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture
Figure 2 for HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture
Figure 3 for HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture
Figure 4 for HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture
Viaarxiv icon