Picture for Fangxin Liu

Fangxin Liu

Shanghai Jiao Tong University

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Add code
Aug 05, 2026
Viaarxiv icon

DeGS: A Scalable 3DGS Architecture via Decoupled Workload Parsing and Reorganization

Add code
Aug 03, 2026
Viaarxiv icon

Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

Add code
Aug 03, 2026
Viaarxiv icon

TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

Add code
Aug 01, 2026
Viaarxiv icon

CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding

Add code
Aug 01, 2026
Viaarxiv icon

From Craft to Kernel: A Governance-First Execution Architecture and Semantic ISA for Agentic Computers

Add code
Apr 20, 2026
Viaarxiv icon

Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference

Add code
Apr 15, 2026
Viaarxiv icon

HyperOffload: Graph-Driven Hierarchical Memory Management for Large Language Models on SuperNode Architectures

Add code
Feb 03, 2026
Viaarxiv icon

SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization

Add code
Nov 11, 2025
Figure 1 for SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
Figure 2 for SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
Figure 3 for SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
Figure 4 for SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
Viaarxiv icon

QUARK: Quantization-Enabled Circuit Sharing for Transformer Acceleration by Exploiting Common Patterns in Nonlinear Operations

Add code
Nov 10, 2025
Viaarxiv icon