Picture for Zhiwen Mo

Zhiwen Mo

AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding

Add code
Aug 04, 2026
Viaarxiv icon

Deep Kernel Fusion for Transformers

Add code
Feb 12, 2026
Viaarxiv icon

Dynamic Expert Sharing: Decoupling Memory from Parallelism in Mixture-of-Experts Diffusion LLMs

Add code
Jan 31, 2026
Viaarxiv icon

xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations

Add code
Jun 16, 2025
Figure 1 for xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations
Figure 2 for xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations
Figure 3 for xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations
Figure 4 for xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations
Viaarxiv icon

Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling

Add code
May 16, 2025
Viaarxiv icon

TileLang: A Composable Tiled Programming Model for AI Systems

Add code
Apr 24, 2025
Viaarxiv icon

LUT Tensor Core: Lookup Table Enables Efficient Low-Bit LLM Inference Acceleration

Add code
Aug 12, 2024
Viaarxiv icon