Picture for Max

Max

Xiangjun

Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval

Add code
Jul 01, 2026
Viaarxiv icon

Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput

Add code
Nov 13, 2025
Figure 1 for Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
Figure 2 for Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
Figure 3 for Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
Viaarxiv icon