Picture for Shengtao Wen

Shengtao Wen

VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation

Add code
Aug 16, 2026
Viaarxiv icon

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

Add code
Aug 16, 2026
Viaarxiv icon

MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA

Add code
Aug 09, 2025
Viaarxiv icon