Picture for Rui Sheng

Rui Sheng

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

Add code
Aug 05, 2026
Viaarxiv icon

TACT: Taxonomy-Aligned Post-Training for Pedagogically Adaptive English Tutoring

Add code
Aug 04, 2026
Viaarxiv icon

Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

Add code
Jul 29, 2026
Viaarxiv icon

Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

Add code
Jul 13, 2026
Viaarxiv icon

WILDTRACE: Benchmarking Natural Evidence Trails in Long-Context Reasoning

Add code
Jul 10, 2026
Viaarxiv icon

Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows

Add code
May 14, 2026
Viaarxiv icon

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

Add code
May 07, 2026
Viaarxiv icon

VeriLLMed: Interactive Visual Debugging of Medical Large Language Models with Knowledge Graphs

Add code
Apr 25, 2026
Viaarxiv icon

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

Add code
Mar 30, 2026
Viaarxiv icon

MedKGI: Iterative Differential Diagnosis with Medical Knowledge Graphs and Information-Guided Inquiring

Add code
Dec 30, 2025
Viaarxiv icon