Picture for Yuxuan Lu

Yuxuan Lu

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

Add code
Aug 02, 2026
Viaarxiv icon

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

Add code
Jul 23, 2026
Viaarxiv icon

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

Add code
Jul 07, 2026
Viaarxiv icon

SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

Add code
Jun 11, 2026
Viaarxiv icon

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

Add code
Jun 04, 2026
Viaarxiv icon

CollabSim: A CSCW-Grounded Methodology for Investigating Collaborative Competence of LLM Agents through Controlled Multi-Agent Experiments

Add code
Jun 04, 2026
Viaarxiv icon

Jailbreaking LLMs via Calibration

Add code
Jan 31, 2026
Viaarxiv icon

Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents

Add code
Jan 28, 2026
Viaarxiv icon

See, Think, Act: Online Shopper Behavior Simulation with VLM Agents

Add code
Oct 22, 2025
Viaarxiv icon

DPRF: A Generalizable Dynamic Persona Refinement Framework for Optimizing Behavior Alignment Between Personalized LLM Role-Playing Agents and Humans

Add code
Oct 16, 2025
Viaarxiv icon