Picture for Tianjun Pan

Tianjun Pan

Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

Add code
Aug 10, 2026
Viaarxiv icon

Beyond Solution-Centric Search: Adaptive Inquiry and Knowledge Revision for Autonomous ML Engineering

Add code
Aug 03, 2026
Viaarxiv icon

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

Add code
Jul 31, 2026
Viaarxiv icon

OPSDL: On-Policy Self-Distillation for Long-Context Language Models

Add code
Apr 19, 2026
Viaarxiv icon

SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment

Add code
Apr 14, 2026
Viaarxiv icon

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

Add code
Mar 26, 2026
Viaarxiv icon