Picture for Bingxiang He

Bingxiang He

May

MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement

Add code
Aug 14, 2026
Viaarxiv icon

PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

Add code
Aug 14, 2026
Viaarxiv icon

Weak-to-Strong Generalization via Direct On-Policy Distillation

Add code
Jul 06, 2026
Viaarxiv icon

Scalable Behaviour Cloning on Browser Using via Skill Distillation

Add code
Jun 30, 2026
Viaarxiv icon

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

Add code
Jun 23, 2026
Viaarxiv icon

MA-ProofBench: A Two-Tiered Evaluation of LLMs for Theorem Proving in Mathematical Analysis

Add code
Jun 11, 2026
Viaarxiv icon

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

Add code
Apr 14, 2026
Viaarxiv icon

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

Add code
Apr 14, 2026
Viaarxiv icon

How Far Can Unsupervised RLVR Scale LLM Training?

Add code
Mar 09, 2026
Viaarxiv icon

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

Add code
Feb 03, 2026
Viaarxiv icon