Picture for Chengsong Huang

Chengsong Huang

EnvHarness: Awakening Static Worlds for Agent Learning

Add code
Aug 20, 2026
Viaarxiv icon

Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling

Add code
Jun 02, 2026
Viaarxiv icon

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

Add code
May 20, 2026
Viaarxiv icon

G-Zero: Self-Play for Open-Ended Generation from Zero Data

Add code
May 11, 2026
Viaarxiv icon

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

Add code
Mar 10, 2026
Viaarxiv icon

Training Data Efficiency in Multimodal Process Reward Models

Add code
Feb 05, 2026
Viaarxiv icon

Parallel-Probe: Towards Efficient Parallel Thinking via 2D Probing

Add code
Feb 03, 2026
Viaarxiv icon

Rethinking the Reranker: Boundary-Aware Evidence Selection for Robust Retrieval-Augmented Generation

Add code
Feb 03, 2026
Viaarxiv icon

TTCS: Test-Time Curriculum Synthesis for Self-Evolving

Add code
Jan 30, 2026
Viaarxiv icon

MoCo: A One-Stop Shop for Model Collaboration Research

Add code
Jan 29, 2026
Viaarxiv icon