Picture for Xiaoxi Jiang

Xiaoxi Jiang

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

Add code
Aug 04, 2026
Viaarxiv icon

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

Add code
Jul 24, 2026
Viaarxiv icon

From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

Add code
Jul 07, 2026
Viaarxiv icon

Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

Add code
Jun 29, 2026
Viaarxiv icon

PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

Add code
Jun 24, 2026
Viaarxiv icon

A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine

Add code
Jun 17, 2026
Viaarxiv icon

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

Add code
Jun 15, 2026
Viaarxiv icon

Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

Add code
Jun 02, 2026
Viaarxiv icon

Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

Add code
May 12, 2026
Viaarxiv icon

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

Add code
Mar 31, 2026
Viaarxiv icon