Picture for Yifei Shen

Yifei Shen

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

Add code
Aug 14, 2026
Viaarxiv icon

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Add code
Aug 07, 2026
Viaarxiv icon

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

Add code
Aug 05, 2026
Viaarxiv icon

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Add code
Jul 27, 2026
Viaarxiv icon

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Add code
Jul 21, 2026
Viaarxiv icon

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

Add code
Jul 03, 2026
Viaarxiv icon

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

Add code
May 25, 2026
Viaarxiv icon

SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

Add code
Mar 24, 2026
Viaarxiv icon

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

Add code
Mar 03, 2026
Viaarxiv icon

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

Add code
Feb 09, 2026
Viaarxiv icon