Picture for Hao Yang

Hao Yang

PosterText: Towards Unified Visual Text Generation and Editing for E-commerce Poster

Add code
Aug 18, 2026
Viaarxiv icon

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

Add code
Aug 17, 2026
Viaarxiv icon

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

Add code
Jul 27, 2026
Viaarxiv icon

Kimi K3: Open Frontier Intelligence

Add code
Jul 27, 2026
Viaarxiv icon

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

Add code
Jul 27, 2026
Viaarxiv icon

Offline-Online Curriculum RL for Multimodal Reasoning

Add code
Jul 26, 2026
Viaarxiv icon

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

Add code
Jul 24, 2026
Viaarxiv icon

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

Add code
Jul 24, 2026
Viaarxiv icon

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

Add code
Jul 16, 2026
Viaarxiv icon

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

Add code
Jul 15, 2026
Viaarxiv icon