Picture for Alex Jinpeng Wang

Alex Jinpeng Wang

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

Add code
Jul 29, 2026
Viaarxiv icon

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

Add code
Jul 17, 2026
Viaarxiv icon

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

Add code
Jun 30, 2026
Viaarxiv icon

VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

Add code
Jun 24, 2026
Viaarxiv icon

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

Add code
Jun 18, 2026
Viaarxiv icon

TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering

Add code
Apr 27, 2026
Viaarxiv icon

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

Add code
Apr 24, 2026
Viaarxiv icon

FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching

Add code
Apr 08, 2026
Viaarxiv icon

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

Add code
Feb 10, 2026
Viaarxiv icon

MIND: Benchmarking Memory Consistency and Action Control in World Models

Add code
Feb 08, 2026
Viaarxiv icon