Picture for Yikang Zhou

Yikang Zhou

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

Add code
Jul 13, 2026
Viaarxiv icon

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

Add code
Jun 30, 2026
Viaarxiv icon

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

Add code
Jun 28, 2026
Viaarxiv icon

World Action Models: The Next Frontier in Embodied AI

Add code
May 12, 2026
Viaarxiv icon

SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track

Add code
Mar 28, 2026
Viaarxiv icon

SAMTok: Representing Any Mask with Two Words

Add code
Jan 22, 2026
Viaarxiv icon

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

Add code
Oct 22, 2025
Viaarxiv icon

Dense360: Dense Understanding from Omnidirectional Panoramas

Add code
Jun 17, 2025
Viaarxiv icon

An Empirical Study of GPT-4o Image Generation Capabilities

Add code
Apr 08, 2025
Figure 1 for An Empirical Study of GPT-4o Image Generation Capabilities
Figure 2 for An Empirical Study of GPT-4o Image Generation Capabilities
Figure 3 for An Empirical Study of GPT-4o Image Generation Capabilities
Figure 4 for An Empirical Study of GPT-4o Image Generation Capabilities
Viaarxiv icon

Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs

Add code
Jan 08, 2025
Figure 1 for Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
Figure 2 for Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
Figure 3 for Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
Figure 4 for Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
Viaarxiv icon