Picture for Cong Wan

Cong Wan

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

Add code
Jul 14, 2026
Viaarxiv icon

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

Add code
Jun 19, 2026
Viaarxiv icon

Kairos: A Native World Model Stack for Physical AI

Add code
Jun 16, 2026
Viaarxiv icon

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning

Add code
Jun 06, 2026
Viaarxiv icon

ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

Add code
May 25, 2026
Viaarxiv icon

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

Add code
May 11, 2026
Viaarxiv icon

Trajectory-Diversity-Driven Robust Vision-and-Language Navigation

Add code
Mar 16, 2026
Viaarxiv icon

ReMoT: Reinforcement Learning with Motion Contrast Triplets

Add code
Feb 28, 2026
Viaarxiv icon

CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation

Add code
Jul 03, 2025
Viaarxiv icon

GridShow: Omni Visual Generation

Add code
Dec 17, 2024
Viaarxiv icon