Picture for Jiwen Zhang

Jiwen Zhang

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

Add code
Jul 04, 2026
Viaarxiv icon

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

Add code
Jun 30, 2026
Viaarxiv icon

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

Add code
Jun 13, 2026
Viaarxiv icon

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

Add code
Jun 09, 2026
Viaarxiv icon

SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation

Add code
Mar 27, 2026
Viaarxiv icon

MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution

Add code
Jan 27, 2026
Viaarxiv icon

A Graph Prompt Fine-Tuning Method for WSN Spatio-Temporal Correlation Anomaly Detection

Add code
Jan 19, 2026
Viaarxiv icon

SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation

Add code
Jan 11, 2026
Viaarxiv icon

A robust and compliant robotic assembly control strategy for batch precision assembly task with uncertain fit types and fit amounts

Add code
Aug 17, 2025
Viaarxiv icon

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs

Add code
May 27, 2025
Viaarxiv icon