Picture for Jiawei Gu

Jiawei Gu

HumanCLAW: Can Vision-Language Models Act Through a Body?

Add code
Jul 29, 2026
Viaarxiv icon

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

Add code
Jul 04, 2026
Viaarxiv icon

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

Add code
Jun 11, 2026
Viaarxiv icon

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

Add code
Apr 26, 2026
Viaarxiv icon

Gym-V: A Unified Vision Environment System for Agentic Vision Research

Add code
Mar 17, 2026
Viaarxiv icon

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

Add code
Jan 26, 2026
Viaarxiv icon

ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

Add code
Oct 30, 2025
Figure 1 for ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
Figure 2 for ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
Figure 3 for ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
Figure 4 for ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
Viaarxiv icon

Gradient Short-Circuit: Efficient Out-of-Distribution Detection via Feature Intervention

Add code
Jul 02, 2025
Viaarxiv icon

Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations

Add code
Jun 05, 2025
Viaarxiv icon

FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow

Add code
May 26, 2025
Viaarxiv icon