Picture for Zhixi Cai

Zhixi Cai

MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

Add code
Jul 14, 2026
Viaarxiv icon

A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

Add code
Jul 14, 2026
Viaarxiv icon

What We Talk About When We Talk About LLM Planning: Evidence for Two Distinct Planning Abilities

Add code
Jul 13, 2026
Viaarxiv icon

SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition

Add code
May 03, 2026
Viaarxiv icon

VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations

Add code
Mar 17, 2026
Viaarxiv icon

MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning

Add code
Jan 27, 2026
Viaarxiv icon

DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors

Add code
Dec 24, 2025
Figure 1 for DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors
Figure 2 for DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors
Figure 3 for DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors
Figure 4 for DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors
Viaarxiv icon

Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video

Add code
Nov 13, 2025
Figure 1 for Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video
Figure 2 for Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video
Figure 3 for Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video
Figure 4 for Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video
Viaarxiv icon

Explain Before You Answer: A Survey on Compositional Visual Reasoning

Add code
Aug 24, 2025
Figure 1 for Explain Before You Answer: A Survey on Compositional Visual Reasoning
Figure 2 for Explain Before You Answer: A Survey on Compositional Visual Reasoning
Figure 3 for Explain Before You Answer: A Survey on Compositional Visual Reasoning
Figure 4 for Explain Before You Answer: A Survey on Compositional Visual Reasoning
Viaarxiv icon

JRDB-Reasoning: A Difficulty-Graded Benchmark for Visual Reasoning in Robotics

Add code
Aug 14, 2025
Viaarxiv icon