Picture for Jiayi Zhu

Jiayi Zhu

Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models

Add code
Aug 03, 2026
Viaarxiv icon

CameraAnything: Refilming Videos with Arbitrary Camera Control

Add code
Jul 27, 2026
Viaarxiv icon

Large Language Models Do Not Always Need Readable Language

Add code
Jun 18, 2026
Viaarxiv icon

DataMagic: Transforming Tabular Data into Data Insight Video

Add code
Jun 18, 2026
Viaarxiv icon

Cross-Modal Clinical Knowledge Integration for Mammography Report Generation

Add code
May 29, 2026
Viaarxiv icon

StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding

Add code
Apr 10, 2026
Viaarxiv icon

ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling

Add code
Mar 03, 2026
Viaarxiv icon

Advancing Open-source World Models

Add code
Jan 28, 2026
Viaarxiv icon

Beyond Pixels: Semantic-aware Typographic Attack for Geo-Privacy Protection

Add code
Nov 16, 2025
Viaarxiv icon

Concept Guided Co-saliency Objection Detection

Add code
Dec 21, 2024
Viaarxiv icon