Picture for Jie Tan

Jie Tan

MLUBench: A Benchmark for Lifelong Unlearning Evaluation in MLLMs

Add code
Jun 11, 2026
Viaarxiv icon

What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents

Add code
Jun 09, 2026
Viaarxiv icon

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

Add code
Jun 06, 2026
Viaarxiv icon

How Far Are Video Models from True Multimodal Reasoning?

Add code
Apr 21, 2026
Viaarxiv icon

TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents

Add code
Jan 06, 2026
Viaarxiv icon

Evaluating Gemini Robotics Policies in a Veo World Simulator

Add code
Dec 11, 2025
Viaarxiv icon

Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning

Add code
Jun 08, 2025
Figure 1 for Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
Figure 2 for Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
Figure 3 for Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
Figure 4 for Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
Viaarxiv icon

LocoTouch: Learning Dexterous Quadrupedal Transport with Tactile Sensing

Add code
May 29, 2025
Viaarxiv icon

Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models

Add code
Apr 17, 2025
Viaarxiv icon

Gemini Robotics: Bringing AI into the Physical World

Add code
Mar 25, 2025
Viaarxiv icon