Picture for Yunhao Ge

Yunhao Ge

RoboTTT: Context Scaling for Robot Policies

Add code
Jul 16, 2026
Viaarxiv icon

Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation

Add code
May 19, 2026
Viaarxiv icon

VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning

Add code
Mar 15, 2026
Viaarxiv icon

World Action Models are Zero-shot Policies

Add code
Feb 17, 2026
Viaarxiv icon

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Add code
Jan 22, 2026
Viaarxiv icon

I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners

Add code
Dec 15, 2025
Figure 1 for I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
Figure 2 for I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
Figure 3 for I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
Figure 4 for I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
Viaarxiv icon

Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation

Add code
May 05, 2025
Viaarxiv icon

Describe Anything: Detailed Localized Image and Video Captioning

Add code
Apr 22, 2025
Viaarxiv icon

Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control

Add code
Mar 18, 2025
Viaarxiv icon

Cosmos World Foundation Model Platform for Physical AI

Add code
Jan 07, 2025
Figure 1 for Cosmos World Foundation Model Platform for Physical AI
Figure 2 for Cosmos World Foundation Model Platform for Physical AI
Figure 3 for Cosmos World Foundation Model Platform for Physical AI
Figure 4 for Cosmos World Foundation Model Platform for Physical AI
Viaarxiv icon