Picture for Pin Tang

Pin Tang

SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction

Add code
Jul 06, 2026
Viaarxiv icon

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

Add code
Jul 06, 2026
Viaarxiv icon

Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving

Add code
Jul 06, 2026
Viaarxiv icon

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

Add code
Apr 10, 2026
Viaarxiv icon

Learning Vision-Language-Action World Models for Autonomous Driving

Add code
Apr 10, 2026
Viaarxiv icon

LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation

Add code
Dec 23, 2025
Viaarxiv icon

Grounding Everything in Tokens for Multimodal Large Language Models

Add code
Dec 11, 2025
Viaarxiv icon

Enhancing Sampling Protocol for Robust Point Cloud Classification

Add code
Aug 22, 2024
Viaarxiv icon

VEON: Vocabulary-Enhanced Occupancy Prediction

Add code
Jul 17, 2024
Figure 1 for VEON: Vocabulary-Enhanced Occupancy Prediction
Figure 2 for VEON: Vocabulary-Enhanced Occupancy Prediction
Figure 3 for VEON: Vocabulary-Enhanced Occupancy Prediction
Figure 4 for VEON: Vocabulary-Enhanced Occupancy Prediction
Viaarxiv icon

OccGen: Generative Multi-modal 3D Occupancy Prediction for Autonomous Driving

Add code
Apr 23, 2024
Figure 1 for OccGen: Generative Multi-modal 3D Occupancy Prediction for Autonomous Driving
Figure 2 for OccGen: Generative Multi-modal 3D Occupancy Prediction for Autonomous Driving
Figure 3 for OccGen: Generative Multi-modal 3D Occupancy Prediction for Autonomous Driving
Figure 4 for OccGen: Generative Multi-modal 3D Occupancy Prediction for Autonomous Driving
Viaarxiv icon