Picture for He Guan

He Guan

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

Add code
Aug 05, 2026
Viaarxiv icon

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

Add code
Jul 14, 2026
Viaarxiv icon

CityGaussian: Real-time High-quality Large-Scale Scene Rendering with Gaussians

Add code
Apr 07, 2024
Figure 1 for CityGaussian: Real-time High-quality Large-Scale Scene Rendering with Gaussians
Figure 2 for CityGaussian: Real-time High-quality Large-Scale Scene Rendering with Gaussians
Figure 3 for CityGaussian: Real-time High-quality Large-Scale Scene Rendering with Gaussians
Figure 4 for CityGaussian: Real-time High-quality Large-Scale Scene Rendering with Gaussians
Viaarxiv icon

Rethink ReLU to Training Better CNNs

Add code
Aug 31, 2018
Figure 1 for Rethink ReLU to Training Better CNNs
Figure 2 for Rethink ReLU to Training Better CNNs
Figure 3 for Rethink ReLU to Training Better CNNs
Figure 4 for Rethink ReLU to Training Better CNNs
Viaarxiv icon

Integrating both Visual and Audio Cues for Enhanced Video Caption

Add code
Dec 09, 2017
Figure 1 for Integrating both Visual and Audio Cues for Enhanced Video Caption
Figure 2 for Integrating both Visual and Audio Cues for Enhanced Video Caption
Figure 3 for Integrating both Visual and Audio Cues for Enhanced Video Caption
Figure 4 for Integrating both Visual and Audio Cues for Enhanced Video Caption
Viaarxiv icon

CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation

Add code
Dec 09, 2017
Figure 1 for CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation
Figure 2 for CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation
Figure 3 for CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation
Figure 4 for CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation
Viaarxiv icon