Picture for SouYoung Jin

SouYoung Jin

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

Add code
Jul 13, 2026
Viaarxiv icon

Learning Video Dynamics with Predictive Differentiable Rendering

Add code
Jun 30, 2026
Viaarxiv icon

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

Add code
Mar 30, 2026
Viaarxiv icon

Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation

Add code
Mar 16, 2026
Viaarxiv icon

Is Attention All You Need For Actigraphy? Foundation Models of Wearable Accelerometer Data for Mental Health Research

Add code
Nov 26, 2024
Figure 1 for Is Attention All You Need For Actigraphy? Foundation Models of Wearable Accelerometer Data for Mental Health Research
Figure 2 for Is Attention All You Need For Actigraphy? Foundation Models of Wearable Accelerometer Data for Mental Health Research
Figure 3 for Is Attention All You Need For Actigraphy? Foundation Models of Wearable Accelerometer Data for Mental Health Research
Figure 4 for Is Attention All You Need For Actigraphy? Foundation Models of Wearable Accelerometer Data for Mental Health Research
Viaarxiv icon

Multi-layer Learnable Attention Mask for Multimodal Tasks

Add code
Jun 04, 2024
Figure 1 for Multi-layer Learnable Attention Mask for Multimodal Tasks
Figure 2 for Multi-layer Learnable Attention Mask for Multimodal Tasks
Figure 3 for Multi-layer Learnable Attention Mask for Multimodal Tasks
Figure 4 for Multi-layer Learnable Attention Mask for Multimodal Tasks
Viaarxiv icon

FT2TF: First-Person Statement Text-To-Talking Face Generation

Add code
Dec 09, 2023
Figure 1 for FT2TF: First-Person Statement Text-To-Talking Face Generation
Figure 2 for FT2TF: First-Person Statement Text-To-Talking Face Generation
Figure 3 for FT2TF: First-Person Statement Text-To-Talking Face Generation
Figure 4 for FT2TF: First-Person Statement Text-To-Talking Face Generation
Viaarxiv icon

Learning Human Action Recognition Representations Without Real Humans

Add code
Nov 10, 2023
Figure 1 for Learning Human Action Recognition Representations Without Real Humans
Figure 2 for Learning Human Action Recognition Representations Without Real Humans
Figure 3 for Learning Human Action Recognition Representations Without Real Humans
Figure 4 for Learning Human Action Recognition Representations Without Real Humans
Viaarxiv icon

LangNav: Language as a Perceptual Representation for Navigation

Add code
Oct 11, 2023
Figure 1 for LangNav: Language as a Perceptual Representation for Navigation
Figure 2 for LangNav: Language as a Perceptual Representation for Navigation
Figure 3 for LangNav: Language as a Perceptual Representation for Navigation
Figure 4 for LangNav: Language as a Perceptual Representation for Navigation
Viaarxiv icon

Cross-Modal Discrete Representation Learning

Add code
Jun 10, 2021
Figure 1 for Cross-Modal Discrete Representation Learning
Figure 2 for Cross-Modal Discrete Representation Learning
Figure 3 for Cross-Modal Discrete Representation Learning
Figure 4 for Cross-Modal Discrete Representation Learning
Viaarxiv icon