Picture for Peipei Song

Peipei Song

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

Add code
Jul 30, 2026
Viaarxiv icon

Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset

Add code
Jul 11, 2026
Viaarxiv icon

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

Add code
Jul 03, 2026
Viaarxiv icon

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

Add code
Jun 24, 2026
Viaarxiv icon

A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation

Add code
Apr 21, 2026
Viaarxiv icon

FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning

Add code
Mar 18, 2026
Viaarxiv icon

Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark

Add code
Aug 23, 2025
Viaarxiv icon

Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering

Add code
Apr 15, 2025
Figure 1 for Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
Figure 2 for Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
Figure 3 for Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
Figure 4 for Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
Viaarxiv icon

Linguistics-Vision Monotonic Consistent Network for Sign Language Production

Add code
Dec 22, 2024
Figure 1 for Linguistics-Vision Monotonic Consistent Network for Sign Language Production
Figure 2 for Linguistics-Vision Monotonic Consistent Network for Sign Language Production
Figure 3 for Linguistics-Vision Monotonic Consistent Network for Sign Language Production
Figure 4 for Linguistics-Vision Monotonic Consistent Network for Sign Language Production
Viaarxiv icon

Scene-Text Grounding for Text-Based Video Question Answering

Add code
Sep 22, 2024
Figure 1 for Scene-Text Grounding for Text-Based Video Question Answering
Figure 2 for Scene-Text Grounding for Text-Based Video Question Answering
Figure 3 for Scene-Text Grounding for Text-Based Video Question Answering
Figure 4 for Scene-Text Grounding for Text-Based Video Question Answering
Viaarxiv icon