Picture for Jingdong Chen

Jingdong Chen

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

Add code
Jun 27, 2026
Viaarxiv icon

WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

Add code
Jun 25, 2026
Viaarxiv icon

Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming

Add code
Jun 23, 2026
Viaarxiv icon

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

Add code
Jun 23, 2026
Viaarxiv icon

GraphPO: Graph-based Policy Optimization for Reasoning Models

Add code
Jun 17, 2026
Viaarxiv icon

SPRI: SVD-Partitioned Residual Initialization for Data-Constrained MoE Upcycling

Add code
Jun 15, 2026
Viaarxiv icon

Selecting Samples on Graphs: A Unified Dataset Pruning Framework for Lossless Training Acceleration

Add code
Jun 11, 2026
Viaarxiv icon

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

Add code
Jun 05, 2026
Viaarxiv icon

The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?

Add code
May 10, 2026
Viaarxiv icon

VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

Add code
Apr 11, 2026
Viaarxiv icon