Picture for Minnan Luo

Minnan Luo

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

Add code
Aug 10, 2026
Viaarxiv icon

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

Add code
Aug 07, 2026
Viaarxiv icon

Controlled Dynamics Attractor Transformer

Add code
Jun 13, 2026
Viaarxiv icon

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Add code
Jun 09, 2026
Viaarxiv icon

OmniTryOn: Video Try-On Anything at Once!

Add code
Jun 07, 2026
Viaarxiv icon

The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation

Add code
Jun 02, 2026
Viaarxiv icon

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

Add code
Mar 26, 2026
Viaarxiv icon

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

Add code
Mar 22, 2026
Viaarxiv icon

Memory-guided Prototypical Co-occurrence Learning for Mixed Emotion Recognition

Add code
Feb 24, 2026
Viaarxiv icon

Flow-Factory: A Unified Framework for Reinforcement Learning in Flow-Matching Models

Add code
Feb 13, 2026
Viaarxiv icon