Picture for Junbo Wang

Junbo Wang

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

Add code
Aug 11, 2026
Viaarxiv icon

Tree-of-Experience: Hierarchical Experience Management for Self-Evolving Agents

Add code
Aug 10, 2026
Viaarxiv icon

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

Add code
Aug 04, 2026
Viaarxiv icon

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

Add code
Jul 31, 2026
Viaarxiv icon

Tree-of-Experience: A Structured Experience-Management Solution for Self-Evolving Agents under Low-Repetition and Implicit-Reward Environments

Add code
Jun 05, 2026
Viaarxiv icon

Joint Design of Doppler-Resilient Unimodular Discrete-Phase Waveforms and Receiving Filters for MIMO Radars

Add code
Apr 28, 2026
Viaarxiv icon

EPIR: An Efficient Patch Tokenization, Integration and Representation Framework for Micro-expression Recognition

Add code
Apr 09, 2026
Viaarxiv icon

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

Add code
Apr 09, 2026
Viaarxiv icon

KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering

Add code
Apr 01, 2026
Viaarxiv icon

SDD-YOLO: A Small-Target Detection Framework for Ground-to-Air Anti-UAV Surveillance with Edge-Efficient Deployment

Add code
Mar 26, 2026
Viaarxiv icon