Picture for Fengxiang Wang

Fengxiang Wang

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

Add code
Jul 30, 2026
Viaarxiv icon

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

Add code
Jul 28, 2026
Viaarxiv icon

MBTI: A Multi-Branch Efficient Fine-Tuning Framework for Hyperspectral Image Classification with Foundation Models

Add code
Jul 14, 2026
Viaarxiv icon

LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization

Add code
Jun 09, 2026
Viaarxiv icon

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

Add code
May 25, 2026
Viaarxiv icon

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

Add code
May 18, 2026
Viaarxiv icon

Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding

Add code
Apr 13, 2026
Viaarxiv icon

VA-FastNavi-MARL: Real-Time Robot Control with Multimedia-Driven Meta-Reinforcement Learning

Add code
Apr 05, 2026
Viaarxiv icon

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

Add code
Apr 01, 2026
Viaarxiv icon

MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

Add code
Mar 09, 2026
Viaarxiv icon