Picture for Naveed Akhtar

Naveed Akhtar

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

Add code
Aug 11, 2026
Viaarxiv icon

InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation

Add code
Jul 21, 2026
Viaarxiv icon

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

Add code
Jul 20, 2026
Viaarxiv icon

Introspective Attention Modulation for Safe Text-to-Image Generation

Add code
Jul 16, 2026
Viaarxiv icon

LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning

Add code
Jul 03, 2026
Viaarxiv icon

Beyond Pixel Diffs: Benchmarking Image Change Captioning for Web UI Visual Regression Testing

Add code
Jul 02, 2026
Viaarxiv icon

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

Add code
Jun 29, 2026
Viaarxiv icon

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

Add code
Jun 25, 2026
Viaarxiv icon

$S^{2}$-FracMix: Label-Preserving Self-Saliency Mixup Augmentation

Add code
Jun 24, 2026
Viaarxiv icon

Symmetry-Aware 9D Pose Estimation with Sim(3)-Consistent Feature and Spherical Inception Convolution

Add code
Jun 01, 2026
Viaarxiv icon