Picture for Ufaq Khan

Ufaq Khan

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

Add code
Aug 14, 2026
Viaarxiv icon

An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering

Add code
Jul 13, 2026
Viaarxiv icon

PolyAlign: Conditional Human-Distribution Alignment

Add code
Jun 11, 2026
Viaarxiv icon

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

Add code
Jun 08, 2026
Viaarxiv icon

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

Add code
May 25, 2026
Viaarxiv icon

PathWISE: Multi-Agent Cancer Pathway Triaging Ontology Learning from Clinical Flowcharts

Add code
May 25, 2026
Viaarxiv icon

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

Add code
May 25, 2026
Viaarxiv icon

MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage

Add code
Mar 24, 2026
Viaarxiv icon

WorldCache: Content-Aware Caching for Accelerated Video World Models

Add code
Mar 23, 2026
Viaarxiv icon

AURORA: Adaptive Unified Representation for Robust Ultrasound Analysis

Add code
Mar 19, 2026
Viaarxiv icon