Picture for Ritesh Thawkar

Ritesh Thawkar

How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning?

Add code
Aug 13, 2026
Viaarxiv icon

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

Add code
Aug 10, 2026
Viaarxiv icon

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Add code
Jun 25, 2026
Viaarxiv icon

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

Add code
Jun 25, 2026
Viaarxiv icon

Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device

Add code
Feb 24, 2026
Viaarxiv icon

How Good are Foundation Models in Step-by-Step Embodied Reasoning?

Add code
Sep 18, 2025
Figure 1 for How Good are Foundation Models in Step-by-Step Embodied Reasoning?
Figure 2 for How Good are Foundation Models in Step-by-Step Embodied Reasoning?
Figure 3 for How Good are Foundation Models in Step-by-Step Embodied Reasoning?
Figure 4 for How Good are Foundation Models in Step-by-Step Embodied Reasoning?
Viaarxiv icon

Beyond Simple Edits: Composed Video Retrieval with Dense Modifications

Add code
Aug 19, 2025
Viaarxiv icon

Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs

Add code
May 26, 2025
Figure 1 for Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs
Figure 2 for Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs
Figure 3 for Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs
Figure 4 for Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs
Viaarxiv icon

DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding

Add code
Mar 13, 2025
Figure 1 for DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
Figure 2 for DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
Figure 3 for DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
Figure 4 for DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
Viaarxiv icon

Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts

Add code
Feb 20, 2025
Viaarxiv icon