Picture for Lei Yi

Lei Yi

HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction

Add code
Aug 18, 2026
Viaarxiv icon

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

Add code
Aug 07, 2026
Viaarxiv icon

ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning

Add code
May 25, 2025
Viaarxiv icon

CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models

Add code
Dec 22, 2024
Figure 1 for CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
Figure 2 for CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
Figure 3 for CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
Figure 4 for CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
Viaarxiv icon

Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples

Add code
Dec 13, 2024
Figure 1 for Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples
Figure 2 for Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples
Figure 3 for Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples
Figure 4 for Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples
Viaarxiv icon