Picture for Tiehan Fan

Tiehan Fan

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

Add code
Aug 03, 2026
Viaarxiv icon

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

Add code
Jul 02, 2026
Viaarxiv icon

UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset

Add code
Oct 23, 2025
Figure 1 for UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
Figure 2 for UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
Figure 3 for UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
Figure 4 for UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
Viaarxiv icon

InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption

Add code
Dec 12, 2024
Figure 1 for InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
Figure 2 for InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
Figure 3 for InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
Figure 4 for InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
Viaarxiv icon

OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation

Add code
Jul 02, 2024
Figure 1 for OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
Figure 2 for OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
Figure 3 for OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
Figure 4 for OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
Viaarxiv icon