Picture for Yijia Fan

Yijia Fan

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

Add code
Aug 14, 2026
Viaarxiv icon

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Add code
Aug 07, 2026
Viaarxiv icon

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

Add code
Aug 05, 2026
Viaarxiv icon

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

Add code
Jun 28, 2026
Viaarxiv icon

Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

Add code
May 12, 2026
Viaarxiv icon

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

Add code
Mar 03, 2026
Viaarxiv icon

Spectral Gating Networks

Add code
Feb 07, 2026
Viaarxiv icon

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems

Add code
Jan 26, 2026
Viaarxiv icon

3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation

Add code
Jan 07, 2026
Viaarxiv icon

FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models

Add code
Dec 23, 2025
Figure 1 for FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
Figure 2 for FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
Figure 3 for FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
Figure 4 for FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
Viaarxiv icon