Picture for Chaoyou Fu

Chaoyou Fu

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

Add code
Jul 06, 2026
Viaarxiv icon

EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory

Add code
Jun 25, 2026
Viaarxiv icon

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

Add code
Jun 12, 2026
Viaarxiv icon

SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation

Add code
Apr 22, 2026
Viaarxiv icon

Tango: Taming Visual Signals for Efficient Video Large Language Models

Add code
Apr 13, 2026
Viaarxiv icon

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

Add code
Apr 10, 2026
Viaarxiv icon

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

Add code
Apr 06, 2026
Viaarxiv icon

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Add code
Apr 03, 2026
Viaarxiv icon

Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

Add code
Mar 31, 2026
Viaarxiv icon

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

Add code
Mar 23, 2026
Viaarxiv icon