Picture for Qixun Wang

Qixun Wang

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

Add code
Aug 05, 2026
Viaarxiv icon

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

Add code
Aug 04, 2026
Viaarxiv icon

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Add code
Jul 30, 2026
Viaarxiv icon

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

Add code
Jul 30, 2026
Viaarxiv icon

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

Add code
Jul 15, 2026
Viaarxiv icon

Diagnosing Visual Ignorance in Vision-Language Models

Add code
Jun 05, 2026
Viaarxiv icon

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

Add code
May 25, 2026
Viaarxiv icon

Semantic-Enriched Latent Visual Reasoning

Add code
May 19, 2026
Viaarxiv icon

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

Add code
May 18, 2026
Viaarxiv icon

PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting

Add code
Sep 04, 2025
Viaarxiv icon