Picture for Haiwen Diao

Haiwen Diao

Vision as Unified Multimodal Generation

Add code
Jul 07, 2026
Viaarxiv icon

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

Add code
Jun 30, 2026
Viaarxiv icon

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

Add code
Jun 16, 2026
Viaarxiv icon

From Pixels to Words -- Towards Native One-Vision Models at Scale

Add code
May 27, 2026
Viaarxiv icon

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

Add code
May 12, 2026
Viaarxiv icon

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

Add code
Feb 04, 2026
Viaarxiv icon

DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation

Add code
Jan 29, 2026
Viaarxiv icon

The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding

Add code
Dec 22, 2025
Viaarxiv icon

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

Add code
Oct 16, 2025
Viaarxiv icon

Regularizing Subspace Redundancy of Low-Rank Adaptation

Add code
Jul 28, 2025
Figure 1 for Regularizing Subspace Redundancy of Low-Rank Adaptation
Figure 2 for Regularizing Subspace Redundancy of Low-Rank Adaptation
Figure 3 for Regularizing Subspace Redundancy of Low-Rank Adaptation
Figure 4 for Regularizing Subspace Redundancy of Low-Rank Adaptation
Viaarxiv icon