Picture for Kaichen Zhang

Kaichen Zhang

StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding

Add code
Aug 17, 2026
Viaarxiv icon

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

Add code
Aug 09, 2026
Viaarxiv icon

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Add code
Jul 27, 2026
Viaarxiv icon

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Add code
Jul 21, 2026
Viaarxiv icon

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

Add code
May 25, 2026
Viaarxiv icon

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

Add code
May 21, 2026
Viaarxiv icon

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

Add code
May 13, 2026
Viaarxiv icon

Streaming Multi-agent Pathfinding

Add code
May 14, 2025
Viaarxiv icon

GVPO: Group Variance Policy Optimization for Large Language Model Post-Training

Add code
Apr 28, 2025
Figure 1 for GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
Figure 2 for GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
Figure 3 for GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
Viaarxiv icon

Large Multi-modal Models Can Interpret Features in Large Multi-modal Models

Add code
Nov 22, 2024
Figure 1 for Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
Figure 2 for Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
Figure 3 for Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
Figure 4 for Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
Viaarxiv icon