Picture for Zhiheng Liu

Zhiheng Liu

Kimi K3: Open Frontier Intelligence

Add code
Jul 27, 2026
Viaarxiv icon

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

Add code
Jul 15, 2026
Viaarxiv icon

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

Add code
Jun 26, 2026
Viaarxiv icon

WavFlow: Audio Generation in Waveform Space

Add code
May 18, 2026
Viaarxiv icon

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

Add code
Apr 27, 2026
Viaarxiv icon

EvA: An Evidence-First Audio Understanding Paradigm for LALMs

Add code
Mar 29, 2026
Viaarxiv icon

See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation

Add code
Mar 10, 2026
Viaarxiv icon

VecGlypher: Unified Vector Glyph Generation with Language Models

Add code
Feb 25, 2026
Viaarxiv icon

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

Add code
Dec 24, 2025
Figure 1 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Figure 2 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Figure 3 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Figure 4 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Viaarxiv icon

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

Add code
Dec 08, 2025
Figure 1 for OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
Figure 2 for OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
Figure 3 for OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
Figure 4 for OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
Viaarxiv icon