Picture for Quan Kong

Quan Kong

Woven by Toyota, Inc., Tokyo, Japan

The 10th AI City Challenge

Add code
Aug 17, 2026
Viaarxiv icon

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

Add code
Jun 19, 2026
Viaarxiv icon

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

Add code
Jun 02, 2026
Viaarxiv icon

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

Add code
May 22, 2026
Viaarxiv icon

Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding

Add code
May 19, 2026
Viaarxiv icon

InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding

Add code
Apr 09, 2026
Viaarxiv icon

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

Add code
Mar 23, 2026
Viaarxiv icon

Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training

Add code
Feb 28, 2026
Viaarxiv icon

TrajTok: Learning Trajectory Tokens enables better Video Understanding

Add code
Feb 26, 2026
Viaarxiv icon

Mixture of Experts Guided by Gaussian Splatters Matters: A new Approach to Weakly-Supervised Video Anomaly Detection

Add code
Aug 08, 2025
Viaarxiv icon