Picture for Yinghui Li

Yinghui Li

Thinking in Video: Can Video Generators Really Reason About the Real World?

Add code
Jul 20, 2026
Viaarxiv icon

TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning

Add code
Jul 16, 2026
Viaarxiv icon

Latent Visual Cache for Video Reasoning

Add code
Jul 01, 2026
Viaarxiv icon

From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI

Add code
Jun 12, 2026
Viaarxiv icon

Toward Native Multimodal Modeling: A Roadmap

Add code
May 25, 2026
Viaarxiv icon

SMASH: Mastering Scalable Whole-Body Skills for Humanoid Ping-Pong with Egocentric Vision

Add code
Apr 01, 2026
Viaarxiv icon

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

Add code
Mar 19, 2026
Viaarxiv icon

Deep Tabular Research via Continual Experience-Driven Execution

Add code
Mar 12, 2026
Viaarxiv icon

EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration

Add code
Feb 10, 2026
Viaarxiv icon

EvoConfig: Self-Evolving Multi-Agent Systems for Efficient Autonomous Environment Configuration

Add code
Jan 23, 2026
Viaarxiv icon