Picture for Zhongyu Yang

Zhongyu Yang

James

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

Add code
Aug 10, 2026
Viaarxiv icon

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

Add code
Aug 10, 2026
Viaarxiv icon

CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits

Add code
Aug 10, 2026
Viaarxiv icon

Conversational Human Audio-visual Talking Dialogue Generation

Add code
Jul 02, 2026
Viaarxiv icon

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

Add code
May 21, 2026
Viaarxiv icon

Towards Successful Implementation of Automated Raveling Detection: Effects of Training Data Size, Illumination Difference, and Spatial Shift

Add code
Apr 14, 2026
Viaarxiv icon

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

Add code
Apr 06, 2026
Viaarxiv icon

XR: Cross-Modal Agents for Composed Image Retrieval

Add code
Jan 20, 2026
Viaarxiv icon

Deep Learning for Crack Detection: A Review of Learning Paradigms, Generalizability, and Datasets

Add code
Aug 14, 2025
Viaarxiv icon

Pose State Perception of Interventional Robot for Cardio-cerebrovascular Procedures

Add code
Jun 17, 2025
Figure 1 for Pose State Perception of Interventional Robot for Cardio-cerebrovascular Procedures
Figure 2 for Pose State Perception of Interventional Robot for Cardio-cerebrovascular Procedures
Figure 3 for Pose State Perception of Interventional Robot for Cardio-cerebrovascular Procedures
Figure 4 for Pose State Perception of Interventional Robot for Cardio-cerebrovascular Procedures
Viaarxiv icon