Picture for Yifan Yang

Yifan Yang

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

Add code
Aug 14, 2026
Viaarxiv icon

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

Add code
Aug 11, 2026
Viaarxiv icon

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

Add code
Aug 08, 2026
Viaarxiv icon

When Coordination Becomes a Threat: Communication Attacks in LLM-Controlled Multi-Robot Systems

Add code
Aug 07, 2026
Viaarxiv icon

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

Add code
Aug 06, 2026
Viaarxiv icon

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

Add code
Aug 05, 2026
Viaarxiv icon

DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation

Add code
Aug 01, 2026
Viaarxiv icon

HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation

Add code
Jul 20, 2026
Viaarxiv icon

SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions

Add code
Jul 16, 2026
Viaarxiv icon

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Add code
Jul 15, 2026
Viaarxiv icon