Picture for Sheng Sun

Sheng Sun

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

Add code
Jul 16, 2026
Viaarxiv icon

Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise

Add code
Apr 10, 2026
Viaarxiv icon

Discrete Prototypical Memories for Federated Time Series Foundation Models

Add code
Apr 06, 2026
Viaarxiv icon

Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks

Add code
Feb 09, 2026
Viaarxiv icon

SearchAttack: Red-Teaming LLMs against Real-World Threats via Framing Unsafe Web Information-Seeking Tasks

Add code
Jan 07, 2026
Viaarxiv icon

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

Add code
Jan 06, 2026
Viaarxiv icon

The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning

Add code
Sep 16, 2025
Viaarxiv icon

PoisonSwarm: Universal Harmful Information Synthesis via Model Crowdsourcing

Add code
May 27, 2025
Viaarxiv icon

TransDiffuser: End-to-end Trajectory Generation with Decorrelated Multi-modal Representation for Autonomous Driving

Add code
May 14, 2025
Viaarxiv icon

FNBench: Benchmarking Robust Federated Learning against Noisy Labels

Add code
May 10, 2025
Figure 1 for FNBench: Benchmarking Robust Federated Learning against Noisy Labels
Figure 2 for FNBench: Benchmarking Robust Federated Learning against Noisy Labels
Figure 3 for FNBench: Benchmarking Robust Federated Learning against Noisy Labels
Figure 4 for FNBench: Benchmarking Robust Federated Learning against Noisy Labels
Viaarxiv icon