Picture for Wentao Yang

Wentao Yang

DGA$_2$D: Directed Graph-Guided Automated Algorithm Design with Large Language Models

Add code
Aug 01, 2026
Viaarxiv icon

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

Add code
Jul 30, 2026
Viaarxiv icon

Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation

Add code
Jul 13, 2026
Viaarxiv icon

iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models

Add code
May 19, 2026
Viaarxiv icon

RS-Claw: Progressive Active Tool Exploration via Hierarchical Skill Trees for Remote Sensing Agents

Add code
May 13, 2026
Viaarxiv icon

SuperFace: Preference-Aligned Facial Expression Estimation Beyond Pseudo Supervision

Add code
May 07, 2026
Viaarxiv icon

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

Add code
Apr 15, 2026
Viaarxiv icon

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

Add code
Mar 16, 2026
Viaarxiv icon

DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming

Add code
Jun 27, 2024
Figure 1 for DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
Figure 2 for DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
Figure 3 for DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
Figure 4 for DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
Viaarxiv icon

Hierarchical Side-Tuning for Vision Transformers

Add code
Oct 10, 2023
Figure 1 for Hierarchical Side-Tuning for Vision Transformers
Figure 2 for Hierarchical Side-Tuning for Vision Transformers
Figure 3 for Hierarchical Side-Tuning for Vision Transformers
Figure 4 for Hierarchical Side-Tuning for Vision Transformers
Viaarxiv icon