Picture for Minghe Gao

Minghe Gao

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

Add code
Jul 06, 2026
Viaarxiv icon

SCOPE: Evolving Symbolic World for Planning in Open-Ended Environments

Add code
Jun 21, 2026
Viaarxiv icon

What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities

Add code
Jun 10, 2025
Figure 1 for What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
Figure 2 for What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
Figure 3 for What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
Figure 4 for What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
Viaarxiv icon

On Path to Multimodal Generalist: General-Level and General-Bench

Add code
May 07, 2025
Viaarxiv icon

Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program

Add code
Apr 09, 2025
Figure 1 for Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
Figure 2 for Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
Figure 3 for Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
Figure 4 for Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
Viaarxiv icon

Boosting Virtual Agent Learning and Reasoning: A Step-wise, Multi-dimensional, and Generalist Reward Model with Benchmark

Add code
Mar 24, 2025
Viaarxiv icon

Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining

Add code
Dec 13, 2024
Figure 1 for Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
Figure 2 for Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
Figure 3 for Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
Figure 4 for Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
Viaarxiv icon

STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training

Add code
Nov 29, 2024
Viaarxiv icon

Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales

Add code
Apr 17, 2024
Figure 1 for Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
Figure 2 for Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
Figure 3 for Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
Figure 4 for Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
Viaarxiv icon

De-fine: Decomposing and Refining Visual Programs with Auto-Feedback

Add code
Nov 25, 2023
Figure 1 for De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
Figure 2 for De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
Figure 3 for De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
Figure 4 for De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
Viaarxiv icon