Picture for Jing Bi

Jing Bi

Yolo

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

Add code
Jul 16, 2026
Viaarxiv icon

PGD-NO: A Neural Operator with Precomputed Geometry Decomposition for 3D Million-scale Physics Simulations

Add code
Jul 09, 2026
Viaarxiv icon

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

Add code
Jun 24, 2026
Viaarxiv icon

TDMM-LM: Bridging Facial Understanding and Animation via Language Models

Add code
Mar 14, 2026
Viaarxiv icon

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Add code
Feb 02, 2026
Viaarxiv icon

VisualActBench: Can VLMs See and Act like a Human?

Add code
Dec 10, 2025
Viaarxiv icon

When to Think and When to Look: Uncertainty-Guided Lookback

Add code
Nov 19, 2025
Figure 1 for When to Think and When to Look: Uncertainty-Guided Lookback
Figure 2 for When to Think and When to Look: Uncertainty-Guided Lookback
Figure 3 for When to Think and When to Look: Uncertainty-Guided Lookback
Figure 4 for When to Think and When to Look: Uncertainty-Guided Lookback
Viaarxiv icon

Diagnosing Visual Reasoning: Challenges, Insights, and a Path Forward

Add code
Oct 23, 2025
Viaarxiv icon

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

Add code
Oct 06, 2025
Figure 1 for Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
Figure 2 for Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
Figure 3 for Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
Figure 4 for Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
Viaarxiv icon

rQdia: Regularizing Q-Value Distributions With Image Augmentation

Add code
Jun 26, 2025
Viaarxiv icon