Picture for Ryo Hachiuma

Ryo Hachiuma

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

Add code
Jul 02, 2026
Viaarxiv icon

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

Add code
Jun 16, 2026
Viaarxiv icon

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

Add code
Jun 11, 2026
Viaarxiv icon

DVSM: Decoder-only View Synthesis Model Done Right

Add code
May 28, 2026
Viaarxiv icon

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning

Add code
May 27, 2026
Viaarxiv icon

Learning from Synthetic Data via Provenance-Based Input Gradient Guidance

Add code
Apr 03, 2026
Viaarxiv icon

Interpretable Debiasing of Vision-Language Models for Social Fairness

Add code
Feb 27, 2026
Viaarxiv icon

VIOLA: Towards Video In-Context Learning with Minimal Annotations

Add code
Jan 22, 2026
Viaarxiv icon

Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception

Add code
Jan 14, 2026
Viaarxiv icon

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

Add code
Dec 23, 2025
Viaarxiv icon