Picture for Haoming Xu

Haoming Xu

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

Add code
Aug 20, 2026
Viaarxiv icon

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Add code
Aug 12, 2026
Viaarxiv icon

MobileMem: Learning from a Year of Mobile Experiences

Add code
Aug 11, 2026
Viaarxiv icon

Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments

Add code
Aug 05, 2026
Viaarxiv icon

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis

Add code
May 28, 2026
Viaarxiv icon

When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

Add code
May 28, 2026
Viaarxiv icon

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

Add code
Apr 26, 2026
Viaarxiv icon

How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities

Add code
Mar 03, 2026
Viaarxiv icon

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

Add code
Mar 01, 2026
Viaarxiv icon

Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency

Add code
Jan 09, 2026
Viaarxiv icon