Picture for Xin Wu

Xin Wu

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

Add code
Jul 10, 2026
Viaarxiv icon

Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

Add code
Jun 30, 2026
Viaarxiv icon

SMADE-IE: Sparse Multi-Agent Framework with Evidence-Driven Debate for Zero-Shot Information Extraction

Add code
Jun 03, 2026
Viaarxiv icon

M100: An Orchestrated Dataflow Architecture Powering General AI Computing

Add code
Apr 20, 2026
Viaarxiv icon

KEditVis: A Visual Analytics System for Knowledge Editing of Large Language Models

Add code
Mar 31, 2026
Viaarxiv icon

SSR: Pushing the Limit of Spatial Intelligence with Structured Scene Reasoning

Add code
Feb 28, 2026
Viaarxiv icon

Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters

Add code
Feb 11, 2026
Viaarxiv icon

BiManiBench: A Hierarchical Benchmark for Evaluating Bimanual Coordination of Multimodal Large Language Models

Add code
Feb 09, 2026
Viaarxiv icon

DockSmith: Scaling Reliable Coding Environments via an Agentic Docker Builder

Add code
Jan 31, 2026
Viaarxiv icon

STEP3-VL-10B Technical Report

Add code
Jan 15, 2026
Viaarxiv icon