Picture for Mouxiao Bian

Mouxiao Bian

RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

Add code
Aug 06, 2026
Viaarxiv icon

MyoCardBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

Add code
Jul 28, 2026
Viaarxiv icon

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

Add code
Jun 25, 2026
Viaarxiv icon

SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

Add code
May 27, 2026
Viaarxiv icon

Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology

Add code
Dec 23, 2025
Viaarxiv icon

MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents

Add code
Nov 19, 2025
Viaarxiv icon

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts

Add code
Nov 17, 2025
Viaarxiv icon

MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models

Add code
Oct 31, 2025
Viaarxiv icon

Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030

Add code
May 12, 2025
Figure 1 for Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030
Viaarxiv icon

Building a Human-Verified Clinical Reasoning Dataset via a Human LLM Hybrid Pipeline for Trustworthy Medical AI

Add code
May 11, 2025
Viaarxiv icon