Picture for Samir Abdaljalil

Samir Abdaljalil

ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral

Add code
Aug 11, 2026
Viaarxiv icon

IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

Add code
Jul 01, 2026
Viaarxiv icon

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

Add code
Apr 06, 2026
Viaarxiv icon

4D Synchronized Fields: Motion-Language Gaussian Splatting for Temporal Scene Understanding

Add code
Mar 15, 2026
Viaarxiv icon

Knowing When Not to Answer: Abstention-Aware Scientific Reasoning

Add code
Feb 15, 2026
Viaarxiv icon

Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs

Add code
Feb 06, 2026
Viaarxiv icon

Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference

Add code
Aug 20, 2025
Viaarxiv icon

Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models

Add code
Jun 08, 2025
Viaarxiv icon

HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations

Add code
Mar 10, 2025
Figure 1 for HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
Figure 2 for HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
Figure 3 for HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
Figure 4 for HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
Viaarxiv icon

SINdex: Semantic INconsistency Index for Hallucination Detection in LLMs

Add code
Mar 07, 2025
Viaarxiv icon