Picture for Philippe Laban

Philippe Laban

LLMs Get Lost in Evolving User Intent

Add code
Jul 22, 2026
Viaarxiv icon

KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive Reasoning

Add code
May 14, 2025
Viaarxiv icon

LLMs Get Lost In Multi-Turn Conversation

Add code
May 09, 2025
Viaarxiv icon

EvalAgent: Discovering Implicit Evaluation Criteria from the Web

Add code
Apr 21, 2025
Viaarxiv icon

Voice Interaction With Conversational AI Could Facilitate Thoughtful Reflection and Substantive Revision in Writing

Add code
Apr 11, 2025
Viaarxiv icon

AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation

Add code
Apr 10, 2025
Viaarxiv icon

BingoGuard: LLM Content Moderation Tools with Risk Levels

Add code
Mar 09, 2025
Viaarxiv icon

Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding

Add code
Feb 17, 2025
Viaarxiv icon

SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits

Add code
Dec 17, 2024
Viaarxiv icon

CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic Environments

Add code
Nov 04, 2024
Viaarxiv icon