Picture for Takashi Ishida

Takashi Ishida

CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies

Add code
Jun 15, 2026
Viaarxiv icon

Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

Add code
Jun 05, 2026
Viaarxiv icon

Unified Approach for Weakly Supervised Multicalibration

Add code
May 11, 2026
Viaarxiv icon

Scalable Oversight via Partitioned Human Supervision

Add code
Oct 26, 2025
Viaarxiv icon

LLM Routing with Dueling Feedback

Add code
Oct 01, 2025
Viaarxiv icon

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

Add code
Jun 10, 2025
Figure 1 for EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements
Figure 2 for EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements
Figure 3 for EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements
Figure 4 for EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements
Viaarxiv icon

Practical estimation of the optimal classification error with soft labels and calibration

Add code
May 27, 2025
Viaarxiv icon

How Can I Publish My LLM Benchmark Without Giving the True Answers Away?

Add code
May 23, 2025
Viaarxiv icon

Learning with Complementary Labels Revisited: A Consistent Approach via Negative-Unlabeled Learning

Add code
Nov 27, 2023
Viaarxiv icon

Flooding Regularization for Stable Training of Generative Adversarial Networks

Add code
Nov 01, 2023
Viaarxiv icon