Picture for Dongwei Jiang

Dongwei Jiang

CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities

Add code
Jun 03, 2026
Viaarxiv icon

Supplement Generation Training for Enhancing Agentic Task Performance

Add code
Apr 22, 2026
Viaarxiv icon

Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback

Add code
Jun 13, 2025
Viaarxiv icon

Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets

Add code
Oct 06, 2024
Figure 1 for Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
Figure 2 for Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
Figure 3 for Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
Figure 4 for Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
Viaarxiv icon

RATIONALYST: Pre-training Process-Supervision for Improving Reasoning

Add code
Oct 01, 2024
Figure 1 for RATIONALYST: Pre-training Process-Supervision for Improving Reasoning
Figure 2 for RATIONALYST: Pre-training Process-Supervision for Improving Reasoning
Figure 3 for RATIONALYST: Pre-training Process-Supervision for Improving Reasoning
Figure 4 for RATIONALYST: Pre-training Process-Supervision for Improving Reasoning
Viaarxiv icon

To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning

Add code
Sep 18, 2024
Figure 1 for To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning
Figure 2 for To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning
Figure 3 for To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning
Figure 4 for To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning
Viaarxiv icon

Benchmarking Language Model Creativity: A Case Study on Code Generation

Add code
Jul 12, 2024
Figure 1 for Benchmarking Language Model Creativity: A Case Study on Code Generation
Figure 2 for Benchmarking Language Model Creativity: A Case Study on Code Generation
Figure 3 for Benchmarking Language Model Creativity: A Case Study on Code Generation
Figure 4 for Benchmarking Language Model Creativity: A Case Study on Code Generation
Viaarxiv icon

SELF-CORRECT: LLMs Struggle with Refining Self-Generated Responses

Add code
Apr 04, 2024
Figure 1 for SELF-CORRECT: LLMs Struggle with Refining Self-Generated Responses
Figure 2 for SELF-CORRECT: LLMs Struggle with Refining Self-Generated Responses
Figure 3 for SELF-CORRECT: LLMs Struggle with Refining Self-Generated Responses
Figure 4 for SELF-CORRECT: LLMs Struggle with Refining Self-Generated Responses
Viaarxiv icon

LeanReasoner: Boosting Complex Logical Reasoning with Lean

Add code
Mar 20, 2024
Viaarxiv icon

Enhancing Systematic Decompositional Natural Language Inference Using Informal Logic

Add code
Feb 27, 2024
Viaarxiv icon