Picture for Shi Wu

Shi Wu

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

Add code
Jul 23, 2026
Viaarxiv icon

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models

Add code
May 12, 2026
Viaarxiv icon

CoVe: Training Interactive Tool-Use Agents via Constraint-Guided Verification

Add code
Mar 02, 2026
Viaarxiv icon

SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity

Add code
Dec 30, 2024
Figure 1 for SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
Figure 2 for SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
Figure 3 for SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
Figure 4 for SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
Viaarxiv icon

TBDetector:Transformer-Based Detector for Advanced Persistent Threats with Provenance Graph

Add code
Apr 06, 2023
Figure 1 for TBDetector:Transformer-Based Detector for Advanced Persistent Threats with Provenance Graph
Figure 2 for TBDetector:Transformer-Based Detector for Advanced Persistent Threats with Provenance Graph
Figure 3 for TBDetector:Transformer-Based Detector for Advanced Persistent Threats with Provenance Graph
Figure 4 for TBDetector:Transformer-Based Detector for Advanced Persistent Threats with Provenance Graph
Viaarxiv icon