Picture for Hongwei Yao

Hongwei Yao

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

Add code
Aug 10, 2026
Viaarxiv icon

Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework

Add code
Aug 05, 2026
Viaarxiv icon

Black-Box Guardrail Reverse-engineering Attack

Add code
Nov 06, 2025
Viaarxiv icon

SoK: Large Language Model Copyright Auditing via Fingerprinting

Add code
Aug 27, 2025
Figure 1 for SoK: Large Language Model Copyright Auditing via Fingerprinting
Figure 2 for SoK: Large Language Model Copyright Auditing via Fingerprinting
Figure 3 for SoK: Large Language Model Copyright Auditing via Fingerprinting
Figure 4 for SoK: Large Language Model Copyright Auditing via Fingerprinting
Viaarxiv icon

Quantifying Conversation Drift in MCP via Latent Polytope

Add code
Aug 08, 2025
Viaarxiv icon

ControlNET: A Firewall for RAG-based LLM System

Add code
Apr 13, 2025
Viaarxiv icon

FIT-Print: Towards False-claim-resistant Model Ownership Verification via Targeted Fingerprint

Add code
Jan 26, 2025
Viaarxiv icon

Mitigating Privacy Risks in LLM Embeddings from Embedding Inversion

Add code
Nov 06, 2024
Figure 1 for Mitigating Privacy Risks in LLM Embeddings from Embedding Inversion
Figure 2 for Mitigating Privacy Risks in LLM Embeddings from Embedding Inversion
Figure 3 for Mitigating Privacy Risks in LLM Embeddings from Embedding Inversion
Figure 4 for Mitigating Privacy Risks in LLM Embeddings from Embedding Inversion
Viaarxiv icon

TAPI: Towards Target-Specific and Adversarial Prompt Injection against Code LLMs

Add code
Jul 12, 2024
Figure 1 for TAPI: Towards Target-Specific and Adversarial Prompt Injection against Code LLMs
Figure 2 for TAPI: Towards Target-Specific and Adversarial Prompt Injection against Code LLMs
Figure 3 for TAPI: Towards Target-Specific and Adversarial Prompt Injection against Code LLMs
Figure 4 for TAPI: Towards Target-Specific and Adversarial Prompt Injection against Code LLMs
Viaarxiv icon

Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution

Add code
May 08, 2024
Figure 1 for Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
Figure 2 for Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
Figure 3 for Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
Figure 4 for Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
Viaarxiv icon