This repository is a curated collection of research papers, attack strategies, and tools related to watermark attacks on Large Language Models (LLMs).
1
4 commits
updated Feb 28, 2025
This repository contains research and tools for watermark attacks on Large Language Models (LLMs). It aims to help researchers and developers understand watermarking techniques and their challenges.
Watermark Stealing in Large Language Models
Large language model watermark stealing with mixed integer programming
Toward Breaking Watermarks in Distortion-free Large Language Models
Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense
Watermarks in the Sand: Impossibility of Strong Watermarking for Generative Models
Watermark Smoothing Attacks against Language Models
Optimizing Adaptive Attacks against Content Watermarks for Language Models
De-mark: Watermark Removal in Large Language Models
$B^4$: A Black-Box Scrubbing Attack on LLM Watermarks
Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?
4 commits
This repository is a curated collection of research papers, attack strategies, and tools related to watermark attacks on Large Language Models (LLMs).
1
4 commits
updated Feb 28, 2025
This repository contains research and tools for watermark attacks on Large Language Models (LLMs). It aims to help researchers and developers understand watermarking techniques and their challenges.
Watermark Stealing in Large Language Models
Large language model watermark stealing with mixed integer programming
Toward Breaking Watermarks in Distortion-free Large Language Models
Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense
Watermarks in the Sand: Impossibility of Strong Watermarking for Generative Models
Watermark Smoothing Attacks against Language Models
Optimizing Adaptive Attacks against Content Watermarks for Language Models
De-mark: Watermark Removal in Large Language Models
$B^4$: A Black-Box Scrubbing Attack on LLM Watermarks
Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?
4 commits