Text watermark is an important research direction for the misuse of LLM-generated text. This repo will have the followings:
Distinguished based on the amount of information that can be embedded in the watermark.
Text watermark research existed in the last century, at which time it was only possible to add watermarks to already written text, and was classified as Post-hoc. However, with the development of language models, some new stages of text watermark emerges.
This category represents a further subdivision within Category Embedding Phase→Generating-Process.
This category represents a further subdivision within Category Embedding Phase→Generating-Process→Token-Level.
During each step of token generation, the language model undergoes the following processing: Get Logits on the vocabulary $\rightarrow$ Get Probability Distribution(Weight) over the vocabulary $\rightarrow$ Sample from the probability distribution
The addition of watermarks often involves a trade-off among multiple aspects.
The watermark is removed by modifying the word.
The watermark is removed by modifying the sentence.
The method of cracking the watermark is to try to forge the watermark text in a certain way.
About Key Word:
The keywords we set are used to describe the most prominent features of the corresponding paper, the absence of some keywords does not mean that the paper does not cover those aspects. For example:Zero-Bit, Completion, Detectability, Logits Bias, Token Level.
Some watermark already have classic abbreviations, which we have also included in the keywords.
A watermark for large language models
Protecting Intellectual Property of Language Generation APIs with Lexical Watermark.
CATER: Intellectual Property Protection on Text Generation APIs via Conditional Watermarks.
Adversarial Watermarking Transformer: Towards Tracing Text Provenance with Data Hiding.
Protecting Language Generation Models via Invisible Watermarking
Watermarking Pre-trained Language Models with Backdooring
Tracing Text Provenance via Context-Aware Lexical Substitution
Towards Tracing Code Provenance with Code Watermarking
Watermarking Text Generated by Black-Box Language Models
Who Wrote this Code? Watermarking for Code Generation
Robust Multi-bit Natural Language Watermarking through Invariant Features
Undetectable Watermarks for Language Models
Optimizing watermarks for large language models
Robust Distortion-free Watermarks for Language Models
SemStamp: A Semantic Watermark with Paraphrastic Robustness for Text Generation
Three Bricks to Consolidate Watermarks for Large Language Models
PromptCARE: Prompt Copyright Protection by Watermark Injection and Verification
Embarrassingly Simple Text Watermarks
Publicly Detectable Watermarking for Language Models
Improving the Generation Quality of Watermarked Large Language Models via Word Importance Scoring
WatME: Towards Lossless Watermarking Through Lexical Redundancy
Necessary and sufficient watermark for large language models.
Provable robust watermarking for ai-generated text.
A Semantic Invariant Robust Watermark for Large Language Models
Towards Optimal Statistical Watermarking
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
WaterMax: breaking the LLM watermark detectability-robustness-quality
Adaptive Text Watermark for Large Language Models
Cross-Attention Watermarking of Large Language Models
Multi-Bit Distortion-Free Watermarking for Large Language Models
An Unforgeable Publicly Verifiable Watermark for Large Language Models
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
Towards Codable Watermarking for Injecting Multi-bit Information to LLM
Resilient Watermarking for LLM-Generated Codes
Permute-and-Flip: An optimally robust and watermarkable decoder for LLMs
Not Paper: https://simons.berkeley.edu/talks/scott-aaronson-ut-austin-openai-2023-08-17
An Entropy-based Text Watermarking Detection Method
Is Watermarking LLM-Generated Code Robust?
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
Stylometric Watermarks for Large Language Models
Watermarking Language Models for Many Adaptive Users
Injecting Undetectable Backdoors in Deep Learning and Language Models
Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature
Large Language Models as Carriers of Hidden Messages
Watermarking Counterfactual Explanations
A Watermark for Low-entropy and Unbiased Generation in Large Language Models
WaterPool: A Watermark Mitigating Trade-offs among Imperceptibility, Efficacy and Robustness
Waterfall: Framework for Robust and Scalable Text Watermarking
Less is More: Sparse Watermarking in LLMs with Enhanced Text Quality
Advancing beyond identification: Multi-bit watermark for large language models.
MCGMark: An Encodable and Robust Online Watermark for LLM-Generated Malicious Code
Hey, That's My Model! Introducing Chain&Hash, An LLM Fingerprinting Technique
PostMark: A Robust Blackbox Watermark for Large Language Models
Adaptive and robust watermark against model extraction attack
Provably Robust Multi-bit Watermarking for AI-generated Text
GumbelSoft: Diversified Language Model Watermarking via the GumbelMax-trick
PersonaMark: Personalized LLM watermarking for model protection and user attribution
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
A Watermark for Order-Agnostic Language Models
Signal Watermark on Large Language Models
Universally Optimal Watermarking Schemes for LLMs: from Theory to Practice
A Watermark for Black-Box Language Models
A Certified Robust Watermark For Large Language Models
Provably Robust Watermarks for Open-Source Language Models
Scalable watermarking for identifying large language model outputs
Watermarking Language Models through Language Models
Debiasing Watermarks for Large Language Models via Maximal Coupling
Segmenting Watermarked Texts From Language Models
TREND: A Whitespace Replacement Information Hiding Method
DERMARK: A Dynamic, Efficient and Robust Multi-bit Watermark for Large Language Models
Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
BiMarker: Enhancing Text Watermark Detection for Large Language Models with Bipolar Watermarks
Robust Multi-bit Text Watermark with LLM-based Paraphrasers
Srcmarker: Dualchannel source code watermarking via scalable code transformations
Domain Watermark: Effective and Harmless Dataset Copyright Protection is Closed at Hand
Robust Steganography from Large Language Models
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
Enhancing Watermarking Quality for LLMs via Contextual Generation States Awareness
In-Context Watermarks for Large Language Models
Robust LLM Fingerprinting via Domain-Specific Watermarks
Optimized Couplings for Watermarking Large Language Models
An End-to-End Model for Logits Based Large Language Models Watermarking
Towards the Resistance of Neural Network Watermarking to Fine-tuning
LLM Watermarking Using Mixtures and Statistical-to-Computational Gaps
Reversible natural language watermarking with augmented word prediction and compression
Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm
Robustness Assessment and Enhancement of Text Watermarking for Google's SynthID
Optimizing Token Choice for Code Watermarking: A RL Approach
SAEMark: Multi-bit LLM Watermarking with Inference-Time Scaling
LOCAT: Localization-Driven Text Watermarking via Large Language Models
CurveMark: Detecting AI-Generated Text via Probabilistic Curvature and Dynamic Semantic Watermarking
Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks
BiMark: Unbiased Multilayer Watermarking for Large Language Models
Multi-use LLM Watermarking and the False Detection Problem
PVMark: Enabling Public Verifiability for LLM Watermarking Schemes
PRO: Enabling Precise and Robust Text Watermark for Open-Source LLMs
Task-Agnostic Language Model Watermarking via High Entropy Passthrough Layers
Watermarking Large Language Models: An Unbiased and Low-risk Method
Ensemble Watermarks for Large Language Models
MorphMark: Flexible Adaptive Watermarking for Large Language Models
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
Post-Hoc Watermarking for Robust Detection in Text Generated by Large Language Models.
Filtering Resistant Large Language Model Watermarking via Style Injection
GaussMark: A Practical Approach for Structural Watermarking of Language Models
Reinforcement Learning-based Copyright Protection Watermarking for Large Language Model.
Position: LLM Watermarking Should Align Stakeholders'Incentives for Practical Adoption
EditMark: Watermarking Large Language Models based on Model Editing
Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique
Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking.
Visual pattern-based watermarking for large language model generated text
MATRIX: Multi-Layer Code Watermarking via Dual-Channel Constrained Parity-Check Encoding
Can we Watermark Low-Entropy LLM Outputs?
Optimal Multi-bit Generative Watermarking Schemes Under Worst-Case False-Alarm Constraints
Refined Detection for Gumbel Watermarking
Robust Safety Monitoring of Language Models via Activation Watermarking
Functional Subspace Watermarking for Large Language Models
MC$^2$Mark: Distortion-Free Multi-Bit Watermarking for Long Messages
ArcMark: Distortion-Free Multi-Byte LLM Watermark via Optimal Transport
WorldCup Sampling for Multi-bit LLM Watermarking
A Survey on LLM-generated Text Detection: Necessity, Methods, and Future Directions
A Survey of Text Watermarking in the Era of Large Language Models
Copyright Protection in Generative AI: A Technical Perspective
Detecting AI-Generated Text: Factors Influencing Detectability with Current Methods
Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks
SoK: On the Role and Future of AIGC Watermarking in the Era of Gen-AI
Enhancing the Robustness of AI-Generated Text Detectors: A Survey
Watermarking Large Language Models in Europe: Interpreting the AI Act in Light of Technology
On the Detectability of LLM-Generated Text: What Exactly Is LLM-Generated Text?
AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective
In this part, the core of the paper is the research of the watermarking attack method, and sometimes the corresponding solution is proposed.
On the Learnability of Watermarks for Language Models
Watermarks in the Sand: Impossibility of Strong Watermarking for Generative Models
Watermark Stealing in Large Language Models
Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense
Can AI-Generated Text be Reliably Detected?
Lost in Overlap: Exploring Watermark Collision in LLMs
Evading AI-Generated Content Detectors using Homoglyphs
Large Language Model Watermark Stealing With Mixed Integer Programming
Alignment-Aware Model Extraction Attacks on Large Language Models
WAPITI: A Watermark for Finetuned Open-Source LLMs
Optimizing Adaptive Attacks against Content Watermarks for Language Models
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
B4: A Black-Box Scrubbing Attack on LLM Watermarks
Bypassing LLM Watermarks with Color-Aware Substitutions
Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text
Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks
Character-Level Perturbations Disrupt LLM Watermarks
Cross-Lingual Summarization as a Black-Box Watermark Removal Attack
Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?
De-mark: Watermark Removal in Large Language Models
Learning to Watermark LLM-generated Text via Reinforcement Learning
RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience
StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors
MARKLLM: An Open-Source Toolkit for LLM Watermarking
WaterSeeker: Efficient Detection of Watermarked Segments in Large Documents
Efficiently Identifying Watermarked Segments in Mixed-Source Texts
SimKey: A Semantically Aware Key Module for Watermarking Language Models
On the Empirical Power of Goodness-of-Fit Tests in Watermark Detection
Online LLM watermark detection via e-processes
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
Mark My Words: Analyzing and Evaluating Language Model Watermarks
New Evaluation Metrics Capture Quality Degradation due to LLM Watermarking
WaterJudge: Quality-Detection Trade-off when Watermarking Large Language Models
Sandcastles in the Storm: Revisiting the (Im)possibility of Strong Watermarking
Auditing Cross-Lingual Fairness in Language Model Watermarking
Performance Trade-offs of Watermarking Large Language Models
Watermarking Makes Language Models Radioactive
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
Baselines for Identifying Watermarked Large Language Models
Black-Box Detection of Language Model Watermarks
Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data?
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
Discovering Clues of Spoofed LM Watermarks
Can Watermarked LLMs be Identified by Users via Crafted Prompts?
Discovering Spoofing Attempts on Language Model Watermarks.
Can Watermarks be Used to Detect LLM IP Infringement For Free?
Red Teaming Language Model Detectors with Language Models
Ward: Provable RAG Dataset Inference via LLM Watermarks
VLA-Mark: A cross modal watermark for large vision-language alignment model
Advancing Machine-Generated Text Detection from an Easy to Hard Supervision Perspective
Watermark Robustness and Radioactivity May Be at Odds in Federated Learning
AgentMark: Utility-Preserving Behavioral Watermarking for Agents
PromptHash: Robust Instruction Watermarks Against Paraphrase and Splicing in LLM Forensics
Robust spectral watermark for synthetic tabular data
When Only the Final Text Survives: Implicit Execution Tracing for Multi-Agent Attribution
TRACE: Structure-Aware Character Encoding for Robust and Generalizable Document Watermarking
Watermarking LLM Agent Trajectories
51 commits
Text watermark is an important research direction for the misuse of LLM-generated text. This repo will have the followings:
Distinguished based on the amount of information that can be embedded in the watermark.
Text watermark research existed in the last century, at which time it was only possible to add watermarks to already written text, and was classified as Post-hoc. However, with the development of language models, some new stages of text watermark emerges.
This category represents a further subdivision within Category Embedding Phase→Generating-Process.
This category represents a further subdivision within Category Embedding Phase→Generating-Process→Token-Level.
During each step of token generation, the language model undergoes the following processing: Get Logits on the vocabulary $\rightarrow$ Get Probability Distribution(Weight) over the vocabulary $\rightarrow$ Sample from the probability distribution
The addition of watermarks often involves a trade-off among multiple aspects.
The watermark is removed by modifying the word.
The watermark is removed by modifying the sentence.
The method of cracking the watermark is to try to forge the watermark text in a certain way.
About Key Word:
The keywords we set are used to describe the most prominent features of the corresponding paper, the absence of some keywords does not mean that the paper does not cover those aspects. For example:Zero-Bit, Completion, Detectability, Logits Bias, Token Level.
Some watermark already have classic abbreviations, which we have also included in the keywords.
A watermark for large language models
Protecting Intellectual Property of Language Generation APIs with Lexical Watermark.
CATER: Intellectual Property Protection on Text Generation APIs via Conditional Watermarks.
Adversarial Watermarking Transformer: Towards Tracing Text Provenance with Data Hiding.
Protecting Language Generation Models via Invisible Watermarking
Watermarking Pre-trained Language Models with Backdooring
Tracing Text Provenance via Context-Aware Lexical Substitution
Towards Tracing Code Provenance with Code Watermarking
Watermarking Text Generated by Black-Box Language Models
Who Wrote this Code? Watermarking for Code Generation
Robust Multi-bit Natural Language Watermarking through Invariant Features
Undetectable Watermarks for Language Models
Optimizing watermarks for large language models
Robust Distortion-free Watermarks for Language Models
SemStamp: A Semantic Watermark with Paraphrastic Robustness for Text Generation
Three Bricks to Consolidate Watermarks for Large Language Models
PromptCARE: Prompt Copyright Protection by Watermark Injection and Verification
Embarrassingly Simple Text Watermarks
Publicly Detectable Watermarking for Language Models
Improving the Generation Quality of Watermarked Large Language Models via Word Importance Scoring
WatME: Towards Lossless Watermarking Through Lexical Redundancy
Necessary and sufficient watermark for large language models.
Provable robust watermarking for ai-generated text.
A Semantic Invariant Robust Watermark for Large Language Models
Towards Optimal Statistical Watermarking
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
WaterMax: breaking the LLM watermark detectability-robustness-quality
Adaptive Text Watermark for Large Language Models
Cross-Attention Watermarking of Large Language Models
Multi-Bit Distortion-Free Watermarking for Large Language Models
An Unforgeable Publicly Verifiable Watermark for Large Language Models
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
Towards Codable Watermarking for Injecting Multi-bit Information to LLM
Resilient Watermarking for LLM-Generated Codes
Permute-and-Flip: An optimally robust and watermarkable decoder for LLMs
Not Paper: https://simons.berkeley.edu/talks/scott-aaronson-ut-austin-openai-2023-08-17
An Entropy-based Text Watermarking Detection Method
Is Watermarking LLM-Generated Code Robust?
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
Stylometric Watermarks for Large Language Models
Watermarking Language Models for Many Adaptive Users
Injecting Undetectable Backdoors in Deep Learning and Language Models
Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature
Large Language Models as Carriers of Hidden Messages
Watermarking Counterfactual Explanations
A Watermark for Low-entropy and Unbiased Generation in Large Language Models
WaterPool: A Watermark Mitigating Trade-offs among Imperceptibility, Efficacy and Robustness
Waterfall: Framework for Robust and Scalable Text Watermarking
Less is More: Sparse Watermarking in LLMs with Enhanced Text Quality
Advancing beyond identification: Multi-bit watermark for large language models.
MCGMark: An Encodable and Robust Online Watermark for LLM-Generated Malicious Code
Hey, That's My Model! Introducing Chain&Hash, An LLM Fingerprinting Technique
PostMark: A Robust Blackbox Watermark for Large Language Models
Adaptive and robust watermark against model extraction attack
Provably Robust Multi-bit Watermarking for AI-generated Text
GumbelSoft: Diversified Language Model Watermarking via the GumbelMax-trick
PersonaMark: Personalized LLM watermarking for model protection and user attribution
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
A Watermark for Order-Agnostic Language Models
Signal Watermark on Large Language Models
Universally Optimal Watermarking Schemes for LLMs: from Theory to Practice
A Watermark for Black-Box Language Models
A Certified Robust Watermark For Large Language Models
Provably Robust Watermarks for Open-Source Language Models
Scalable watermarking for identifying large language model outputs
Watermarking Language Models through Language Models
Debiasing Watermarks for Large Language Models via Maximal Coupling
Segmenting Watermarked Texts From Language Models
TREND: A Whitespace Replacement Information Hiding Method
DERMARK: A Dynamic, Efficient and Robust Multi-bit Watermark for Large Language Models
Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
BiMarker: Enhancing Text Watermark Detection for Large Language Models with Bipolar Watermarks
Robust Multi-bit Text Watermark with LLM-based Paraphrasers
Srcmarker: Dualchannel source code watermarking via scalable code transformations
Domain Watermark: Effective and Harmless Dataset Copyright Protection is Closed at Hand
Robust Steganography from Large Language Models
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
Enhancing Watermarking Quality for LLMs via Contextual Generation States Awareness
In-Context Watermarks for Large Language Models
Robust LLM Fingerprinting via Domain-Specific Watermarks
Optimized Couplings for Watermarking Large Language Models
An End-to-End Model for Logits Based Large Language Models Watermarking
Towards the Resistance of Neural Network Watermarking to Fine-tuning
LLM Watermarking Using Mixtures and Statistical-to-Computational Gaps
Reversible natural language watermarking with augmented word prediction and compression
Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm
Robustness Assessment and Enhancement of Text Watermarking for Google's SynthID
Optimizing Token Choice for Code Watermarking: A RL Approach
SAEMark: Multi-bit LLM Watermarking with Inference-Time Scaling
LOCAT: Localization-Driven Text Watermarking via Large Language Models
CurveMark: Detecting AI-Generated Text via Probabilistic Curvature and Dynamic Semantic Watermarking
Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks
BiMark: Unbiased Multilayer Watermarking for Large Language Models
Multi-use LLM Watermarking and the False Detection Problem
PVMark: Enabling Public Verifiability for LLM Watermarking Schemes
PRO: Enabling Precise and Robust Text Watermark for Open-Source LLMs
Task-Agnostic Language Model Watermarking via High Entropy Passthrough Layers
Watermarking Large Language Models: An Unbiased and Low-risk Method
Ensemble Watermarks for Large Language Models
MorphMark: Flexible Adaptive Watermarking for Large Language Models
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
Post-Hoc Watermarking for Robust Detection in Text Generated by Large Language Models.
Filtering Resistant Large Language Model Watermarking via Style Injection
GaussMark: A Practical Approach for Structural Watermarking of Language Models
Reinforcement Learning-based Copyright Protection Watermarking for Large Language Model.
Position: LLM Watermarking Should Align Stakeholders'Incentives for Practical Adoption
EditMark: Watermarking Large Language Models based on Model Editing
Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique
Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking.
Visual pattern-based watermarking for large language model generated text
MATRIX: Multi-Layer Code Watermarking via Dual-Channel Constrained Parity-Check Encoding
Can we Watermark Low-Entropy LLM Outputs?
Optimal Multi-bit Generative Watermarking Schemes Under Worst-Case False-Alarm Constraints
Refined Detection for Gumbel Watermarking
Robust Safety Monitoring of Language Models via Activation Watermarking
Functional Subspace Watermarking for Large Language Models
MC$^2$Mark: Distortion-Free Multi-Bit Watermarking for Long Messages
ArcMark: Distortion-Free Multi-Byte LLM Watermark via Optimal Transport
WorldCup Sampling for Multi-bit LLM Watermarking
A Survey on LLM-generated Text Detection: Necessity, Methods, and Future Directions
A Survey of Text Watermarking in the Era of Large Language Models
Copyright Protection in Generative AI: A Technical Perspective
Detecting AI-Generated Text: Factors Influencing Detectability with Current Methods
Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks
SoK: On the Role and Future of AIGC Watermarking in the Era of Gen-AI
Enhancing the Robustness of AI-Generated Text Detectors: A Survey
Watermarking Large Language Models in Europe: Interpreting the AI Act in Light of Technology
On the Detectability of LLM-Generated Text: What Exactly Is LLM-Generated Text?
AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective
In this part, the core of the paper is the research of the watermarking attack method, and sometimes the corresponding solution is proposed.
On the Learnability of Watermarks for Language Models
Watermarks in the Sand: Impossibility of Strong Watermarking for Generative Models
Watermark Stealing in Large Language Models
Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense
Can AI-Generated Text be Reliably Detected?
Lost in Overlap: Exploring Watermark Collision in LLMs
Evading AI-Generated Content Detectors using Homoglyphs
Large Language Model Watermark Stealing With Mixed Integer Programming
Alignment-Aware Model Extraction Attacks on Large Language Models
WAPITI: A Watermark for Finetuned Open-Source LLMs
Optimizing Adaptive Attacks against Content Watermarks for Language Models
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
B4: A Black-Box Scrubbing Attack on LLM Watermarks
Bypassing LLM Watermarks with Color-Aware Substitutions
Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text
Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks
Character-Level Perturbations Disrupt LLM Watermarks
Cross-Lingual Summarization as a Black-Box Watermark Removal Attack
Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?
De-mark: Watermark Removal in Large Language Models
Learning to Watermark LLM-generated Text via Reinforcement Learning
RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience
StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors
MARKLLM: An Open-Source Toolkit for LLM Watermarking
WaterSeeker: Efficient Detection of Watermarked Segments in Large Documents
Efficiently Identifying Watermarked Segments in Mixed-Source Texts
SimKey: A Semantically Aware Key Module for Watermarking Language Models
On the Empirical Power of Goodness-of-Fit Tests in Watermark Detection
Online LLM watermark detection via e-processes
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
Mark My Words: Analyzing and Evaluating Language Model Watermarks
New Evaluation Metrics Capture Quality Degradation due to LLM Watermarking
WaterJudge: Quality-Detection Trade-off when Watermarking Large Language Models
Sandcastles in the Storm: Revisiting the (Im)possibility of Strong Watermarking
Auditing Cross-Lingual Fairness in Language Model Watermarking
Performance Trade-offs of Watermarking Large Language Models
Watermarking Makes Language Models Radioactive
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
Baselines for Identifying Watermarked Large Language Models
Black-Box Detection of Language Model Watermarks
Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data?
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
Discovering Clues of Spoofed LM Watermarks
Can Watermarked LLMs be Identified by Users via Crafted Prompts?
Discovering Spoofing Attempts on Language Model Watermarks.
Can Watermarks be Used to Detect LLM IP Infringement For Free?
Red Teaming Language Model Detectors with Language Models
Ward: Provable RAG Dataset Inference via LLM Watermarks
VLA-Mark: A cross modal watermark for large vision-language alignment model
Advancing Machine-Generated Text Detection from an Easy to Hard Supervision Perspective
Watermark Robustness and Radioactivity May Be at Odds in Federated Learning
AgentMark: Utility-Preserving Behavioral Watermarking for Agents
PromptHash: Robust Instruction Watermarks Against Paraphrase and Splicing in LLM Forensics
Robust spectral watermark for synthetic tabular data
When Only the Final Text Survives: Implicit Execution Tracing for Multi-Agent Attribution
TRACE: Structure-Aware Character Encoding for Robust and Generalizable Document Watermarking
Watermarking LLM Agent Trajectories
51 commits