germane/Tab-MIA

Dataset

Tab-MIA: A Benchmark for Membership Inference Attacks on Tabular Data

0

19 commits

1 linked in READMEs

updated May 4, 2025

See the code

README

Tab-MIA: A Benchmark for Membership Inference Attacks on Tabular Data

Tab-MIA is a benchmark dataset designed to evaluate the privacy risks of fine-tuning large language models (LLMs) on structured tabular data. It enables reproducible and systematic testing of Membership Inference Attacks (MIAs) across diverse datasets and six different serialization formats.

📋 Overview

  • Datasets:

    • WTQ (WikiTableQuestions)
    • WikiSQL
    • TabFact
    • Adult Census
    • California Housing
  • Encodings:

    • json
    • html
    • markdown
    • key-value-pair
    • key-is-value
    • line-sep

Each table is serialized into one of these formats and labeled with label=1 (member) or label=0 (non-member) for evaluating MIA methods.

📁 File Format

All files are in JSONL format. Each line has:

{
  "input": "serialized table string",
  "label": 1
}
benchmark
large-language-models
membership-inference
tabular

germane/Tab-MIA

Dataset

Tab-MIA: A Benchmark for Membership Inference Attacks on Tabular Data

0

19 commits

1 linked in READMEs

updated May 4, 2025

See the code

README

Tab-MIA: A Benchmark for Membership Inference Attacks on Tabular Data

Tab-MIA is a benchmark dataset designed to evaluate the privacy risks of fine-tuning large language models (LLMs) on structured tabular data. It enables reproducible and systematic testing of Membership Inference Attacks (MIAs) across diverse datasets and six different serialization formats.

📋 Overview

  • Datasets:

    • WTQ (WikiTableQuestions)
    • WikiSQL
    • TabFact
    • Adult Census
    • California Housing
  • Encodings:

    • json
    • html
    • markdown
    • key-value-pair
    • key-is-value
    • line-sep

Each table is serialized into one of these formats and labeled with label=1 (member) or label=0 (non-member) for evaluating MIA methods.

📁 File Format

All files are in JSONL format. Each line has:

{
  "input": "serialized table string",
  "label": 1
}
benchmark
large-language-models
membership-inference
tabular