Foysal87/Bangla-NLP-Dataset

Bangla NLP dataset. Bangla NER,POStag, text summarization, stopword, translate, sentiment analysis, wiki articles, root word, dataset etc.

72

15 commits

updated May 3, 2026

See the code

README

🇧🇩 Bangla NLP Dataset

Bangla NLP Datasets License Contribution

A comprehensive, URL-validated collection of Bangla / Bengali NLP datasets, models, tools, and corpora — for researchers, students, and developers.

বাংলা ভাষার এনএলপি গবেষণা, শিক্ষা এবং প্রায়োগিক কাজের জন্য একটি যাচাইকৃত সম্পদ-সংগ্রহ।


🔄 Our sbnltk dataset is in LFS mode — clone the repository to download data.

🚀 All deep-learning-era datasets are linked below; we'll keep adding new releases.

📑 Table of Contents

📖 About

This repository contains the sbnltk datasets used in the Bangla NLP toolkit sbnltk, and serves as a comprehensive, URL-validated catalogue of publicly available Bangla NLP resources contributed by the worldwide Bangla research community.

Validation note: Every link in this document was tested between 2025–2026. Resources that previously appeared here under fabricated GitHub paths (e.g. github.com/poetry-bangla/corpus, github.com/medical-bangla/medical-translation, etc.) have been removed. If you find a dead link, please open an issue.

🎯 sbnltk Dataset List (DUMP & HUMAN Evaluated)

DatasetDescriptionLink
Number ListBangla number list📥 Download
Root Word ListBangla root word list📥 Download
Word ListBangla word list (highest → lowest occurrence)📥 Download
Wiki DumpBangla wiki dump words📥 Download
POS Tag StaticBangla POS-tag static dataset (single word)📥 Download
NER StaticBangla NER static dataset (single word)📥 Download
Stop WordsBangla stop-word list📥 Download
Dump POS TagBangla dump POS-tag📥 Download
Question ClassificationBangla dump question classification dataset📥 Download
Sentiment AnalysisBangla dump sentiment analysis📥 Download
Translation DatasetGoogle translation dataset📥 Download
NER EnhancedExisting NER dataset (modified + Date entity)📥 Download
News ArticlesNews article dataset📥 Download
POS ConvertedPOS-tag converted data📥 Download
POS Human EvaluatedPOS-tag human-evaluated data📥 Download
NER Dump (Both)Dump NER (active + passive)📥 Download
NER Dump (Active)Dump NER (active only)📥 Download
Extractive SummarizationExtractive text summarization🔗 GitHub
Abstractive SummarizationAbstractive summarization (newspaper)📥 Drive · 📊 Kaggle
Text ClassificationNews article classification📥 Drive · 📊 Kaggle
Keywords ClassificationTopic-keyword classification📥 Drive · 📊 Kaggle

🤖 Pre-trained Language Models

BERT-style Encoders

ModelDescriptionParamsLink
BanglaBERTELECTRA discriminator, SOTA Bangla NLU (BUET CSE NLP)110M🤗 HF · 🔗 GitHub
BanglaBERT (Small)Lightweight variant13M🤗 HF
BanglaBERT (Large)Large variant, top scores on BLUB335M🤗 HF
BanglishBERTBilingual (Bangla + English)110M🤗 HF
Bangla BERT Base (sagorsarker)Popular community BERT110M🤗 HF
mBERT-Bengali-NERMultilingual BERT fine-tuned for NER—🤗 HF
mBERT-Bengali-TyDiQA-QAmBERT fine-tuned for QA—🤗 HF
sahajBERTALBERT-based collaborative training18M🤗 HF
MuRILGoogle multilingual (17 Indian)236M🤗 HF
IndicBERTAI4Bharat (12 Indian)—🤗 HF

Generative / Seq2Seq Models

ModelDescriptionParamsLink
BanglaT5T5-style seq2seq (BUET)247M🤗 HF
BanglaT5 (small)Small T5 variant60M🤗 HF
BanglaT5 NMT bn↔enTranslation seq2seq—🤗 bn→en · 🤗 en→bn
BanglaT5-ParaphraseParaphrase seq2seq—🤗 HF
BanglaByT5Byte-level T5small📄 arXiv 2505.17102
GPT-2 BengaliFlax-community GPT-2117M🤗 HF

Bangla LLMs (2025)

ModelDescriptionParamsLink
TigerLLM-1B-itBangla instruction-tuned LLM1B🤗 HF
TigerLLM-9B-itLarger variant, beats GPT-3.5 on Bangla9B🤗 HF
TituLLMs (1B / 3B)Family of Bangla LLMs with benchmarks1B / 3B📄 arXiv 2502.11187
TigerLLM PaperACL 2025 short paper—📄 arXiv 2503.10995 · 📄 ACL 2025
BanglaLLaMA-3-8B-BnWiki-InstructLlama-3 fine-tuned on Bn Wiki8B🤗 HF
Bangla LLaMA (saiful9379)LoRA-tuned LLaMA—🔗 GitHub

Speech Models

ModelDescriptionPerformanceLink
Wav2Vec2-Bengali (300M)Self-supervised ASR17.8 % WER🤗 HF
Wav2Vec2-XLSR BengaliXLSR fine-tune—🤗 HF
BanglaConformerConformer ASR by Bengali.AI—🤗 HF
BanglaASRWhisper fine-tuned for Bengali14.73 % WER🤗 HF · 🔗 GitHub
Whisper (multilingual)OpenAI base model — Bn supportedvarious sizes🤗 HF

Word & Sentence Embeddings

ResourceDescriptionLink
Bangla FastText (sagorsarker)20 M-token wiki-trained skipgram + CBOW🤗 HF
Bangla Word2Vec (sagorsarker)100-d Wikipedia embeddings🤗 HF
fastText 157-language BengaliFacebook 300-d Wiki + CC🌐 fastText
Spark NLP bengali_cc_300dProduction embedding🔗 Spark NLP
BanglaEmbedCross-lingual distilled sentence embeddings📄 arXiv 2411.15270

📚 Latest 2024–2026 Datasets

These are the most relevant new releases — cite the original authors when used.

DatasetTaskSize / NotesLink
Bangla-InstructInstruction-tuning342 K instruction–response pairs🤗 HF
Bangla-TextBookLM pretraining9.9 M tokens, 163 NCTB textbooks🤗 HF
BanglaSTEMTechnical-domain MT5 K Bn-En STEM sentence pairs📄 arXiv 2511.03498
NCTB-QAEducational QA87 805 QA pairs (grade 1–10)📄 arXiv 2603.05462
BanglaQuADOpen-domain QA30 808 QA pairs📄 arXiv 2410.10229
ANCHOLIK-NERRegional-dialect NER17 405 sentences, 5 regions📄 arXiv 2502.11198
BanNERD (NAACL 2025)NER, 10 classes / 29 domains85 K sentences, 991 K tokens🔗 GitHub
ONUBADDialect→Standard MTChittagong / Sylhet / Barisal🔗 ScienceDirect
BanglaDialDialect text corpus60 729 entries × 11 dialects🔗 PMC
BIDWESHRegional hate speechMulti-region📄 arXiv 2507.16183
BanglaTLitRomanized→Bn back-transliteration42.7 K + 245.7 K pretrain📄 ACL 2024
BanglishRevE-commerce code-mix reviews1.74 M Daraz reviews📄 arXiv 2412.13161
BengaliSent140Hate vs non-hate fusion140 K speeches📄 arXiv 2601.20129 · 🔗 IEEE DataPort
BLUCKLLM cultural-knowledge benchmark2 366 MCQs / 23 categories📄 arXiv 2505.21092
BNLI (refined)NLICurated entail/contra/neutral📄 arXiv 2511.08813
MultiBanAbsMulti-domain abstractive sum.Multi-corpus📄 arXiv 2511.19317
MultiBanFakeDetectMultimodal fake newsText + image🔗 ScienceDirect
BanFakeNews-2.0Fake news (2024)47 K real + 13 K fake📊 Mendeley
BanglaHealthHealth-domain paraphrase200 K sentences🔗 ScienceDirect
BanglaCHQ-SummConsumer-health-question summary2 350 pairs (BLP-2023)🔗 GitHub
Bangla-MedERMedical NER2 980 texts, 6 entity types📊 Mendeley
BanglaSarc3Sarcasm (ternary)12 089 FB comments🔗 ScienceDirect
VACASPATIBangla literature corpus11 M sentences / 115 M words📄 arXiv 2307.05083
MixSarcCode-mix sarcasm/humor/offenceBn-En transliterated📄 arXiv 2602.21608
EmoMix-3LCode-mix emotion1 071 Bn-Hi-En instances🔗 GitHub
Bangla-ToCoContext-aware toxic1 004 FB news comments🔗 ScienceDirect
BanglaDocAtlasDocument-layout, 8 classesannotated complex docs🔗 IEEE
FoodBDBD cuisine images, 67 categories3 523 polygon-annotated meals🔗 Springer 2025
DeshiFoodBDBD traditional food images5 425 images / 19 dishes🔗 Springer

📊 Benchmarking and Evaluation

BLUB — Bangla Language Understanding Benchmark

The first comprehensive Bangla NLU benchmark, introduced with BanglaBERT (NAACL 2022).

TaskDatasetMetricBest ModelScore
Sentiment ClassificationSentNoBMacro-F1BanglaBERT72.89
Natural Language InferenceXNLI-bn / BNLIAccuracyBanglaBERT (Large)83.41
Named Entity RecognitionMultiCoNERMicro-F1BanglaBERT (Large)79.20
Question AnsweringSQuAD-bn / TyDiQAEM / F1BanglaBERT (Large)76.10 / 81.50

📄 BLUB code & leaderboard: github.com/csebuetnlp/banglabert

BLUCK — Bangla LLM Cultural & Linguistic Benchmark (2025)

2 366 multiple-choice questions across 23 categories covering Bangladesh culture, history, and Bangla linguistics — designed to probe LLM cultural knowledge. 📄 arXiv 2505.21092

Recent Benchmark Datasets

DatasetTaskSizeLink
BanglaBookSentiment158 065 reviews🔗 GitHub
SentMix-3L / OffMix-3LCode-mix sentiment / offence~1 K each📄 ACL
MultiCoNER (Bangla)Multilingual complex NERtask🔗 multiconer.github.io

📰 News, Corpora & Pretraining Data

DatasetSizeLink
Bangla2B+ (BanglaBERT pretraining corpus)27.5 GB / 110 sites🔗 GitHub
BanglaLM (data-mining corpus)14 GB📄 IEEE
BdNC – Bangladesh National Corpus ✅40 GB / 3 B+ words🔗 corpus.bangla.gov.bd
VACASPATI literary corpus11 M sentences📄 arXiv 2307.05083
CC-100 Bangla8.3 GB🔗 StatMT
OSCAR Bangla12 GB+🔗 OSCAR
AI4Bharat IndicCorp9 B tokens incl. Bangla🔗 site
AI4Bharat IndicNLP corpus + catalogmeta-resource🔗 corpus · 🔗 catalog
Bangla Wikipedia Corpus (Kaggle)wiki-text📊 Kaggle
Wikipedia bnwiki dumpslatest dumps🔗 dumps.wikimedia.org
Leipzig Bengali corpora (2021)1.65 M sentences🔗 corpora.uni-leipzig.de
Wiki Articles (Kaggle)wiki snapshot📊 Kaggle
40k News Articles40 K📊 Kaggle
Largest Bangla Newspaperlarge multi-paper📊 Kaggle
bdNews24 corpusbdnews24 articles📊 Kaggle
Bangladesh ProtidinBangladesh Protidin news📊 Kaggle
csebuetnlp/xlsumXL-Sum (Bangla subset)🤗 HF
csebuetnlp/dailydialogue_bnDaily-dialogue translated🤗 HF
goru001/nlp-for-bengaliULMFiT model + Wiki / news data🔗 GitHub
masiur/Bangla-CorpusOpen community corpus🔗 GitHub

🔄 Machine Translation & Paraphrase

DatasetDescriptionLink
csebuetnlp/BanglaNMT2.38 M Bn-En pairs (133 MB)🤗 HF · 🔗 GitHub
AI4Bharat Samanantar49.6 M sentence pairs across Indic languages🤗 HF · 🔗 site
SUPara0.8MBalanced En-Bn corpus🔗 IEEE DataPort
BanglaSTEM5 K STEM Bn-En pairs📄 arXiv 2511.03498
WMT24 Bangla seed datasetHigh-quality manual translation📄 ACL 2024
BanglaParaphrase466 K paraphrase pairs (AACL 2022)🤗 HF · 🔗 GitHub
OPUS CollectionsMulti-source parallel corpora🔗 OPUS
Bengali Visual Genome 1.029 K image-caption multimodal🔗 LINDAT
Google Dakshina12 South-Asian transliteration / parallel🔗 GitHub
BanglaTLitRomanized → Bangla📄 ACL 2024
bntranslitTransliteration toolkit🔗 GitHub
Bengali Dictionary (Minhas Kamal)Dictionary🔗 GitHub
TED2020 (Bangla)TED multilingual📥 TSV

🎤 Speech (ASR / TTS / Emotion)

ASR / Recognition

DatasetDescription / SizeLink
OpenSLR-53Large Bengali ASR — 196 K utterances / 14.6 GB (Google)🔗 OpenSLR
OpenSLR (HF mirror)All OpenSLR languages🤗 HF
OpenSLR-104Multilingual code-switching🔗 OpenSLR
Bengali Common Voice (Mozilla)399 h+ / 19 817 contributors (v9.0)🔗 Mozilla
Bengali.AI OOD-Speech1 177 h / 22 645 speakers — largest Bn ASR🔗 Bengali.AI
FLEURS BanglaCross-lingual 12 h🤗 HF
BanglaASR DatasetFine-tuned ASR🔗 GitHub
SUST-CSE-Speech / banspeechTTS / ASR corpus🤗 HF
SKNahin / open-large-bengali-asr-dataLarge open ASR🤗 HF
Bangla-Speech-Corpora (Bangla-Language-Processing)Cleaned TTS-ready speech🔗 GitHub

TTS

DatasetDescriptionLink
OpenSLR-37High-quality Google Bengali TTS🔗 OpenSLR
Bengali.AI TTS datasetStudio-quality TTS🔗 site
bangla-tts (zabir-nabil)Real-time multilingual synthesis🔗 GitHub

Speech Emotion

DatasetDescriptionLink
SUBESCO7 K utterances / 7 emotions, gender-balanced📄 PLOS One
BanglaSER1 467 utterances / 34 speakers / 5 emotions🔗 ScienceDirect
KBESRealistic speech-emotion w/ intensity🔗 ScienceDirect
BANSpEmoBangla emotional speech📄 arXiv 2312.14020

Speech-to-Text Toolkits

ToolNotesLink
BanglaSpeech2TextWhisper-FT offline ASR (mp3/mp4/wav)🔗 GitHub

😊 Sentiment / Emotion / Sarcasm

DatasetSize / NotesLink
BanglaBook158 K book reviews🔗 GitHub
SentNoBNoisy social-media sentiment📊 Kaggle
EmoNoBa22 698 comments / 6 emotions (AACL 2022)📊 Kaggle · 📄 ACL
BanglaEmotion (shaoncsecu)Emotion benchmark🔗 GitHub
MONOVABMulti-label emotion📄 paper
BAN-ABSA / BANGLA-ABSA9 009 aspect-level comments📄 arXiv 2012.00288 · 📊 Mendeley
BanglaSenti (lexicon)61 582 polarity words🔗 GitHub
banglanlp/bangla-sentiment-classificationCompiled benchmarking sets🔗 GitHub
Ayubur sentiment datasetsMultiple legacy datasets🔗 GitHub
BanglaSarc5 112 sarcasm samples📊 Kaggle
BanglaSarc312 089 ternary-class sarcasm🔗 ScienceDirect
BnSentMix20 K Bn-En code-mix sentiment📄 paper
SentMix-3L / OffMix-3LBn-En-Hi code-mix📄 ACL
Drama ReviewBengali drama reviews📊 Figshare
YouTube Sentiment / EmotionYT comments📊 Kaggle
News Comments SentimentBn news comments📊 Kaggle
News Headline CategoriesHeadline classification📊 Kaggle
Big News ClassificationLarge news classifier📊 Kaggle
News Article Classification (IndicNLP)Indic news classifier📊 Kaggle
Bengali-Banglish EmotionMixed-script📊 Mendeley
E-commerce Sentiment + Emotion78 130 Daraz / Pickaboo reviews🔗 ScienceDirect
BanglishRev1.74 M Daraz code-mix reviews📄 arXiv 2412.13161

🛡️ Hate Speech / Toxic / Cyberbullying

DatasetSize / NotesLink
Bengali-Hate-Speech (rezacsedu)6 418 / 5 categories🔗 GitHub · 📊 UCI
Bengali Hate Speech (naurosromim)Annotated hate dataset📊 Kaggle
BIDWESHRegional-based hate speech📄 arXiv 2507.16183
BengaliSent140140 K hate vs non-hate🔗 IEEE DataPort
ToxLex_bn1 959 bigrams from 2.2 M FB comments📊 Mendeley
Multi-Labeled Bengali Toxic16 073 / 7 labels🔗 GitHub
Bangla-ToCo1 004 context-aware toxic🔗 ScienceDirect
Bangla Multilabel Cyberbully12 557 (5 classes)📊 Mendeley
Bangla Social-Media CyberbullyingYT/FB/IG/TikTok🔗 IEEE DataPort
Code-mixed Chaos (Banglish toxic)10 234 multi-label📊 Mendeley
BanglaMedia7 725 YT comments — 10 topics, 4 sentiments📊 Mendeley
VITD (BLP-2023 violence)Violence-inciting text — 3 classes🔗 BLP

🕵️ Fake News & Misinformation

DatasetSizeLink
BanFakeNews (LREC 2020)50 K news📊 Kaggle · 📄 arXiv 2004.08789
BanFakeNews-2.0 (2024)47 K real + 13 K fake📊 Mendeley
MultiBanFakeDetectMultimodal text + image🔗 ScienceDirect
Rowan1224/FakeNewsCode & data🔗 GitHub
DataCOVID1914 571 COVID misinformation🔗 Springer

🏷️ NER / POS / Parsing

DatasetSize / NotesLink
B-NER (IEEE Access)22 144 sentences🔗 IEEE
BanNERD (NAACL 2025)85 K sentences / 991 K tokens / 10 classes / 29 domains🔗 GitHub
NER-Bangla-Dataset (MISabic)70 K sentences / 5 types🔗 GitHub
bnlp-resources NERTrain/dev/test splits🌐 banglanlp.github.io
ANCHOLIK-NERRegional NER, 5 regions📄 arXiv 2502.11198
celloscope_bangla_ner_dataset319 K NER🤗 HF
celloscope_bangla_ner_dataset (small)6.57 K🤗 HF
Bangla-MedERMedical NER 2 980 / 6 types📊 Mendeley
Bangla NER (towhidahmedfoysal)400 K word-level📊 Kaggle
POS — 3 K sentencesabhishekgupta92🔗 GitHub
POS — 100 K+ words (towhidahmedfoysal)Word-level POS📊 Kaggle
UD_Bengali-BRU treebank14 UPOS tags, UD v2.9+🌐 universaldependencies.org

❓ Question Answering

DatasetSizeLink
csebuetnlp/squad_bn118 K train QA🤗 HF
BanglaRQA14 889 QA / 3 K passages (EMNLP 2022)🔗 GitHub
Bengali QA (Mayeesha)SQuAD 2.0–style Bn QA📊 Kaggle
BanglaQuAD30 808 QA pairs📄 arXiv 2410.10229
NCTB-QA87 805 educational QA📄 arXiv 2603.05462
doctor_qa_bangla5.14 K medical QA🤗 HF
TyDiQA (Bengali subset)Cross-lingual QA🤗 HF

📝 Text Summarization

DatasetSize / NotesLink
csebuetnlp/xlsumXL-Sum (Bangla subset, BBC)🤗 HF
BanglaCHQ-Summ2 350 health-question summary pairs🔗 GitHub
MultiBanAbsMulti-domain abstractive📄 arXiv 2511.19317
BNLPC + NCTBEACL 2021 unsupervised abstractive🔗 GitHub
BANSData (Prithwiraj)News abstractive📊 Kaggle
Bengali Text Summarization (Hasan Moni)Extractive + abstractive📊 Kaggle
BUSUM-BNLPMulti-document update summarization📊 Kaggle
bnSum_gemma7b-itGemma-7B inst news summary system🔗 GitHub
Bangla-Text-summarization-Dataset (Abid)Extractive🔗 GitHub
3 Human-Evaluated articles (BNLPC)Reference summaries🌐 BNLPC

🖊️ OCR, Handwriting & Document Layout

DatasetSize / NotesLink
NumtaDB85 K handwritten Bn-digit images📊 Kaggle
Bengali.AI Handwritten Grapheme ClassificationKaggle competition📊 Kaggle
EkushHandwritten Bn characters (largest)🌐 rabby.dev/ekush · 📊 Kaggle
BN-HTRd788 pages / 150 writers / 108 K words (HTR)📊 Mendeley
BanglaWritingMulti-purpose offline HTR📄 paper
BayannoMulti-purpose handwriting📊 Mendeley
BongabdoBn handwritten script📄 arXiv 2101.00204
CMATERdb (1 / 2.1.2)5 K word imgs / 18 K Bn city names🔗 site
BaDLAD33 695 layout samples / 6 domains📄 paper
BanglaDocAtlas8-class complex Bn document layout🔗 IEEE
DL Sprint 2.0 (BUET CSE Fest 2023)Layout segmentation📊 Kaggle
Bangla License Plate 2.5 K2 519 plate images🔗 Zenodo
BD-ALPDR725 high-res LP images🌐 site
Govt. Bangla OCR serviceFree Bangla OCR🌐 ocr.bangla.gov.bd

✋ Sign Language & Multimodal Vision

DatasetSize / NotesLink
BdSLW6060 sign words / 9 307 video trials📄 arXiv 2402.08635
KU-BdSL30 classes / 38 consonants📊 Mendeley
BAUST Lipi18 K imgs / 36 alphabets📄 arXiv 2408.10518
BDSL 4929 490 imgs / 49 labels📄 arXiv 2208.06827
BdSL364 M+ imgs / 36 cats📄 paper
Ego-SLDEgocentric Bn sign-language video🔗 IEEE DataPort
Bengali Visual Genome 1.0Multimodal MT + captioning🔗 LINDAT
BAN-CapEnglish-Bangla image-description📄 arXiv 2205.14462
BNATUREBn image captioning📊 Kaggle
BanglaView31 783 imgs / 158 K captions📊 Mendeley
csebuetnlp/illusionVQABn-aware VQA🤗 HF
DeshiFoodBD5 425 BD-cuisine images / 19 dishes🔗 Springer
FoodBD3 523 polygon-annotated meals (2025)🔗 Springer
BnLiT — Bangla Image-to-TextNatural-language image-text📊 Kaggle

🗺️ Regional Dialects

DatasetCoverageLink
ANCHOLIK-NERBarishal, Chittagong, Mymensingh, Noakhali, Sylhet📄 arXiv 2502.11198
ONUBADChittagong / Sylhet / Barisal → Standard Bn🔗 ScienceDirect
BanglaDial11 dialects / 60 729 entries🔗 PMC
BIDWESHRegional hate speech📄 arXiv 2507.16183
BanglaCHQ-Summ + dialect benchmarksSylheti / Chittagonian📄 ACL 2025
Sylheti → Standard NMTSylheti corpus🔗 ScienceDirect

🧪 NLI / Bias / Misc

DatasetDescriptionLink
csebuetnlp/xnli_bnBangla NLI translated from XNLI🤗 HF
BNLI (refined)Curated entail/contra/neutral📄 arXiv 2511.08813
csebuetnlp/BanglaSocialBiasSocial-bias evaluation🤗 HF
csebuetnlp/BanglaContextualBiasContextual-bias evaluation🤗 HF
csebuetnlp/CrossSumCross-lingual summarization🤗 HF
stopwords-iso/stopwords-bnStopword list🔗 GitHub
Bangla Plagiarism Dataset59.9 K🤗 HF
Banking 14-intents (en + bn + banglish)16.5 K intent samples🤗 HF
Massive intent (bn-BD)16.5 K🤗 HF
BanglaMusicStylo2 824 lyrics / 211 lyricists🔗 IEEE DataPort
Bangla Song Lyrics (genres + artists)Bn song-lyric corpus📊 Kaggle
Bn Numbers w/ WordsNumber-name dataset📊 Kaggle
likhonsheikh/BanglaNLP120 K parallel news pairs🤗 HF

🔧 NLP Tools & Libraries

Python Libraries

LibraryDescriptionLink
BNLP (sagorbrur)Comprehensive Bengali NLP toolkit🔗 GitHub · pip install bnlp_toolkit
BNLTKBangla NLP toolkit (tokenize / stem / POS)🔗 GitHub
sbnltkThis repo's toolkit (sentiment / NER / POS / sum)🔗 GitHub
bangla-stemmerLightweight Bn stemmer🔗 PyPI
bnunicodeBijoy → Unicode normalization🔗 GitHub
Indic NLP LibraryMulti-Indic processing / transliteration🔗 GitHub
bntranslitBengali transliteration🔗 GitHub
BanglaSpeech2TextBangla offline ASR🔗 GitHub
bangla-ttsBangla TTS library🔗 GitHub
BanglaKit organisationTools, datasets, resources🔗 GitHub

OCR / Vision

ToolNotesLink
EasyOCRBuilt-in Bangla support🔗 GitHub
Tesseract OCRben traineddata available🔗 GitHub
ocr.bangla.gov.bdGovt-hosted Bangla OCR service🌐 site

📄 Research Papers

Foundational

LLMs & Generation (2024–2025)

QA / Reading Comprehension

NER

Summarization

Speech

Workshops


🇧🇩 Bangladesh Government Resources

বাংলাদেশ সরকারের তথ্যপ্রযুক্তি ও বাংলা ভাষাগত সম্পদ:

Resourceবাংলা নামLink
Bangladesh National Corpus (BdNC)বাংলাদেশ জাতীয় কর্পাস (৪০ GB / ৩B+ শব্দ)🌐 corpus.bangla.gov.bd
Govt. Bangla OCRসরকারি বাংলা OCR সেবা🌐 ocr.bangla.gov.bd
Accessible Dictionaryপ্রতিবন্ধী-বান্ধব বাংলা অভিধান🌐 accessibledictionary.gov.bd
EBLICT Projectতথ্যপ্রযুক্তিতে বাংলা ভাষা সমৃদ্ধকরণ প্রকল্প🌐 eblict.portal.gov.bd
IPA — Information Processing Authorityবাংলা ভাষা প্রক্রিয়াকরণ কর্তৃপক্ষ🌐 ipa.bangla.gov.bd
Bangladesh Computer Council (BCC)বাংলাদেশ কম্পিউটার কাউন্সিল🌐 bcc.gov.bd
Bangla Academyবাংলা একাডেমি🌐 banglaacademy.gov.bd

🔗 Curated Aggregator Lists (start here)

ResourceMaintainerLink
bnlp-resourcesbanglanlp🔗 GitHub · 🌐 site
awesome-banglabanglakit🔗 GitHub
bangla-corpussagorbrur🔗 GitHub
Awesome_Bangla_Datasetssabbirhossainujjal🔗 GitHub
AI4Bharat Indic NLP catalogAI4Bharat🔗 GitHub
Mahadih534 — Bangla NLP HF collectionMahadih534🤗 HF
Mahadih534 — Bangla TTS collectionMahadih534🤗 HF
Mahadih534 — Bangla LLM finetuningMahadih534🤗 HF
csebuetnlp organizationBUET CSE NLP🤗 HF
Sudipta Kar Bangla NLP resourcespersonal🌐 site
হাতেকলমে Bangla NLP (Rakibul Hassan)educational notebooks🔗 GitHub · 🌐 book
GitHub topic: bangla-nlpcommunity-tagged🌐 topic
GitHub topic: bengali-nlpcommunity-tagged🌐 topic
Awesome Public Datasets (general NLP)community🔗 GitHub
NLP Datasets Collectioncommunity🔗 GitHub

💡 Motivation & Contribution

Bangla is the 6th-most-spoken language in the world (~270 million native speakers) but remains classified as low-resource in NLP. This repository exists to make every Bangla NLP resource one click away — accurately documented and free of fabricated links.

How to Get Started

  1. For Pre-trained Models — visit the HuggingFace links above and load directly with transformers.
  2. For Tools — pip install bnlp_toolkit or pip install bnltk.
  3. For Datasets — follow individual links; honor each dataset's license (most are CC BY-NC-SA 4.0).
  4. For Research — start with the BLP workshop proceedings and the latest 2024–2026 release table.

Contributing

  • 📝 Submit new datasets via pull request — include a working URL and one-line description.
  • 🐛 Report broken / fabricated links by opening an issue.
  • 🔬 Tag your own paper to share with the community.
  • ✅ Every PR is welcome — please verify URLs return 200 before submitting.

⭐ If this repository helps your work, please give it a star! ⭐

🤝 Contributions, corrections, and additions are very welcome.

🌟 Thanks to every researcher and developer pushing Bangla NLP forward.


☕ Support This Project

If this resource has been helpful, you can support its maintenance:

Buy Me A Coffee

bengali-dataset
dataset
nlp
question-answering
sentiment-analysis
text-classification
text-summarization

Foysal87/Bangla-NLP-Dataset

Bangla NLP dataset. Bangla NER,POStag, text summarization, stopword, translate, sentiment analysis, wiki articles, root word, dataset etc.

72

15 commits

updated May 3, 2026

See the code

README

🇧🇩 Bangla NLP Dataset

Bangla NLP Datasets License Contribution

A comprehensive, URL-validated collection of Bangla / Bengali NLP datasets, models, tools, and corpora — for researchers, students, and developers.

বাংলা ভাষার এনএলপি গবেষণা, শিক্ষা এবং প্রায়োগিক কাজের জন্য একটি যাচাইকৃত সম্পদ-সংগ্রহ।


🔄 Our sbnltk dataset is in LFS mode — clone the repository to download data.

🚀 All deep-learning-era datasets are linked below; we'll keep adding new releases.

📑 Table of Contents

📖 About

This repository contains the sbnltk datasets used in the Bangla NLP toolkit sbnltk, and serves as a comprehensive, URL-validated catalogue of publicly available Bangla NLP resources contributed by the worldwide Bangla research community.

Validation note: Every link in this document was tested between 2025–2026. Resources that previously appeared here under fabricated GitHub paths (e.g. github.com/poetry-bangla/corpus, github.com/medical-bangla/medical-translation, etc.) have been removed. If you find a dead link, please open an issue.

🎯 sbnltk Dataset List (DUMP & HUMAN Evaluated)

DatasetDescriptionLink
Number ListBangla number list📥 Download
Root Word ListBangla root word list📥 Download
Word ListBangla word list (highest → lowest occurrence)📥 Download
Wiki DumpBangla wiki dump words📥 Download
POS Tag StaticBangla POS-tag static dataset (single word)📥 Download
NER StaticBangla NER static dataset (single word)📥 Download
Stop WordsBangla stop-word list📥 Download
Dump POS TagBangla dump POS-tag📥 Download
Question ClassificationBangla dump question classification dataset📥 Download
Sentiment AnalysisBangla dump sentiment analysis📥 Download
Translation DatasetGoogle translation dataset📥 Download
NER EnhancedExisting NER dataset (modified + Date entity)📥 Download
News ArticlesNews article dataset📥 Download
POS ConvertedPOS-tag converted data📥 Download
POS Human EvaluatedPOS-tag human-evaluated data📥 Download
NER Dump (Both)Dump NER (active + passive)📥 Download
NER Dump (Active)Dump NER (active only)📥 Download
Extractive SummarizationExtractive text summarization🔗 GitHub
Abstractive SummarizationAbstractive summarization (newspaper)📥 Drive · 📊 Kaggle
Text ClassificationNews article classification📥 Drive · 📊 Kaggle
Keywords ClassificationTopic-keyword classification📥 Drive · 📊 Kaggle

🤖 Pre-trained Language Models

BERT-style Encoders

ModelDescriptionParamsLink
BanglaBERTELECTRA discriminator, SOTA Bangla NLU (BUET CSE NLP)110M🤗 HF · 🔗 GitHub
BanglaBERT (Small)Lightweight variant13M🤗 HF
BanglaBERT (Large)Large variant, top scores on BLUB335M🤗 HF
BanglishBERTBilingual (Bangla + English)110M🤗 HF
Bangla BERT Base (sagorsarker)Popular community BERT110M🤗 HF
mBERT-Bengali-NERMultilingual BERT fine-tuned for NER—🤗 HF
mBERT-Bengali-TyDiQA-QAmBERT fine-tuned for QA—🤗 HF
sahajBERTALBERT-based collaborative training18M🤗 HF
MuRILGoogle multilingual (17 Indian)236M🤗 HF
IndicBERTAI4Bharat (12 Indian)—🤗 HF

Generative / Seq2Seq Models

ModelDescriptionParamsLink
BanglaT5T5-style seq2seq (BUET)247M🤗 HF
BanglaT5 (small)Small T5 variant60M🤗 HF
BanglaT5 NMT bn↔enTranslation seq2seq—🤗 bn→en · 🤗 en→bn
BanglaT5-ParaphraseParaphrase seq2seq—🤗 HF
BanglaByT5Byte-level T5small📄 arXiv 2505.17102
GPT-2 BengaliFlax-community GPT-2117M🤗 HF

Bangla LLMs (2025)

ModelDescriptionParamsLink
TigerLLM-1B-itBangla instruction-tuned LLM1B🤗 HF
TigerLLM-9B-itLarger variant, beats GPT-3.5 on Bangla9B🤗 HF
TituLLMs (1B / 3B)Family of Bangla LLMs with benchmarks1B / 3B📄 arXiv 2502.11187
TigerLLM PaperACL 2025 short paper—📄 arXiv 2503.10995 · 📄 ACL 2025
BanglaLLaMA-3-8B-BnWiki-InstructLlama-3 fine-tuned on Bn Wiki8B🤗 HF
Bangla LLaMA (saiful9379)LoRA-tuned LLaMA—🔗 GitHub

Speech Models

ModelDescriptionPerformanceLink
Wav2Vec2-Bengali (300M)Self-supervised ASR17.8 % WER🤗 HF
Wav2Vec2-XLSR BengaliXLSR fine-tune—🤗 HF
BanglaConformerConformer ASR by Bengali.AI—🤗 HF
BanglaASRWhisper fine-tuned for Bengali14.73 % WER🤗 HF · 🔗 GitHub
Whisper (multilingual)OpenAI base model — Bn supportedvarious sizes🤗 HF

Word & Sentence Embeddings

ResourceDescriptionLink
Bangla FastText (sagorsarker)20 M-token wiki-trained skipgram + CBOW🤗 HF
Bangla Word2Vec (sagorsarker)100-d Wikipedia embeddings🤗 HF
fastText 157-language BengaliFacebook 300-d Wiki + CC🌐 fastText
Spark NLP bengali_cc_300dProduction embedding🔗 Spark NLP
BanglaEmbedCross-lingual distilled sentence embeddings📄 arXiv 2411.15270

📚 Latest 2024–2026 Datasets

These are the most relevant new releases — cite the original authors when used.

DatasetTaskSize / NotesLink
Bangla-InstructInstruction-tuning342 K instruction–response pairs🤗 HF
Bangla-TextBookLM pretraining9.9 M tokens, 163 NCTB textbooks🤗 HF
BanglaSTEMTechnical-domain MT5 K Bn-En STEM sentence pairs📄 arXiv 2511.03498
NCTB-QAEducational QA87 805 QA pairs (grade 1–10)📄 arXiv 2603.05462
BanglaQuADOpen-domain QA30 808 QA pairs📄 arXiv 2410.10229
ANCHOLIK-NERRegional-dialect NER17 405 sentences, 5 regions📄 arXiv 2502.11198
BanNERD (NAACL 2025)NER, 10 classes / 29 domains85 K sentences, 991 K tokens🔗 GitHub
ONUBADDialect→Standard MTChittagong / Sylhet / Barisal🔗 ScienceDirect
BanglaDialDialect text corpus60 729 entries × 11 dialects🔗 PMC
BIDWESHRegional hate speechMulti-region📄 arXiv 2507.16183
BanglaTLitRomanized→Bn back-transliteration42.7 K + 245.7 K pretrain📄 ACL 2024
BanglishRevE-commerce code-mix reviews1.74 M Daraz reviews📄 arXiv 2412.13161
BengaliSent140Hate vs non-hate fusion140 K speeches📄 arXiv 2601.20129 · 🔗 IEEE DataPort
BLUCKLLM cultural-knowledge benchmark2 366 MCQs / 23 categories📄 arXiv 2505.21092
BNLI (refined)NLICurated entail/contra/neutral📄 arXiv 2511.08813
MultiBanAbsMulti-domain abstractive sum.Multi-corpus📄 arXiv 2511.19317
MultiBanFakeDetectMultimodal fake newsText + image🔗 ScienceDirect
BanFakeNews-2.0Fake news (2024)47 K real + 13 K fake📊 Mendeley
BanglaHealthHealth-domain paraphrase200 K sentences🔗 ScienceDirect
BanglaCHQ-SummConsumer-health-question summary2 350 pairs (BLP-2023)🔗 GitHub
Bangla-MedERMedical NER2 980 texts, 6 entity types📊 Mendeley
BanglaSarc3Sarcasm (ternary)12 089 FB comments🔗 ScienceDirect
VACASPATIBangla literature corpus11 M sentences / 115 M words📄 arXiv 2307.05083
MixSarcCode-mix sarcasm/humor/offenceBn-En transliterated📄 arXiv 2602.21608
EmoMix-3LCode-mix emotion1 071 Bn-Hi-En instances🔗 GitHub
Bangla-ToCoContext-aware toxic1 004 FB news comments🔗 ScienceDirect
BanglaDocAtlasDocument-layout, 8 classesannotated complex docs🔗 IEEE
FoodBDBD cuisine images, 67 categories3 523 polygon-annotated meals🔗 Springer 2025
DeshiFoodBDBD traditional food images5 425 images / 19 dishes🔗 Springer

📊 Benchmarking and Evaluation

BLUB — Bangla Language Understanding Benchmark

The first comprehensive Bangla NLU benchmark, introduced with BanglaBERT (NAACL 2022).

TaskDatasetMetricBest ModelScore
Sentiment ClassificationSentNoBMacro-F1BanglaBERT72.89
Natural Language InferenceXNLI-bn / BNLIAccuracyBanglaBERT (Large)83.41
Named Entity RecognitionMultiCoNERMicro-F1BanglaBERT (Large)79.20
Question AnsweringSQuAD-bn / TyDiQAEM / F1BanglaBERT (Large)76.10 / 81.50

📄 BLUB code & leaderboard: github.com/csebuetnlp/banglabert

BLUCK — Bangla LLM Cultural & Linguistic Benchmark (2025)

2 366 multiple-choice questions across 23 categories covering Bangladesh culture, history, and Bangla linguistics — designed to probe LLM cultural knowledge. 📄 arXiv 2505.21092

Recent Benchmark Datasets

DatasetTaskSizeLink
BanglaBookSentiment158 065 reviews🔗 GitHub
SentMix-3L / OffMix-3LCode-mix sentiment / offence~1 K each📄 ACL
MultiCoNER (Bangla)Multilingual complex NERtask🔗 multiconer.github.io

📰 News, Corpora & Pretraining Data

DatasetSizeLink
Bangla2B+ (BanglaBERT pretraining corpus)27.5 GB / 110 sites🔗 GitHub
BanglaLM (data-mining corpus)14 GB📄 IEEE
BdNC – Bangladesh National Corpus ✅40 GB / 3 B+ words🔗 corpus.bangla.gov.bd
VACASPATI literary corpus11 M sentences📄 arXiv 2307.05083
CC-100 Bangla8.3 GB🔗 StatMT
OSCAR Bangla12 GB+🔗 OSCAR
AI4Bharat IndicCorp9 B tokens incl. Bangla🔗 site
AI4Bharat IndicNLP corpus + catalogmeta-resource🔗 corpus · 🔗 catalog
Bangla Wikipedia Corpus (Kaggle)wiki-text📊 Kaggle
Wikipedia bnwiki dumpslatest dumps🔗 dumps.wikimedia.org
Leipzig Bengali corpora (2021)1.65 M sentences🔗 corpora.uni-leipzig.de
Wiki Articles (Kaggle)wiki snapshot📊 Kaggle
40k News Articles40 K📊 Kaggle
Largest Bangla Newspaperlarge multi-paper📊 Kaggle
bdNews24 corpusbdnews24 articles📊 Kaggle
Bangladesh ProtidinBangladesh Protidin news📊 Kaggle
csebuetnlp/xlsumXL-Sum (Bangla subset)🤗 HF
csebuetnlp/dailydialogue_bnDaily-dialogue translated🤗 HF
goru001/nlp-for-bengaliULMFiT model + Wiki / news data🔗 GitHub
masiur/Bangla-CorpusOpen community corpus🔗 GitHub

🔄 Machine Translation & Paraphrase

DatasetDescriptionLink
csebuetnlp/BanglaNMT2.38 M Bn-En pairs (133 MB)🤗 HF · 🔗 GitHub
AI4Bharat Samanantar49.6 M sentence pairs across Indic languages🤗 HF · 🔗 site
SUPara0.8MBalanced En-Bn corpus🔗 IEEE DataPort
BanglaSTEM5 K STEM Bn-En pairs📄 arXiv 2511.03498
WMT24 Bangla seed datasetHigh-quality manual translation📄 ACL 2024
BanglaParaphrase466 K paraphrase pairs (AACL 2022)🤗 HF · 🔗 GitHub
OPUS CollectionsMulti-source parallel corpora🔗 OPUS
Bengali Visual Genome 1.029 K image-caption multimodal🔗 LINDAT
Google Dakshina12 South-Asian transliteration / parallel🔗 GitHub
BanglaTLitRomanized → Bangla📄 ACL 2024
bntranslitTransliteration toolkit🔗 GitHub
Bengali Dictionary (Minhas Kamal)Dictionary🔗 GitHub
TED2020 (Bangla)TED multilingual📥 TSV

🎤 Speech (ASR / TTS / Emotion)

ASR / Recognition

DatasetDescription / SizeLink
OpenSLR-53Large Bengali ASR — 196 K utterances / 14.6 GB (Google)🔗 OpenSLR
OpenSLR (HF mirror)All OpenSLR languages🤗 HF
OpenSLR-104Multilingual code-switching🔗 OpenSLR
Bengali Common Voice (Mozilla)399 h+ / 19 817 contributors (v9.0)🔗 Mozilla
Bengali.AI OOD-Speech1 177 h / 22 645 speakers — largest Bn ASR🔗 Bengali.AI
FLEURS BanglaCross-lingual 12 h🤗 HF
BanglaASR DatasetFine-tuned ASR🔗 GitHub
SUST-CSE-Speech / banspeechTTS / ASR corpus🤗 HF
SKNahin / open-large-bengali-asr-dataLarge open ASR🤗 HF
Bangla-Speech-Corpora (Bangla-Language-Processing)Cleaned TTS-ready speech🔗 GitHub

TTS

DatasetDescriptionLink
OpenSLR-37High-quality Google Bengali TTS🔗 OpenSLR
Bengali.AI TTS datasetStudio-quality TTS🔗 site
bangla-tts (zabir-nabil)Real-time multilingual synthesis🔗 GitHub

Speech Emotion

DatasetDescriptionLink
SUBESCO7 K utterances / 7 emotions, gender-balanced📄 PLOS One
BanglaSER1 467 utterances / 34 speakers / 5 emotions🔗 ScienceDirect
KBESRealistic speech-emotion w/ intensity🔗 ScienceDirect
BANSpEmoBangla emotional speech📄 arXiv 2312.14020

Speech-to-Text Toolkits

ToolNotesLink
BanglaSpeech2TextWhisper-FT offline ASR (mp3/mp4/wav)🔗 GitHub

😊 Sentiment / Emotion / Sarcasm

DatasetSize / NotesLink
BanglaBook158 K book reviews🔗 GitHub
SentNoBNoisy social-media sentiment📊 Kaggle
EmoNoBa22 698 comments / 6 emotions (AACL 2022)📊 Kaggle · 📄 ACL
BanglaEmotion (shaoncsecu)Emotion benchmark🔗 GitHub
MONOVABMulti-label emotion📄 paper
BAN-ABSA / BANGLA-ABSA9 009 aspect-level comments📄 arXiv 2012.00288 · 📊 Mendeley
BanglaSenti (lexicon)61 582 polarity words🔗 GitHub
banglanlp/bangla-sentiment-classificationCompiled benchmarking sets🔗 GitHub
Ayubur sentiment datasetsMultiple legacy datasets🔗 GitHub
BanglaSarc5 112 sarcasm samples📊 Kaggle
BanglaSarc312 089 ternary-class sarcasm🔗 ScienceDirect
BnSentMix20 K Bn-En code-mix sentiment📄 paper
SentMix-3L / OffMix-3LBn-En-Hi code-mix📄 ACL
Drama ReviewBengali drama reviews📊 Figshare
YouTube Sentiment / EmotionYT comments📊 Kaggle
News Comments SentimentBn news comments📊 Kaggle
News Headline CategoriesHeadline classification📊 Kaggle
Big News ClassificationLarge news classifier📊 Kaggle
News Article Classification (IndicNLP)Indic news classifier📊 Kaggle
Bengali-Banglish EmotionMixed-script📊 Mendeley
E-commerce Sentiment + Emotion78 130 Daraz / Pickaboo reviews🔗 ScienceDirect
BanglishRev1.74 M Daraz code-mix reviews📄 arXiv 2412.13161

🛡️ Hate Speech / Toxic / Cyberbullying

DatasetSize / NotesLink
Bengali-Hate-Speech (rezacsedu)6 418 / 5 categories🔗 GitHub · 📊 UCI
Bengali Hate Speech (naurosromim)Annotated hate dataset📊 Kaggle
BIDWESHRegional-based hate speech📄 arXiv 2507.16183
BengaliSent140140 K hate vs non-hate🔗 IEEE DataPort
ToxLex_bn1 959 bigrams from 2.2 M FB comments📊 Mendeley
Multi-Labeled Bengali Toxic16 073 / 7 labels🔗 GitHub
Bangla-ToCo1 004 context-aware toxic🔗 ScienceDirect
Bangla Multilabel Cyberbully12 557 (5 classes)📊 Mendeley
Bangla Social-Media CyberbullyingYT/FB/IG/TikTok🔗 IEEE DataPort
Code-mixed Chaos (Banglish toxic)10 234 multi-label📊 Mendeley
BanglaMedia7 725 YT comments — 10 topics, 4 sentiments📊 Mendeley
VITD (BLP-2023 violence)Violence-inciting text — 3 classes🔗 BLP

🕵️ Fake News & Misinformation

DatasetSizeLink
BanFakeNews (LREC 2020)50 K news📊 Kaggle · 📄 arXiv 2004.08789
BanFakeNews-2.0 (2024)47 K real + 13 K fake📊 Mendeley
MultiBanFakeDetectMultimodal text + image🔗 ScienceDirect
Rowan1224/FakeNewsCode & data🔗 GitHub
DataCOVID1914 571 COVID misinformation🔗 Springer

🏷️ NER / POS / Parsing

DatasetSize / NotesLink
B-NER (IEEE Access)22 144 sentences🔗 IEEE
BanNERD (NAACL 2025)85 K sentences / 991 K tokens / 10 classes / 29 domains🔗 GitHub
NER-Bangla-Dataset (MISabic)70 K sentences / 5 types🔗 GitHub
bnlp-resources NERTrain/dev/test splits🌐 banglanlp.github.io
ANCHOLIK-NERRegional NER, 5 regions📄 arXiv 2502.11198
celloscope_bangla_ner_dataset319 K NER🤗 HF
celloscope_bangla_ner_dataset (small)6.57 K🤗 HF
Bangla-MedERMedical NER 2 980 / 6 types📊 Mendeley
Bangla NER (towhidahmedfoysal)400 K word-level📊 Kaggle
POS — 3 K sentencesabhishekgupta92🔗 GitHub
POS — 100 K+ words (towhidahmedfoysal)Word-level POS📊 Kaggle
UD_Bengali-BRU treebank14 UPOS tags, UD v2.9+🌐 universaldependencies.org

❓ Question Answering

DatasetSizeLink
csebuetnlp/squad_bn118 K train QA🤗 HF
BanglaRQA14 889 QA / 3 K passages (EMNLP 2022)🔗 GitHub
Bengali QA (Mayeesha)SQuAD 2.0–style Bn QA📊 Kaggle
BanglaQuAD30 808 QA pairs📄 arXiv 2410.10229
NCTB-QA87 805 educational QA📄 arXiv 2603.05462
doctor_qa_bangla5.14 K medical QA🤗 HF
TyDiQA (Bengali subset)Cross-lingual QA🤗 HF

📝 Text Summarization

DatasetSize / NotesLink
csebuetnlp/xlsumXL-Sum (Bangla subset, BBC)🤗 HF
BanglaCHQ-Summ2 350 health-question summary pairs🔗 GitHub
MultiBanAbsMulti-domain abstractive📄 arXiv 2511.19317
BNLPC + NCTBEACL 2021 unsupervised abstractive🔗 GitHub
BANSData (Prithwiraj)News abstractive📊 Kaggle
Bengali Text Summarization (Hasan Moni)Extractive + abstractive📊 Kaggle
BUSUM-BNLPMulti-document update summarization📊 Kaggle
bnSum_gemma7b-itGemma-7B inst news summary system🔗 GitHub
Bangla-Text-summarization-Dataset (Abid)Extractive🔗 GitHub
3 Human-Evaluated articles (BNLPC)Reference summaries🌐 BNLPC

🖊️ OCR, Handwriting & Document Layout

DatasetSize / NotesLink
NumtaDB85 K handwritten Bn-digit images📊 Kaggle
Bengali.AI Handwritten Grapheme ClassificationKaggle competition📊 Kaggle
EkushHandwritten Bn characters (largest)🌐 rabby.dev/ekush · 📊 Kaggle
BN-HTRd788 pages / 150 writers / 108 K words (HTR)📊 Mendeley
BanglaWritingMulti-purpose offline HTR📄 paper
BayannoMulti-purpose handwriting📊 Mendeley
BongabdoBn handwritten script📄 arXiv 2101.00204
CMATERdb (1 / 2.1.2)5 K word imgs / 18 K Bn city names🔗 site
BaDLAD33 695 layout samples / 6 domains📄 paper
BanglaDocAtlas8-class complex Bn document layout🔗 IEEE
DL Sprint 2.0 (BUET CSE Fest 2023)Layout segmentation📊 Kaggle
Bangla License Plate 2.5 K2 519 plate images🔗 Zenodo
BD-ALPDR725 high-res LP images🌐 site
Govt. Bangla OCR serviceFree Bangla OCR🌐 ocr.bangla.gov.bd

✋ Sign Language & Multimodal Vision

DatasetSize / NotesLink
BdSLW6060 sign words / 9 307 video trials📄 arXiv 2402.08635
KU-BdSL30 classes / 38 consonants📊 Mendeley
BAUST Lipi18 K imgs / 36 alphabets📄 arXiv 2408.10518
BDSL 4929 490 imgs / 49 labels📄 arXiv 2208.06827
BdSL364 M+ imgs / 36 cats📄 paper
Ego-SLDEgocentric Bn sign-language video🔗 IEEE DataPort
Bengali Visual Genome 1.0Multimodal MT + captioning🔗 LINDAT
BAN-CapEnglish-Bangla image-description📄 arXiv 2205.14462
BNATUREBn image captioning📊 Kaggle
BanglaView31 783 imgs / 158 K captions📊 Mendeley
csebuetnlp/illusionVQABn-aware VQA🤗 HF
DeshiFoodBD5 425 BD-cuisine images / 19 dishes🔗 Springer
FoodBD3 523 polygon-annotated meals (2025)🔗 Springer
BnLiT — Bangla Image-to-TextNatural-language image-text📊 Kaggle

🗺️ Regional Dialects

DatasetCoverageLink
ANCHOLIK-NERBarishal, Chittagong, Mymensingh, Noakhali, Sylhet📄 arXiv 2502.11198
ONUBADChittagong / Sylhet / Barisal → Standard Bn🔗 ScienceDirect
BanglaDial11 dialects / 60 729 entries🔗 PMC
BIDWESHRegional hate speech📄 arXiv 2507.16183
BanglaCHQ-Summ + dialect benchmarksSylheti / Chittagonian📄 ACL 2025
Sylheti → Standard NMTSylheti corpus🔗 ScienceDirect

🧪 NLI / Bias / Misc

DatasetDescriptionLink
csebuetnlp/xnli_bnBangla NLI translated from XNLI🤗 HF
BNLI (refined)Curated entail/contra/neutral📄 arXiv 2511.08813
csebuetnlp/BanglaSocialBiasSocial-bias evaluation🤗 HF
csebuetnlp/BanglaContextualBiasContextual-bias evaluation🤗 HF
csebuetnlp/CrossSumCross-lingual summarization🤗 HF
stopwords-iso/stopwords-bnStopword list🔗 GitHub
Bangla Plagiarism Dataset59.9 K🤗 HF
Banking 14-intents (en + bn + banglish)16.5 K intent samples🤗 HF
Massive intent (bn-BD)16.5 K🤗 HF
BanglaMusicStylo2 824 lyrics / 211 lyricists🔗 IEEE DataPort
Bangla Song Lyrics (genres + artists)Bn song-lyric corpus📊 Kaggle
Bn Numbers w/ WordsNumber-name dataset📊 Kaggle
likhonsheikh/BanglaNLP120 K parallel news pairs🤗 HF

🔧 NLP Tools & Libraries

Python Libraries

LibraryDescriptionLink
BNLP (sagorbrur)Comprehensive Bengali NLP toolkit🔗 GitHub · pip install bnlp_toolkit
BNLTKBangla NLP toolkit (tokenize / stem / POS)🔗 GitHub
sbnltkThis repo's toolkit (sentiment / NER / POS / sum)🔗 GitHub
bangla-stemmerLightweight Bn stemmer🔗 PyPI
bnunicodeBijoy → Unicode normalization🔗 GitHub
Indic NLP LibraryMulti-Indic processing / transliteration🔗 GitHub
bntranslitBengali transliteration🔗 GitHub
BanglaSpeech2TextBangla offline ASR🔗 GitHub
bangla-ttsBangla TTS library🔗 GitHub
BanglaKit organisationTools, datasets, resources🔗 GitHub

OCR / Vision

ToolNotesLink
EasyOCRBuilt-in Bangla support🔗 GitHub
Tesseract OCRben traineddata available🔗 GitHub
ocr.bangla.gov.bdGovt-hosted Bangla OCR service🌐 site

📄 Research Papers

Foundational

LLMs & Generation (2024–2025)

QA / Reading Comprehension

NER

Summarization

Speech

Workshops


🇧🇩 Bangladesh Government Resources

বাংলাদেশ সরকারের তথ্যপ্রযুক্তি ও বাংলা ভাষাগত সম্পদ:

Resourceবাংলা নামLink
Bangladesh National Corpus (BdNC)বাংলাদেশ জাতীয় কর্পাস (৪০ GB / ৩B+ শব্দ)🌐 corpus.bangla.gov.bd
Govt. Bangla OCRসরকারি বাংলা OCR সেবা🌐 ocr.bangla.gov.bd
Accessible Dictionaryপ্রতিবন্ধী-বান্ধব বাংলা অভিধান🌐 accessibledictionary.gov.bd
EBLICT Projectতথ্যপ্রযুক্তিতে বাংলা ভাষা সমৃদ্ধকরণ প্রকল্প🌐 eblict.portal.gov.bd
IPA — Information Processing Authorityবাংলা ভাষা প্রক্রিয়াকরণ কর্তৃপক্ষ🌐 ipa.bangla.gov.bd
Bangladesh Computer Council (BCC)বাংলাদেশ কম্পিউটার কাউন্সিল🌐 bcc.gov.bd
Bangla Academyবাংলা একাডেমি🌐 banglaacademy.gov.bd

🔗 Curated Aggregator Lists (start here)

ResourceMaintainerLink
bnlp-resourcesbanglanlp🔗 GitHub · 🌐 site
awesome-banglabanglakit🔗 GitHub
bangla-corpussagorbrur🔗 GitHub
Awesome_Bangla_Datasetssabbirhossainujjal🔗 GitHub
AI4Bharat Indic NLP catalogAI4Bharat🔗 GitHub
Mahadih534 — Bangla NLP HF collectionMahadih534🤗 HF
Mahadih534 — Bangla TTS collectionMahadih534🤗 HF
Mahadih534 — Bangla LLM finetuningMahadih534🤗 HF
csebuetnlp organizationBUET CSE NLP🤗 HF
Sudipta Kar Bangla NLP resourcespersonal🌐 site
হাতেকলমে Bangla NLP (Rakibul Hassan)educational notebooks🔗 GitHub · 🌐 book
GitHub topic: bangla-nlpcommunity-tagged🌐 topic
GitHub topic: bengali-nlpcommunity-tagged🌐 topic
Awesome Public Datasets (general NLP)community🔗 GitHub
NLP Datasets Collectioncommunity🔗 GitHub

💡 Motivation & Contribution

Bangla is the 6th-most-spoken language in the world (~270 million native speakers) but remains classified as low-resource in NLP. This repository exists to make every Bangla NLP resource one click away — accurately documented and free of fabricated links.

How to Get Started

  1. For Pre-trained Models — visit the HuggingFace links above and load directly with transformers.
  2. For Tools — pip install bnlp_toolkit or pip install bnltk.
  3. For Datasets — follow individual links; honor each dataset's license (most are CC BY-NC-SA 4.0).
  4. For Research — start with the BLP workshop proceedings and the latest 2024–2026 release table.

Contributing

  • 📝 Submit new datasets via pull request — include a working URL and one-line description.
  • 🐛 Report broken / fabricated links by opening an issue.
  • 🔬 Tag your own paper to share with the community.
  • ✅ Every PR is welcome — please verify URLs return 200 before submitting.

⭐ If this repository helps your work, please give it a star! ⭐

🤝 Contributions, corrections, and additions are very welcome.

🌟 Thanks to every researcher and developer pushing Bangla NLP forward.


☕ Support This Project

If this resource has been helpful, you can support its maintenance:

Buy Me A Coffee

bengali-dataset
dataset
nlp
question-answering
sentiment-analysis
text-classification
text-summarization