A comprehensive collection of data quality resources, tools, papers, and projects across various data types including traditional data, LLM pretraining/fine-tuning data, multimodal data, and more. Essential reference for researchers and practitioners in data-centric AI.
31
39 commits
updated Oct 5, 2026
Resources, tools, papers, and projects for ensuring data reliability and effectiveness across traditional data, LLM pretraining/fine-tuning data, multimodal data, and more.
Data quality is a critical aspect of any data-driven application or research. This repository collects resources related to data quality across different data types, including traditional data, large language model data (both pretraining and fine-tuning), multimodal data, and more.
This section covers data quality for traditional structured and unstructured data.
This subsection covers methods and tools for assessing data readiness for AI applications.
This section covers data quality for large language model pretraining data.
This section covers data quality for large language model fine-tuning data.
This section covers comprehensive data management approaches for LLMs, including data processing, storage, and serving.
This section focuses on cognition engineering and test-time scaling methods that improve data quality through enhanced reasoning and thinking processes.
This section covers data quality for multimodal data, including image-text pairs, video, and audio.
This section covers data quality for tabular data.
This section covers data quality for time series data.
This section covers data quality for graph data.
This section focuses on data quality management for machine learning models, following the Data-Centric AI paradigm. It includes papers and resources related to data valuation, data selection, and benchmarks for evaluating data quality in ML pipelines.
A comprehensive collection of data quality resources, tools, papers, and projects across various data types including traditional data, LLM pretraining/fine-tuning data, multimodal data, and more. Essential reference for researchers and practitioners in data-centric AI.
31
39 commits
updated Oct 5, 2026
Resources, tools, papers, and projects for ensuring data reliability and effectiveness across traditional data, LLM pretraining/fine-tuning data, multimodal data, and more.
Data quality is a critical aspect of any data-driven application or research. This repository collects resources related to data quality across different data types, including traditional data, large language model data (both pretraining and fine-tuning), multimodal data, and more.
This section covers data quality for traditional structured and unstructured data.
This subsection covers methods and tools for assessing data readiness for AI applications.
This section covers data quality for large language model pretraining data.
This section covers data quality for large language model fine-tuning data.
This section covers comprehensive data management approaches for LLMs, including data processing, storage, and serving.
This section focuses on cognition engineering and test-time scaling methods that improve data quality through enhanced reasoning and thinking processes.
This section covers data quality for multimodal data, including image-text pairs, video, and audio.
This section covers data quality for tabular data.
This section covers data quality for time series data.
This section covers data quality for graph data.
This section focuses on data quality management for machine learning models, following the Data-Centric AI paradigm. It includes papers and resources related to data valuation, data selection, and benchmarks for evaluating data quality in ML pipelines.