This dataset is a pre-tokenized version of alibayram/cosmos-corpus-0-05-with-embeddings, designed for efficient embedding distillation training of MFT and TabiBERT models.
alibayram/cosmos-corpus-0-05-with-embeddingsThe dataset was processed using two different tokenizers to support multiple student architectures:
Filtering:
mft_input_ids and tabi_input_ids must be <= 2048 tokens.The dataset contains the following columns:
| Column | Type | Description |
|---|---|---|
text | string | The original raw text content. |
mft_input_ids | list[int] | Token IDs encoded using the MFT tokenizer. |
tabi_input_ids | list[int] | Token IDs encoded using the TabiBERT tokenizer. |
teacher_embedding_final | list[float] | Final layer embeddings from the teacher model (Gemma-2-9b-it). |
{
'text': 'Makine öğrenmesi, verilerden öğrenen algoritmaların çalışılmasıdır.',
'mft_input_ids': [124, 5921, ...],
'tabi_input_ids': [101, 2341, ...],
'teacher_embedding_final': [0.021, -0.054, ...] # 3584-dimensional vectors
}
This dataset is optimized for the EmbeddingDistillationTrainer. You can load it directly without needing to re-tokenize during training.
from datasets import load_dataset
dataset = load_dataset("alibayram/cosmos-corpus-encoded")
To train a model using the mft_input_ids column:
from embedding_trainer import EmbeddingDistillationTrainer, EmbeddingTrainerConfig
config = EmbeddingTrainerConfig(
student_model="alibayram/mft-downstream-task-embeddinggemma",
input_ids_column="mft_input_ids", # or "tabi_input_ids"
embedding_column="teacher_embedding_final",
loss_type="cosine",
batch_size=256
)
trainer = EmbeddingDistillationTrainer(config)
trainer.train("alibayram/cosmos-corpus-encoded")
google/gemma-2-9b-it (Embeddings extracted via sartify-llm/Gemma-2-9b-it-v2-embedding)prepare_dataset.pyMIT
9 commits
This dataset is a pre-tokenized version of alibayram/cosmos-corpus-0-05-with-embeddings, designed for efficient embedding distillation training of MFT and TabiBERT models.
alibayram/cosmos-corpus-0-05-with-embeddingsThe dataset was processed using two different tokenizers to support multiple student architectures:
Filtering:
mft_input_ids and tabi_input_ids must be <= 2048 tokens.The dataset contains the following columns:
| Column | Type | Description |
|---|---|---|
text | string | The original raw text content. |
mft_input_ids | list[int] | Token IDs encoded using the MFT tokenizer. |
tabi_input_ids | list[int] | Token IDs encoded using the TabiBERT tokenizer. |
teacher_embedding_final | list[float] | Final layer embeddings from the teacher model (Gemma-2-9b-it). |
{
'text': 'Makine öğrenmesi, verilerden öğrenen algoritmaların çalışılmasıdır.',
'mft_input_ids': [124, 5921, ...],
'tabi_input_ids': [101, 2341, ...],
'teacher_embedding_final': [0.021, -0.054, ...] # 3584-dimensional vectors
}
This dataset is optimized for the EmbeddingDistillationTrainer. You can load it directly without needing to re-tokenize during training.
from datasets import load_dataset
dataset = load_dataset("alibayram/cosmos-corpus-encoded")
To train a model using the mft_input_ids column:
from embedding_trainer import EmbeddingDistillationTrainer, EmbeddingTrainerConfig
config = EmbeddingTrainerConfig(
student_model="alibayram/mft-downstream-task-embeddinggemma",
input_ids_column="mft_input_ids", # or "tabi_input_ids"
embedding_column="teacher_embedding_final",
loss_type="cosine",
batch_size=256
)
trainer = EmbeddingDistillationTrainer(config)
trainer.train("alibayram/cosmos-corpus-encoded")
google/gemma-2-9b-it (Embeddings extracted via sartify-llm/Gemma-2-9b-it-v2-embedding)prepare_dataset.pyMIT
9 commits