lapp0/flan-t5-small-query-expansion-merged-lr-2e-4-ep-30

Model

0

stars

2

commits

1

linked in READMEs

Mar 12, 2024

updated

endpoints_compatible
generated_from_trainer
safetensors
t5
tensorboard
text2text-generation
text-generation-inference
transformers
Browse cluster: Text-to-Text Generation & T5 Models

README

flan-t5-small-query-expansion-merged-lr-2e-4-ep-30

This model is a fine-tuned version of google/flan-t5-small on the None dataset. It achieves the following results on the evaluation set:

  • Loss: 0.0687
  • Rouge1: 88.0058
  • Rouge2: 86.0177
  • Rougel: 87.4622
  • Rougelsum: 87.8743
  • Gen Len: 18.3001

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 0.0002
  • train_batch_size: 8
  • eval_batch_size: 8
  • seed: 42
  • optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
  • lr_scheduler_type: cosine
  • lr_scheduler_warmup_ratio: 0.05
  • num_epochs: 30

Training results

Training LossEpochStepValidation LossRouge1Rouge2RougelRougelsumGen Len
0.59031.033770.669464.096745.421857.490761.082618.3315
0.65132.067540.548766.018748.110659.920463.181518.2596
0.81143.0101310.467868.450552.078763.080566.155618.2296
0.48544.0135080.398169.967454.774164.960267.931918.2352
0.55745.0168850.351271.860257.377867.22269.916918.1424
0.53436.0202620.304772.942659.438368.672671.138218.0677
0.50037.0236390.267074.643462.390671.01773.153718.2826
0.43818.0270160.236675.587963.558171.956374.097618.2247
0.42989.0303930.206577.153566.312874.0475.855718.1933
0.352410.0337700.187778.206668.644575.229277.106718.2107
0.337411.0371470.165079.240170.095376.39278.178818.1982
0.257812.0405240.142480.307272.456178.158379.565718.2659
0.246813.0439010.128081.841975.248580.052481.213118.2401
0.207914.0472780.114782.750576.795581.137582.192918.2212
0.163215.0506550.102383.730378.381982.101983.149218.2826
0.166916.0540320.094584.511879.887583.279784.123218.2561
0.197417.0574090.088685.506781.491484.309185.17818.2840
0.146118.0607860.082985.937582.374385.02585.662518.2805
0.126219.0641630.079786.367983.160385.50786.087518.2722
0.098220.0675400.075987.21584.514186.495586.993418.2770
0.08721.0709170.072687.204684.54886.436986.967818.2924
0.091422.0742940.071587.702485.399786.999387.471618.2882
0.094523.0776710.070387.846885.751387.209487.655818.2896
0.058624.0810480.069887.88385.818487.324387.69218.2882
0.06225.0844250.068987.934585.914287.369387.779918.2875
0.075826.0878020.068787.904285.872787.316687.724918.2903
0.077127.0911790.068687.98986.040187.476887.837918.2882
0.074428.0945560.068788.022786.060487.491787.899218.3001
0.041929.0979330.068788.005886.017787.462287.874318.3001
0.061530.01013100.068788.005886.017787.462287.874318.3001

Framework versions

  • Transformers 4.38.2
  • Pytorch 2.2.0+cu121
  • Datasets 2.18.0
  • Tokenizers 0.15.2

Contributors

lapp0

2 commits

lapp0/flan-t5-small-query-expansion-merged-lr-2e-4-ep-30

Model

0

stars

2

commits

1

linked in READMEs

Mar 12, 2024

updated

endpoints_compatible
generated_from_trainer
safetensors
t5
tensorboard
text2text-generation
text-generation-inference
transformers
Browse cluster: Text-to-Text Generation & T5 Models

README

flan-t5-small-query-expansion-merged-lr-2e-4-ep-30

This model is a fine-tuned version of google/flan-t5-small on the None dataset. It achieves the following results on the evaluation set:

  • Loss: 0.0687
  • Rouge1: 88.0058
  • Rouge2: 86.0177
  • Rougel: 87.4622
  • Rougelsum: 87.8743
  • Gen Len: 18.3001

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 0.0002
  • train_batch_size: 8
  • eval_batch_size: 8
  • seed: 42
  • optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
  • lr_scheduler_type: cosine
  • lr_scheduler_warmup_ratio: 0.05
  • num_epochs: 30

Training results

Training LossEpochStepValidation LossRouge1Rouge2RougelRougelsumGen Len
0.59031.033770.669464.096745.421857.490761.082618.3315
0.65132.067540.548766.018748.110659.920463.181518.2596
0.81143.0101310.467868.450552.078763.080566.155618.2296
0.48544.0135080.398169.967454.774164.960267.931918.2352
0.55745.0168850.351271.860257.377867.22269.916918.1424
0.53436.0202620.304772.942659.438368.672671.138218.0677
0.50037.0236390.267074.643462.390671.01773.153718.2826
0.43818.0270160.236675.587963.558171.956374.097618.2247
0.42989.0303930.206577.153566.312874.0475.855718.1933
0.352410.0337700.187778.206668.644575.229277.106718.2107
0.337411.0371470.165079.240170.095376.39278.178818.1982
0.257812.0405240.142480.307272.456178.158379.565718.2659
0.246813.0439010.128081.841975.248580.052481.213118.2401
0.207914.0472780.114782.750576.795581.137582.192918.2212
0.163215.0506550.102383.730378.381982.101983.149218.2826
0.166916.0540320.094584.511879.887583.279784.123218.2561
0.197417.0574090.088685.506781.491484.309185.17818.2840
0.146118.0607860.082985.937582.374385.02585.662518.2805
0.126219.0641630.079786.367983.160385.50786.087518.2722
0.098220.0675400.075987.21584.514186.495586.993418.2770
0.08721.0709170.072687.204684.54886.436986.967818.2924
0.091422.0742940.071587.702485.399786.999387.471618.2882
0.094523.0776710.070387.846885.751387.209487.655818.2896
0.058624.0810480.069887.88385.818487.324387.69218.2882
0.06225.0844250.068987.934585.914287.369387.779918.2875
0.075826.0878020.068787.904285.872787.316687.724918.2903
0.077127.0911790.068687.98986.040187.476887.837918.2882
0.074428.0945560.068788.022786.060487.491787.899218.3001
0.041929.0979330.068788.005886.017787.462287.874318.3001
0.061530.01013100.068788.005886.017787.462287.874318.3001

Framework versions

  • Transformers 4.38.2
  • Pytorch 2.2.0+cu121
  • Datasets 2.18.0
  • Tokenizers 0.15.2

Contributors

lapp0

2 commits