mt5-ossetian-translator / trainer_state.json
ajsbsd's picture
Upload mT5 Ossetian translator
22b415d verified
Raw History Blame Contribute Delete
10.7 kB
{
"best_global_step": 904,
"best_metric": 2.465582847595215,
"best_model_checkpoint": "./mt5_ossetian_translator/checkpoint-904",
"epoch": 8.0,
"eval_steps": 500,
"global_step": 904,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.17699115044247787,
"grad_norm": 328.7373352050781,
"learning_rate": 0.0004915929203539823,
"loss": 18.003941345214844,
"step": 20
},
{
"epoch": 0.35398230088495575,
"grad_norm": 16.042678833007812,
"learning_rate": 0.0004827433628318584,
"loss": 8.6413818359375,
"step": 40
},
{
"epoch": 0.5309734513274337,
"grad_norm": 7.103315353393555,
"learning_rate": 0.0004738938053097345,
"loss": 6.339987182617188,
"step": 60
},
{
"epoch": 0.7079646017699115,
"grad_norm": 4.68532133102417,
"learning_rate": 0.0004650442477876106,
"loss": 5.369053649902344,
"step": 80
},
{
"epoch": 0.8849557522123894,
"grad_norm": 3.539532423019409,
"learning_rate": 0.0004561946902654867,
"loss": 4.760232543945312,
"step": 100
},
{
"epoch": 1.0,
"eval_loss": 3.66064453125,
"eval_runtime": 0.9181,
"eval_samples_per_second": 110.006,
"eval_steps_per_second": 14.159,
"step": 113
},
{
"epoch": 1.0619469026548674,
"grad_norm": 3.4077095985412598,
"learning_rate": 0.0004473451327433629,
"loss": 4.4729164123535154,
"step": 120
},
{
"epoch": 1.238938053097345,
"grad_norm": 2.3176043033599854,
"learning_rate": 0.000438495575221239,
"loss": 4.149492263793945,
"step": 140
},
{
"epoch": 1.415929203539823,
"grad_norm": 2.055542230606079,
"learning_rate": 0.00042964601769911507,
"loss": 3.9551513671875,
"step": 160
},
{
"epoch": 1.592920353982301,
"grad_norm": 3.381129026412964,
"learning_rate": 0.00042079646017699116,
"loss": 3.8981708526611327,
"step": 180
},
{
"epoch": 1.7699115044247788,
"grad_norm": 2.6095192432403564,
"learning_rate": 0.0004119469026548673,
"loss": 3.908449172973633,
"step": 200
},
{
"epoch": 1.9469026548672566,
"grad_norm": 2.930842399597168,
"learning_rate": 0.0004030973451327434,
"loss": 3.665481185913086,
"step": 220
},
{
"epoch": 2.0,
"eval_loss": 3.1441268920898438,
"eval_runtime": 0.8098,
"eval_samples_per_second": 124.721,
"eval_steps_per_second": 16.053,
"step": 226
},
{
"epoch": 2.1238938053097347,
"grad_norm": 2.2758448123931885,
"learning_rate": 0.0003942477876106195,
"loss": 3.4207077026367188,
"step": 240
},
{
"epoch": 2.3008849557522124,
"grad_norm": 2.5473992824554443,
"learning_rate": 0.0003853982300884956,
"loss": 3.3584686279296876,
"step": 260
},
{
"epoch": 2.47787610619469,
"grad_norm": 1.703884243965149,
"learning_rate": 0.0003765486725663717,
"loss": 3.4501358032226563,
"step": 280
},
{
"epoch": 2.6548672566371683,
"grad_norm": 2.2273247241973877,
"learning_rate": 0.0003676991150442478,
"loss": 3.2697242736816405,
"step": 300
},
{
"epoch": 2.831858407079646,
"grad_norm": 2.3433310985565186,
"learning_rate": 0.0003588495575221239,
"loss": 3.2843551635742188,
"step": 320
},
{
"epoch": 3.0,
"eval_loss": 2.8717918395996094,
"eval_runtime": 0.8009,
"eval_samples_per_second": 126.116,
"eval_steps_per_second": 16.233,
"step": 339
},
{
"epoch": 3.0088495575221237,
"grad_norm": 2.4545156955718994,
"learning_rate": 0.00035,
"loss": 3.2385746002197267,
"step": 340
},
{
"epoch": 3.185840707964602,
"grad_norm": 2.047863483428955,
"learning_rate": 0.00034115044247787614,
"loss": 3.073255157470703,
"step": 360
},
{
"epoch": 3.3628318584070795,
"grad_norm": 3.017425537109375,
"learning_rate": 0.00033230088495575223,
"loss": 2.9876617431640624,
"step": 380
},
{
"epoch": 3.5398230088495577,
"grad_norm": 2.587419271469116,
"learning_rate": 0.0003234513274336283,
"loss": 2.9378360748291015,
"step": 400
},
{
"epoch": 3.7168141592920354,
"grad_norm": 2.2757842540740967,
"learning_rate": 0.0003146017699115044,
"loss": 2.997949409484863,
"step": 420
},
{
"epoch": 3.893805309734513,
"grad_norm": 2.942039728164673,
"learning_rate": 0.00030575221238938056,
"loss": 2.910443115234375,
"step": 440
},
{
"epoch": 4.0,
"eval_loss": 2.6989588737487793,
"eval_runtime": 0.8141,
"eval_samples_per_second": 124.061,
"eval_steps_per_second": 15.968,
"step": 452
},
{
"epoch": 4.070796460176991,
"grad_norm": 2.663364887237549,
"learning_rate": 0.00029690265486725665,
"loss": 2.8674571990966795,
"step": 460
},
{
"epoch": 4.247787610619469,
"grad_norm": 2.9044437408447266,
"learning_rate": 0.00028805309734513274,
"loss": 2.7972084045410157,
"step": 480
},
{
"epoch": 4.424778761061947,
"grad_norm": 2.2075090408325195,
"learning_rate": 0.00027920353982300883,
"loss": 2.7429454803466795,
"step": 500
},
{
"epoch": 4.601769911504425,
"grad_norm": 4.215453147888184,
"learning_rate": 0.000270353982300885,
"loss": 2.767496109008789,
"step": 520
},
{
"epoch": 4.778761061946903,
"grad_norm": 2.807522773742676,
"learning_rate": 0.00026150442477876107,
"loss": 2.7617130279541016,
"step": 540
},
{
"epoch": 4.95575221238938,
"grad_norm": 2.4849319458007812,
"learning_rate": 0.00025265486725663716,
"loss": 2.7167985916137694,
"step": 560
},
{
"epoch": 5.0,
"eval_loss": 2.6085963249206543,
"eval_runtime": 0.8712,
"eval_samples_per_second": 115.935,
"eval_steps_per_second": 14.922,
"step": 565
},
{
"epoch": 5.132743362831858,
"grad_norm": 2.3556389808654785,
"learning_rate": 0.00024380530973451328,
"loss": 2.6242326736450194,
"step": 580
},
{
"epoch": 5.3097345132743365,
"grad_norm": 3.390760898590088,
"learning_rate": 0.00023495575221238937,
"loss": 2.6653488159179686,
"step": 600
},
{
"epoch": 5.486725663716814,
"grad_norm": 2.506216526031494,
"learning_rate": 0.0002261061946902655,
"loss": 2.572140121459961,
"step": 620
},
{
"epoch": 5.663716814159292,
"grad_norm": 2.8693790435791016,
"learning_rate": 0.00021725663716814158,
"loss": 2.493195343017578,
"step": 640
},
{
"epoch": 5.84070796460177,
"grad_norm": 2.4581332206726074,
"learning_rate": 0.0002084070796460177,
"loss": 2.567514991760254,
"step": 660
},
{
"epoch": 6.0,
"eval_loss": 2.5541763305664062,
"eval_runtime": 0.8956,
"eval_samples_per_second": 112.775,
"eval_steps_per_second": 14.516,
"step": 678
},
{
"epoch": 6.017699115044247,
"grad_norm": 3.3094470500946045,
"learning_rate": 0.0001995575221238938,
"loss": 2.548930358886719,
"step": 680
},
{
"epoch": 6.1946902654867255,
"grad_norm": 2.6823666095733643,
"learning_rate": 0.00019070796460176994,
"loss": 2.4545686721801756,
"step": 700
},
{
"epoch": 6.371681415929204,
"grad_norm": 2.289599895477295,
"learning_rate": 0.00018185840707964603,
"loss": 2.381149673461914,
"step": 720
},
{
"epoch": 6.548672566371682,
"grad_norm": 2.9119653701782227,
"learning_rate": 0.00017300884955752214,
"loss": 2.358357620239258,
"step": 740
},
{
"epoch": 6.725663716814159,
"grad_norm": 2.473071575164795,
"learning_rate": 0.00016415929203539824,
"loss": 2.446194648742676,
"step": 760
},
{
"epoch": 6.902654867256637,
"grad_norm": 1.9398255348205566,
"learning_rate": 0.00015530973451327435,
"loss": 2.3346189498901366,
"step": 780
},
{
"epoch": 7.0,
"eval_loss": 2.507996082305908,
"eval_runtime": 0.9073,
"eval_samples_per_second": 111.319,
"eval_steps_per_second": 14.328,
"step": 791
},
{
"epoch": 7.079646017699115,
"grad_norm": 2.9123404026031494,
"learning_rate": 0.00014646017699115044,
"loss": 2.482748794555664,
"step": 800
},
{
"epoch": 7.256637168141593,
"grad_norm": 2.646937131881714,
"learning_rate": 0.00013761061946902656,
"loss": 2.3216293334960936,
"step": 820
},
{
"epoch": 7.433628318584071,
"grad_norm": 4.007692337036133,
"learning_rate": 0.00012876106194690265,
"loss": 2.234068489074707,
"step": 840
},
{
"epoch": 7.610619469026549,
"grad_norm": 2.953052043914795,
"learning_rate": 0.00011991150442477876,
"loss": 2.2527175903320313,
"step": 860
},
{
"epoch": 7.787610619469026,
"grad_norm": 2.417543649673462,
"learning_rate": 0.00011106194690265486,
"loss": 2.412649154663086,
"step": 880
},
{
"epoch": 7.964601769911504,
"grad_norm": 2.309840440750122,
"learning_rate": 0.00010221238938053097,
"loss": 2.326849365234375,
"step": 900
},
{
"epoch": 8.0,
"eval_loss": 2.465582847595215,
"eval_runtime": 1.3915,
"eval_samples_per_second": 72.581,
"eval_steps_per_second": 9.342,
"step": 904
}
],
"logging_steps": 20,
"max_steps": 1130,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 332418321285120.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}