{ "best_global_step": 904, "best_metric": 2.465582847595215, "best_model_checkpoint": "./mt5_ossetian_translator/checkpoint-904", "epoch": 8.0, "eval_steps": 500, "global_step": 904, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.17699115044247787, "grad_norm": 328.7373352050781, "learning_rate": 0.0004915929203539823, "loss": 18.003941345214844, "step": 20 }, { "epoch": 0.35398230088495575, "grad_norm": 16.042678833007812, "learning_rate": 0.0004827433628318584, "loss": 8.6413818359375, "step": 40 }, { "epoch": 0.5309734513274337, "grad_norm": 7.103315353393555, "learning_rate": 0.0004738938053097345, "loss": 6.339987182617188, "step": 60 }, { "epoch": 0.7079646017699115, "grad_norm": 4.68532133102417, "learning_rate": 0.0004650442477876106, "loss": 5.369053649902344, "step": 80 }, { "epoch": 0.8849557522123894, "grad_norm": 3.539532423019409, "learning_rate": 0.0004561946902654867, "loss": 4.760232543945312, "step": 100 }, { "epoch": 1.0, "eval_loss": 3.66064453125, "eval_runtime": 0.9181, "eval_samples_per_second": 110.006, "eval_steps_per_second": 14.159, "step": 113 }, { "epoch": 1.0619469026548674, "grad_norm": 3.4077095985412598, "learning_rate": 0.0004473451327433629, "loss": 4.4729164123535154, "step": 120 }, { "epoch": 1.238938053097345, "grad_norm": 2.3176043033599854, "learning_rate": 0.000438495575221239, "loss": 4.149492263793945, "step": 140 }, { "epoch": 1.415929203539823, "grad_norm": 2.055542230606079, "learning_rate": 0.00042964601769911507, "loss": 3.9551513671875, "step": 160 }, { "epoch": 1.592920353982301, "grad_norm": 3.381129026412964, "learning_rate": 0.00042079646017699116, "loss": 3.8981708526611327, "step": 180 }, { "epoch": 1.7699115044247788, "grad_norm": 2.6095192432403564, "learning_rate": 0.0004119469026548673, "loss": 3.908449172973633, "step": 200 }, { "epoch": 1.9469026548672566, "grad_norm": 2.930842399597168, "learning_rate": 0.0004030973451327434, "loss": 3.665481185913086, "step": 220 }, { "epoch": 2.0, "eval_loss": 3.1441268920898438, "eval_runtime": 0.8098, "eval_samples_per_second": 124.721, "eval_steps_per_second": 16.053, "step": 226 }, { "epoch": 2.1238938053097347, "grad_norm": 2.2758448123931885, "learning_rate": 0.0003942477876106195, "loss": 3.4207077026367188, "step": 240 }, { "epoch": 2.3008849557522124, "grad_norm": 2.5473992824554443, "learning_rate": 0.0003853982300884956, "loss": 3.3584686279296876, "step": 260 }, { "epoch": 2.47787610619469, "grad_norm": 1.703884243965149, "learning_rate": 0.0003765486725663717, "loss": 3.4501358032226563, "step": 280 }, { "epoch": 2.6548672566371683, "grad_norm": 2.2273247241973877, "learning_rate": 0.0003676991150442478, "loss": 3.2697242736816405, "step": 300 }, { "epoch": 2.831858407079646, "grad_norm": 2.3433310985565186, "learning_rate": 0.0003588495575221239, "loss": 3.2843551635742188, "step": 320 }, { "epoch": 3.0, "eval_loss": 2.8717918395996094, "eval_runtime": 0.8009, "eval_samples_per_second": 126.116, "eval_steps_per_second": 16.233, "step": 339 }, { "epoch": 3.0088495575221237, "grad_norm": 2.4545156955718994, "learning_rate": 0.00035, "loss": 3.2385746002197267, "step": 340 }, { "epoch": 3.185840707964602, "grad_norm": 2.047863483428955, "learning_rate": 0.00034115044247787614, "loss": 3.073255157470703, "step": 360 }, { "epoch": 3.3628318584070795, "grad_norm": 3.017425537109375, "learning_rate": 0.00033230088495575223, "loss": 2.9876617431640624, "step": 380 }, { "epoch": 3.5398230088495577, "grad_norm": 2.587419271469116, "learning_rate": 0.0003234513274336283, "loss": 2.9378360748291015, "step": 400 }, { "epoch": 3.7168141592920354, "grad_norm": 2.2757842540740967, "learning_rate": 0.0003146017699115044, "loss": 2.997949409484863, "step": 420 }, { "epoch": 3.893805309734513, "grad_norm": 2.942039728164673, "learning_rate": 0.00030575221238938056, "loss": 2.910443115234375, "step": 440 }, { "epoch": 4.0, "eval_loss": 2.6989588737487793, "eval_runtime": 0.8141, "eval_samples_per_second": 124.061, "eval_steps_per_second": 15.968, "step": 452 }, { "epoch": 4.070796460176991, "grad_norm": 2.663364887237549, "learning_rate": 0.00029690265486725665, "loss": 2.8674571990966795, "step": 460 }, { "epoch": 4.247787610619469, "grad_norm": 2.9044437408447266, "learning_rate": 0.00028805309734513274, "loss": 2.7972084045410157, "step": 480 }, { "epoch": 4.424778761061947, "grad_norm": 2.2075090408325195, "learning_rate": 0.00027920353982300883, "loss": 2.7429454803466795, "step": 500 }, { "epoch": 4.601769911504425, "grad_norm": 4.215453147888184, "learning_rate": 0.000270353982300885, "loss": 2.767496109008789, "step": 520 }, { "epoch": 4.778761061946903, "grad_norm": 2.807522773742676, "learning_rate": 0.00026150442477876107, "loss": 2.7617130279541016, "step": 540 }, { "epoch": 4.95575221238938, "grad_norm": 2.4849319458007812, "learning_rate": 0.00025265486725663716, "loss": 2.7167985916137694, "step": 560 }, { "epoch": 5.0, "eval_loss": 2.6085963249206543, "eval_runtime": 0.8712, "eval_samples_per_second": 115.935, "eval_steps_per_second": 14.922, "step": 565 }, { "epoch": 5.132743362831858, "grad_norm": 2.3556389808654785, "learning_rate": 0.00024380530973451328, "loss": 2.6242326736450194, "step": 580 }, { "epoch": 5.3097345132743365, "grad_norm": 3.390760898590088, "learning_rate": 0.00023495575221238937, "loss": 2.6653488159179686, "step": 600 }, { "epoch": 5.486725663716814, "grad_norm": 2.506216526031494, "learning_rate": 0.0002261061946902655, "loss": 2.572140121459961, "step": 620 }, { "epoch": 5.663716814159292, "grad_norm": 2.8693790435791016, "learning_rate": 0.00021725663716814158, "loss": 2.493195343017578, "step": 640 }, { "epoch": 5.84070796460177, "grad_norm": 2.4581332206726074, "learning_rate": 0.0002084070796460177, "loss": 2.567514991760254, "step": 660 }, { "epoch": 6.0, "eval_loss": 2.5541763305664062, "eval_runtime": 0.8956, "eval_samples_per_second": 112.775, "eval_steps_per_second": 14.516, "step": 678 }, { "epoch": 6.017699115044247, "grad_norm": 3.3094470500946045, "learning_rate": 0.0001995575221238938, "loss": 2.548930358886719, "step": 680 }, { "epoch": 6.1946902654867255, "grad_norm": 2.6823666095733643, "learning_rate": 0.00019070796460176994, "loss": 2.4545686721801756, "step": 700 }, { "epoch": 6.371681415929204, "grad_norm": 2.289599895477295, "learning_rate": 0.00018185840707964603, "loss": 2.381149673461914, "step": 720 }, { "epoch": 6.548672566371682, "grad_norm": 2.9119653701782227, "learning_rate": 0.00017300884955752214, "loss": 2.358357620239258, "step": 740 }, { "epoch": 6.725663716814159, "grad_norm": 2.473071575164795, "learning_rate": 0.00016415929203539824, "loss": 2.446194648742676, "step": 760 }, { "epoch": 6.902654867256637, "grad_norm": 1.9398255348205566, "learning_rate": 0.00015530973451327435, "loss": 2.3346189498901366, "step": 780 }, { "epoch": 7.0, "eval_loss": 2.507996082305908, "eval_runtime": 0.9073, "eval_samples_per_second": 111.319, "eval_steps_per_second": 14.328, "step": 791 }, { "epoch": 7.079646017699115, "grad_norm": 2.9123404026031494, "learning_rate": 0.00014646017699115044, "loss": 2.482748794555664, "step": 800 }, { "epoch": 7.256637168141593, "grad_norm": 2.646937131881714, "learning_rate": 0.00013761061946902656, "loss": 2.3216293334960936, "step": 820 }, { "epoch": 7.433628318584071, "grad_norm": 4.007692337036133, "learning_rate": 0.00012876106194690265, "loss": 2.234068489074707, "step": 840 }, { "epoch": 7.610619469026549, "grad_norm": 2.953052043914795, "learning_rate": 0.00011991150442477876, "loss": 2.2527175903320313, "step": 860 }, { "epoch": 7.787610619469026, "grad_norm": 2.417543649673462, "learning_rate": 0.00011106194690265486, "loss": 2.412649154663086, "step": 880 }, { "epoch": 7.964601769911504, "grad_norm": 2.309840440750122, "learning_rate": 0.00010221238938053097, "loss": 2.326849365234375, "step": 900 }, { "epoch": 8.0, "eval_loss": 2.465582847595215, "eval_runtime": 1.3915, "eval_samples_per_second": 72.581, "eval_steps_per_second": 9.342, "step": 904 } ], "logging_steps": 20, "max_steps": 1130, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 332418321285120.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }