Download trainer_state.json from ajsbsd/mt5-ossetian-translator: direct link, hf CLI and curl.
- Browser
- Download file 10.7 kB
-
https://huggingface.co/ajsbsd/mt5-ossetian-translator/resolve/main/trainer_state.json
- Command line
-
hf download hf://ajsbsd/mt5-ossetian-translator/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/ajsbsd/mt5-ossetian-translator/resolve/main/trainer_state.json
10.7 kB
| { | |
| "best_global_step": 904, | |
| "best_metric": 2.465582847595215, | |
| "best_model_checkpoint": "./mt5_ossetian_translator/checkpoint-904", | |
| "epoch": 8.0, | |
| "eval_steps": 500, | |
| "global_step": 904, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.17699115044247787, | |
| "grad_norm": 328.7373352050781, | |
| "learning_rate": 0.0004915929203539823, | |
| "loss": 18.003941345214844, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.35398230088495575, | |
| "grad_norm": 16.042678833007812, | |
| "learning_rate": 0.0004827433628318584, | |
| "loss": 8.6413818359375, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.5309734513274337, | |
| "grad_norm": 7.103315353393555, | |
| "learning_rate": 0.0004738938053097345, | |
| "loss": 6.339987182617188, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.7079646017699115, | |
| "grad_norm": 4.68532133102417, | |
| "learning_rate": 0.0004650442477876106, | |
| "loss": 5.369053649902344, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.8849557522123894, | |
| "grad_norm": 3.539532423019409, | |
| "learning_rate": 0.0004561946902654867, | |
| "loss": 4.760232543945312, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 3.66064453125, | |
| "eval_runtime": 0.9181, | |
| "eval_samples_per_second": 110.006, | |
| "eval_steps_per_second": 14.159, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 1.0619469026548674, | |
| "grad_norm": 3.4077095985412598, | |
| "learning_rate": 0.0004473451327433629, | |
| "loss": 4.4729164123535154, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.238938053097345, | |
| "grad_norm": 2.3176043033599854, | |
| "learning_rate": 0.000438495575221239, | |
| "loss": 4.149492263793945, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.415929203539823, | |
| "grad_norm": 2.055542230606079, | |
| "learning_rate": 0.00042964601769911507, | |
| "loss": 3.9551513671875, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.592920353982301, | |
| "grad_norm": 3.381129026412964, | |
| "learning_rate": 0.00042079646017699116, | |
| "loss": 3.8981708526611327, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.7699115044247788, | |
| "grad_norm": 2.6095192432403564, | |
| "learning_rate": 0.0004119469026548673, | |
| "loss": 3.908449172973633, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.9469026548672566, | |
| "grad_norm": 2.930842399597168, | |
| "learning_rate": 0.0004030973451327434, | |
| "loss": 3.665481185913086, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 3.1441268920898438, | |
| "eval_runtime": 0.8098, | |
| "eval_samples_per_second": 124.721, | |
| "eval_steps_per_second": 16.053, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 2.1238938053097347, | |
| "grad_norm": 2.2758448123931885, | |
| "learning_rate": 0.0003942477876106195, | |
| "loss": 3.4207077026367188, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 2.3008849557522124, | |
| "grad_norm": 2.5473992824554443, | |
| "learning_rate": 0.0003853982300884956, | |
| "loss": 3.3584686279296876, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 2.47787610619469, | |
| "grad_norm": 1.703884243965149, | |
| "learning_rate": 0.0003765486725663717, | |
| "loss": 3.4501358032226563, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.6548672566371683, | |
| "grad_norm": 2.2273247241973877, | |
| "learning_rate": 0.0003676991150442478, | |
| "loss": 3.2697242736816405, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.831858407079646, | |
| "grad_norm": 2.3433310985565186, | |
| "learning_rate": 0.0003588495575221239, | |
| "loss": 3.2843551635742188, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 2.8717918395996094, | |
| "eval_runtime": 0.8009, | |
| "eval_samples_per_second": 126.116, | |
| "eval_steps_per_second": 16.233, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 3.0088495575221237, | |
| "grad_norm": 2.4545156955718994, | |
| "learning_rate": 0.00035, | |
| "loss": 3.2385746002197267, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 3.185840707964602, | |
| "grad_norm": 2.047863483428955, | |
| "learning_rate": 0.00034115044247787614, | |
| "loss": 3.073255157470703, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 3.3628318584070795, | |
| "grad_norm": 3.017425537109375, | |
| "learning_rate": 0.00033230088495575223, | |
| "loss": 2.9876617431640624, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 3.5398230088495577, | |
| "grad_norm": 2.587419271469116, | |
| "learning_rate": 0.0003234513274336283, | |
| "loss": 2.9378360748291015, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 3.7168141592920354, | |
| "grad_norm": 2.2757842540740967, | |
| "learning_rate": 0.0003146017699115044, | |
| "loss": 2.997949409484863, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 3.893805309734513, | |
| "grad_norm": 2.942039728164673, | |
| "learning_rate": 0.00030575221238938056, | |
| "loss": 2.910443115234375, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_loss": 2.6989588737487793, | |
| "eval_runtime": 0.8141, | |
| "eval_samples_per_second": 124.061, | |
| "eval_steps_per_second": 15.968, | |
| "step": 452 | |
| }, | |
| { | |
| "epoch": 4.070796460176991, | |
| "grad_norm": 2.663364887237549, | |
| "learning_rate": 0.00029690265486725665, | |
| "loss": 2.8674571990966795, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 4.247787610619469, | |
| "grad_norm": 2.9044437408447266, | |
| "learning_rate": 0.00028805309734513274, | |
| "loss": 2.7972084045410157, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 4.424778761061947, | |
| "grad_norm": 2.2075090408325195, | |
| "learning_rate": 0.00027920353982300883, | |
| "loss": 2.7429454803466795, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 4.601769911504425, | |
| "grad_norm": 4.215453147888184, | |
| "learning_rate": 0.000270353982300885, | |
| "loss": 2.767496109008789, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 4.778761061946903, | |
| "grad_norm": 2.807522773742676, | |
| "learning_rate": 0.00026150442477876107, | |
| "loss": 2.7617130279541016, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 4.95575221238938, | |
| "grad_norm": 2.4849319458007812, | |
| "learning_rate": 0.00025265486725663716, | |
| "loss": 2.7167985916137694, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_loss": 2.6085963249206543, | |
| "eval_runtime": 0.8712, | |
| "eval_samples_per_second": 115.935, | |
| "eval_steps_per_second": 14.922, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 5.132743362831858, | |
| "grad_norm": 2.3556389808654785, | |
| "learning_rate": 0.00024380530973451328, | |
| "loss": 2.6242326736450194, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 5.3097345132743365, | |
| "grad_norm": 3.390760898590088, | |
| "learning_rate": 0.00023495575221238937, | |
| "loss": 2.6653488159179686, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 5.486725663716814, | |
| "grad_norm": 2.506216526031494, | |
| "learning_rate": 0.0002261061946902655, | |
| "loss": 2.572140121459961, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 5.663716814159292, | |
| "grad_norm": 2.8693790435791016, | |
| "learning_rate": 0.00021725663716814158, | |
| "loss": 2.493195343017578, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 5.84070796460177, | |
| "grad_norm": 2.4581332206726074, | |
| "learning_rate": 0.0002084070796460177, | |
| "loss": 2.567514991760254, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_loss": 2.5541763305664062, | |
| "eval_runtime": 0.8956, | |
| "eval_samples_per_second": 112.775, | |
| "eval_steps_per_second": 14.516, | |
| "step": 678 | |
| }, | |
| { | |
| "epoch": 6.017699115044247, | |
| "grad_norm": 3.3094470500946045, | |
| "learning_rate": 0.0001995575221238938, | |
| "loss": 2.548930358886719, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 6.1946902654867255, | |
| "grad_norm": 2.6823666095733643, | |
| "learning_rate": 0.00019070796460176994, | |
| "loss": 2.4545686721801756, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 6.371681415929204, | |
| "grad_norm": 2.289599895477295, | |
| "learning_rate": 0.00018185840707964603, | |
| "loss": 2.381149673461914, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 6.548672566371682, | |
| "grad_norm": 2.9119653701782227, | |
| "learning_rate": 0.00017300884955752214, | |
| "loss": 2.358357620239258, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 6.725663716814159, | |
| "grad_norm": 2.473071575164795, | |
| "learning_rate": 0.00016415929203539824, | |
| "loss": 2.446194648742676, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 6.902654867256637, | |
| "grad_norm": 1.9398255348205566, | |
| "learning_rate": 0.00015530973451327435, | |
| "loss": 2.3346189498901366, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_loss": 2.507996082305908, | |
| "eval_runtime": 0.9073, | |
| "eval_samples_per_second": 111.319, | |
| "eval_steps_per_second": 14.328, | |
| "step": 791 | |
| }, | |
| { | |
| "epoch": 7.079646017699115, | |
| "grad_norm": 2.9123404026031494, | |
| "learning_rate": 0.00014646017699115044, | |
| "loss": 2.482748794555664, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 7.256637168141593, | |
| "grad_norm": 2.646937131881714, | |
| "learning_rate": 0.00013761061946902656, | |
| "loss": 2.3216293334960936, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 7.433628318584071, | |
| "grad_norm": 4.007692337036133, | |
| "learning_rate": 0.00012876106194690265, | |
| "loss": 2.234068489074707, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 7.610619469026549, | |
| "grad_norm": 2.953052043914795, | |
| "learning_rate": 0.00011991150442477876, | |
| "loss": 2.2527175903320313, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 7.787610619469026, | |
| "grad_norm": 2.417543649673462, | |
| "learning_rate": 0.00011106194690265486, | |
| "loss": 2.412649154663086, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 7.964601769911504, | |
| "grad_norm": 2.309840440750122, | |
| "learning_rate": 0.00010221238938053097, | |
| "loss": 2.326849365234375, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "eval_loss": 2.465582847595215, | |
| "eval_runtime": 1.3915, | |
| "eval_samples_per_second": 72.581, | |
| "eval_steps_per_second": 9.342, | |
| "step": 904 | |
| } | |
| ], | |
| "logging_steps": 20, | |
| "max_steps": 1130, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 332418321285120.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |