{ "best_global_step": 440, "best_metric": 0.7817979098493669, "best_model_checkpoint": "outputs/models/decision_model\\checkpoint-440", "epoch": 5.0, "eval_steps": 500, "global_step": 440, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.2840909090909091, "grad_norm": 2.0270469188690186, "learning_rate": 1.0909090909090909e-05, "loss": 1.391720733642578, "step": 25 }, { "epoch": 0.5681818181818182, "grad_norm": 2.6033480167388916, "learning_rate": 1.9747474747474747e-05, "loss": 1.3292826843261718, "step": 50 }, { "epoch": 0.8522727272727273, "grad_norm": 3.2250678539276123, "learning_rate": 1.8484848484848487e-05, "loss": 0.9665608978271485, "step": 75 }, { "epoch": 1.0, "eval_accuracy": 0.6933333333333334, "eval_loss": 0.7237751483917236, "eval_macro_f1": 0.6931818181818181, "eval_macro_precision": 0.7383305573636584, "eval_macro_recall": 0.6907309258679122, "eval_runtime": 12.0023, "eval_samples_per_second": 24.995, "eval_steps_per_second": 0.833, "eval_weighted_f1": 0.696861471861472, "step": 88 }, { "epoch": 1.1363636363636362, "grad_norm": 5.046335697174072, "learning_rate": 1.7222222222222224e-05, "loss": 0.7137407684326171, "step": 100 }, { "epoch": 1.4204545454545454, "grad_norm": 2.440394401550293, "learning_rate": 1.595959595959596e-05, "loss": 0.5940697860717773, "step": 125 }, { "epoch": 1.7045454545454546, "grad_norm": 12.461901664733887, "learning_rate": 1.4696969696969699e-05, "loss": 0.5451191329956054, "step": 150 }, { "epoch": 1.9886363636363638, "grad_norm": 6.133688449859619, "learning_rate": 1.3434343434343436e-05, "loss": 0.5883205032348633, "step": 175 }, { "epoch": 2.0, "eval_accuracy": 0.7466666666666667, "eval_loss": 0.6313713192939758, "eval_macro_f1": 0.7507497948674419, "eval_macro_precision": 0.7921349294988134, "eval_macro_recall": 0.7446015720673256, "eval_runtime": 11.3397, "eval_samples_per_second": 26.456, "eval_steps_per_second": 0.882, "eval_weighted_f1": 0.7538517764007959, "step": 176 }, { "epoch": 2.2727272727272725, "grad_norm": 5.935120582580566, "learning_rate": 1.2171717171717172e-05, "loss": 0.46342819213867187, "step": 200 }, { "epoch": 2.5568181818181817, "grad_norm": 7.027043342590332, "learning_rate": 1.0909090909090909e-05, "loss": 0.4100628662109375, "step": 225 }, { "epoch": 2.840909090909091, "grad_norm": 8.357532501220703, "learning_rate": 9.646464646464647e-06, "loss": 0.39318439483642575, "step": 250 }, { "epoch": 3.0, "eval_accuracy": 0.7666666666666667, "eval_loss": 0.5723195672035217, "eval_macro_f1": 0.7632203915397024, "eval_macro_precision": 0.7755475675118532, "eval_macro_recall": 0.7631792593436428, "eval_runtime": 9.3457, "eval_samples_per_second": 32.1, "eval_steps_per_second": 1.07, "eval_weighted_f1": 0.7663719158480559, "step": 264 }, { "epoch": 3.125, "grad_norm": 6.643225193023682, "learning_rate": 8.383838383838384e-06, "loss": 0.41530742645263674, "step": 275 }, { "epoch": 3.409090909090909, "grad_norm": 3.8116602897644043, "learning_rate": 7.121212121212122e-06, "loss": 0.30169292449951174, "step": 300 }, { "epoch": 3.6931818181818183, "grad_norm": 5.07578182220459, "learning_rate": 5.858585858585859e-06, "loss": 0.34119693756103514, "step": 325 }, { "epoch": 3.9772727272727275, "grad_norm": 5.61444616317749, "learning_rate": 4.595959595959597e-06, "loss": 0.34068592071533205, "step": 350 }, { "epoch": 4.0, "eval_accuracy": 0.7533333333333333, "eval_loss": 0.6002340316772461, "eval_macro_f1": 0.7527508236810562, "eval_macro_precision": 0.7775673527557759, "eval_macro_recall": 0.7493573605217441, "eval_runtime": 9.4128, "eval_samples_per_second": 31.872, "eval_steps_per_second": 1.062, "eval_weighted_f1": 0.7562322082167043, "step": 352 }, { "epoch": 4.261363636363637, "grad_norm": 14.103662490844727, "learning_rate": 3.3333333333333333e-06, "loss": 0.36039134979248044, "step": 375 }, { "epoch": 4.545454545454545, "grad_norm": 10.582133293151855, "learning_rate": 2.070707070707071e-06, "loss": 0.2752532386779785, "step": 400 }, { "epoch": 4.829545454545455, "grad_norm": 10.563464164733887, "learning_rate": 8.080808080808082e-07, "loss": 0.21057830810546874, "step": 425 }, { "epoch": 5.0, "eval_accuracy": 0.7833333333333333, "eval_loss": 0.5563565492630005, "eval_macro_f1": 0.7817979098493669, "eval_macro_precision": 0.7985651345558467, "eval_macro_recall": 0.7799016033947541, "eval_runtime": 11.0713, "eval_samples_per_second": 27.097, "eval_steps_per_second": 0.903, "eval_weighted_f1": 0.7847290985647283, "step": 440 }, { "epoch": 5.0, "step": 440, "total_flos": 180259372028736.0, "train_loss": 0.5567306355996565, "train_runtime": 1081.1026, "train_samples_per_second": 6.475, "train_steps_per_second": 0.407 }, { "epoch": 5.0, "step": 440, "test_accuracy": 0.83, "test_loss": 0.4470374584197998, "test_macro_f1": 0.8242622940008544, "test_macro_precision": 0.8358748568155785, "test_macro_recall": 0.8268016594043991, "test_runtime": 10.3642, "test_samples_per_second": 28.946, "test_steps_per_second": 0.965, "test_weighted_f1": 0.8269116167241574 } ], "logging_steps": 25, "max_steps": 440, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 180259372028736.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }