agentguard-decision-distilbert / trainer_state.json
taran1812's picture
Upload folder using huggingface_hub
efe9ea8 verified
Raw
History Blame Contribute Delete
6.99 kB
{
"best_global_step": 440,
"best_metric": 0.7817979098493669,
"best_model_checkpoint": "outputs/models/decision_model\\checkpoint-440",
"epoch": 5.0,
"eval_steps": 500,
"global_step": 440,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.2840909090909091,
"grad_norm": 2.0270469188690186,
"learning_rate": 1.0909090909090909e-05,
"loss": 1.391720733642578,
"step": 25
},
{
"epoch": 0.5681818181818182,
"grad_norm": 2.6033480167388916,
"learning_rate": 1.9747474747474747e-05,
"loss": 1.3292826843261718,
"step": 50
},
{
"epoch": 0.8522727272727273,
"grad_norm": 3.2250678539276123,
"learning_rate": 1.8484848484848487e-05,
"loss": 0.9665608978271485,
"step": 75
},
{
"epoch": 1.0,
"eval_accuracy": 0.6933333333333334,
"eval_loss": 0.7237751483917236,
"eval_macro_f1": 0.6931818181818181,
"eval_macro_precision": 0.7383305573636584,
"eval_macro_recall": 0.6907309258679122,
"eval_runtime": 12.0023,
"eval_samples_per_second": 24.995,
"eval_steps_per_second": 0.833,
"eval_weighted_f1": 0.696861471861472,
"step": 88
},
{
"epoch": 1.1363636363636362,
"grad_norm": 5.046335697174072,
"learning_rate": 1.7222222222222224e-05,
"loss": 0.7137407684326171,
"step": 100
},
{
"epoch": 1.4204545454545454,
"grad_norm": 2.440394401550293,
"learning_rate": 1.595959595959596e-05,
"loss": 0.5940697860717773,
"step": 125
},
{
"epoch": 1.7045454545454546,
"grad_norm": 12.461901664733887,
"learning_rate": 1.4696969696969699e-05,
"loss": 0.5451191329956054,
"step": 150
},
{
"epoch": 1.9886363636363638,
"grad_norm": 6.133688449859619,
"learning_rate": 1.3434343434343436e-05,
"loss": 0.5883205032348633,
"step": 175
},
{
"epoch": 2.0,
"eval_accuracy": 0.7466666666666667,
"eval_loss": 0.6313713192939758,
"eval_macro_f1": 0.7507497948674419,
"eval_macro_precision": 0.7921349294988134,
"eval_macro_recall": 0.7446015720673256,
"eval_runtime": 11.3397,
"eval_samples_per_second": 26.456,
"eval_steps_per_second": 0.882,
"eval_weighted_f1": 0.7538517764007959,
"step": 176
},
{
"epoch": 2.2727272727272725,
"grad_norm": 5.935120582580566,
"learning_rate": 1.2171717171717172e-05,
"loss": 0.46342819213867187,
"step": 200
},
{
"epoch": 2.5568181818181817,
"grad_norm": 7.027043342590332,
"learning_rate": 1.0909090909090909e-05,
"loss": 0.4100628662109375,
"step": 225
},
{
"epoch": 2.840909090909091,
"grad_norm": 8.357532501220703,
"learning_rate": 9.646464646464647e-06,
"loss": 0.39318439483642575,
"step": 250
},
{
"epoch": 3.0,
"eval_accuracy": 0.7666666666666667,
"eval_loss": 0.5723195672035217,
"eval_macro_f1": 0.7632203915397024,
"eval_macro_precision": 0.7755475675118532,
"eval_macro_recall": 0.7631792593436428,
"eval_runtime": 9.3457,
"eval_samples_per_second": 32.1,
"eval_steps_per_second": 1.07,
"eval_weighted_f1": 0.7663719158480559,
"step": 264
},
{
"epoch": 3.125,
"grad_norm": 6.643225193023682,
"learning_rate": 8.383838383838384e-06,
"loss": 0.41530742645263674,
"step": 275
},
{
"epoch": 3.409090909090909,
"grad_norm": 3.8116602897644043,
"learning_rate": 7.121212121212122e-06,
"loss": 0.30169292449951174,
"step": 300
},
{
"epoch": 3.6931818181818183,
"grad_norm": 5.07578182220459,
"learning_rate": 5.858585858585859e-06,
"loss": 0.34119693756103514,
"step": 325
},
{
"epoch": 3.9772727272727275,
"grad_norm": 5.61444616317749,
"learning_rate": 4.595959595959597e-06,
"loss": 0.34068592071533205,
"step": 350
},
{
"epoch": 4.0,
"eval_accuracy": 0.7533333333333333,
"eval_loss": 0.6002340316772461,
"eval_macro_f1": 0.7527508236810562,
"eval_macro_precision": 0.7775673527557759,
"eval_macro_recall": 0.7493573605217441,
"eval_runtime": 9.4128,
"eval_samples_per_second": 31.872,
"eval_steps_per_second": 1.062,
"eval_weighted_f1": 0.7562322082167043,
"step": 352
},
{
"epoch": 4.261363636363637,
"grad_norm": 14.103662490844727,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.36039134979248044,
"step": 375
},
{
"epoch": 4.545454545454545,
"grad_norm": 10.582133293151855,
"learning_rate": 2.070707070707071e-06,
"loss": 0.2752532386779785,
"step": 400
},
{
"epoch": 4.829545454545455,
"grad_norm": 10.563464164733887,
"learning_rate": 8.080808080808082e-07,
"loss": 0.21057830810546874,
"step": 425
},
{
"epoch": 5.0,
"eval_accuracy": 0.7833333333333333,
"eval_loss": 0.5563565492630005,
"eval_macro_f1": 0.7817979098493669,
"eval_macro_precision": 0.7985651345558467,
"eval_macro_recall": 0.7799016033947541,
"eval_runtime": 11.0713,
"eval_samples_per_second": 27.097,
"eval_steps_per_second": 0.903,
"eval_weighted_f1": 0.7847290985647283,
"step": 440
},
{
"epoch": 5.0,
"step": 440,
"total_flos": 180259372028736.0,
"train_loss": 0.5567306355996565,
"train_runtime": 1081.1026,
"train_samples_per_second": 6.475,
"train_steps_per_second": 0.407
},
{
"epoch": 5.0,
"step": 440,
"test_accuracy": 0.83,
"test_loss": 0.4470374584197998,
"test_macro_f1": 0.8242622940008544,
"test_macro_precision": 0.8358748568155785,
"test_macro_recall": 0.8268016594043991,
"test_runtime": 10.3642,
"test_samples_per_second": 28.946,
"test_steps_per_second": 0.965,
"test_weighted_f1": 0.8269116167241574
}
],
"logging_steps": 25,
"max_steps": 440,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 180259372028736.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}