taran1812 commited on
Commit
4a208f4
·
verified ·
1 Parent(s): 9a92b42

Upload folder using huggingface_hub

Browse files
all_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 5.0,
3
+ "test_loss": 0.17423087358474731,
4
+ "test_macro_f1": 0.8512159238545282,
5
+ "test_micro_f1": 0.896807720861173,
6
+ "test_runtime": 12.366,
7
+ "test_samples_per_second": 30.972,
8
+ "test_steps_per_second": 0.97
9
+ }
checkpoint-448/config.json ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "gelu",
3
+ "architectures": [
4
+ "DistilBertForSequenceClassification"
5
+ ],
6
+ "attention_dropout": 0.1,
7
+ "bos_token_id": null,
8
+ "dim": 768,
9
+ "dropout": 0.1,
10
+ "dtype": "float32",
11
+ "eos_token_id": null,
12
+ "hidden_dim": 3072,
13
+ "id2label": {
14
+ "0": "prompt_injection",
15
+ "1": "sensitive_data_exposure",
16
+ "2": "unauthorized_tool_use",
17
+ "3": "policy_violation",
18
+ "4": "high_impact_action",
19
+ "5": "safe_request"
20
+ },
21
+ "initializer_range": 0.02,
22
+ "label2id": {
23
+ "high_impact_action": 4,
24
+ "policy_violation": 3,
25
+ "prompt_injection": 0,
26
+ "safe_request": 5,
27
+ "sensitive_data_exposure": 1,
28
+ "unauthorized_tool_use": 2
29
+ },
30
+ "max_position_embeddings": 512,
31
+ "model_type": "distilbert",
32
+ "n_heads": 12,
33
+ "n_layers": 6,
34
+ "pad_token_id": 0,
35
+ "problem_type": "multi_label_classification",
36
+ "qa_dropout": 0.1,
37
+ "seq_classif_dropout": 0.2,
38
+ "sinusoidal_pos_embds": false,
39
+ "tie_weights_": true,
40
+ "tie_word_embeddings": true,
41
+ "transformers_version": "5.8.1",
42
+ "use_cache": false,
43
+ "vocab_size": 30522
44
+ }
checkpoint-448/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3957158c3a1a1b9a666e3b59e1e444104402a043eba7952ebd8d711f3efdb8db
3
+ size 267844872
checkpoint-448/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bbc0e30ab3cac8b0ec278dad2743ed8b3c873cd7cc2c23ff0b901acf9d4f3036
3
+ size 535749451
checkpoint-448/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:81b014eb753f7439e11a68de2d95f4381eac6810ab5e3abc64b0fe861ec5843d
3
+ size 14455
checkpoint-448/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4830eadc6d5513a211beacafc3bf8c060ba403373db0781e4eea00a2254b8312
3
+ size 1465
checkpoint-448/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-448/tokenizer_config.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "cls_token": "[CLS]",
4
+ "do_lower_case": true,
5
+ "is_local": false,
6
+ "local_files_only": false,
7
+ "mask_token": "[MASK]",
8
+ "model_max_length": 512,
9
+ "pad_token": "[PAD]",
10
+ "sep_token": "[SEP]",
11
+ "strip_accents": null,
12
+ "tokenize_chinese_chars": true,
13
+ "tokenizer_class": "BertTokenizer",
14
+ "unk_token": "[UNK]"
15
+ }
checkpoint-448/trainer_state.json ADDED
@@ -0,0 +1,193 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 448,
3
+ "best_metric": 0.8342735133305208,
4
+ "best_model_checkpoint": "outputs/models/risk_model\\checkpoint-448",
5
+ "epoch": 4.0,
6
+ "eval_steps": 500,
7
+ "global_step": 448,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.22321428571428573,
14
+ "grad_norm": 0.7896187901496887,
15
+ "learning_rate": 8.571428571428571e-06,
16
+ "loss": 0.6760891723632813,
17
+ "step": 25
18
+ },
19
+ {
20
+ "epoch": 0.44642857142857145,
21
+ "grad_norm": 0.5187107920646667,
22
+ "learning_rate": 1.7500000000000002e-05,
23
+ "loss": 0.5672797775268554,
24
+ "step": 50
25
+ },
26
+ {
27
+ "epoch": 0.6696428571428571,
28
+ "grad_norm": 0.9706220626831055,
29
+ "learning_rate": 1.928571428571429e-05,
30
+ "loss": 0.49257232666015627,
31
+ "step": 75
32
+ },
33
+ {
34
+ "epoch": 0.8928571428571429,
35
+ "grad_norm": 1.0596867799758911,
36
+ "learning_rate": 1.8293650793650794e-05,
37
+ "loss": 0.40760456085205077,
38
+ "step": 100
39
+ },
40
+ {
41
+ "epoch": 1.0,
42
+ "eval_loss": 0.33985912799835205,
43
+ "eval_macro_f1": 0.5031273386176547,
44
+ "eval_micro_f1": 0.7580645161290323,
45
+ "eval_runtime": 12.5726,
46
+ "eval_samples_per_second": 30.463,
47
+ "eval_steps_per_second": 0.954,
48
+ "step": 112
49
+ },
50
+ {
51
+ "epoch": 1.1160714285714286,
52
+ "grad_norm": 0.873076856136322,
53
+ "learning_rate": 1.7301587301587302e-05,
54
+ "loss": 0.367144889831543,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.3392857142857144,
59
+ "grad_norm": 1.0305687189102173,
60
+ "learning_rate": 1.630952380952381e-05,
61
+ "loss": 0.29081342697143553,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 1.5625,
66
+ "grad_norm": 1.1709494590759277,
67
+ "learning_rate": 1.531746031746032e-05,
68
+ "loss": 0.27378103256225583,
69
+ "step": 175
70
+ },
71
+ {
72
+ "epoch": 1.7857142857142856,
73
+ "grad_norm": 0.8700473308563232,
74
+ "learning_rate": 1.4325396825396826e-05,
75
+ "loss": 0.2479074478149414,
76
+ "step": 200
77
+ },
78
+ {
79
+ "epoch": 2.0,
80
+ "eval_loss": 0.2255277782678604,
81
+ "eval_macro_f1": 0.7545455310224004,
82
+ "eval_micro_f1": 0.8553940321346595,
83
+ "eval_runtime": 12.437,
84
+ "eval_samples_per_second": 30.795,
85
+ "eval_steps_per_second": 0.965,
86
+ "step": 224
87
+ },
88
+ {
89
+ "epoch": 2.0089285714285716,
90
+ "grad_norm": 0.8799751400947571,
91
+ "learning_rate": 1.3333333333333333e-05,
92
+ "loss": 0.2470851707458496,
93
+ "step": 225
94
+ },
95
+ {
96
+ "epoch": 2.232142857142857,
97
+ "grad_norm": 0.8738771677017212,
98
+ "learning_rate": 1.2341269841269844e-05,
99
+ "loss": 0.21093284606933593,
100
+ "step": 250
101
+ },
102
+ {
103
+ "epoch": 2.455357142857143,
104
+ "grad_norm": 1.715822696685791,
105
+ "learning_rate": 1.134920634920635e-05,
106
+ "loss": 0.21485193252563475,
107
+ "step": 275
108
+ },
109
+ {
110
+ "epoch": 2.678571428571429,
111
+ "grad_norm": 0.783058762550354,
112
+ "learning_rate": 1.0357142857142859e-05,
113
+ "loss": 0.20812702178955078,
114
+ "step": 300
115
+ },
116
+ {
117
+ "epoch": 2.9017857142857144,
118
+ "grad_norm": 1.1336286067962646,
119
+ "learning_rate": 9.365079365079366e-06,
120
+ "loss": 0.19541482925415038,
121
+ "step": 325
122
+ },
123
+ {
124
+ "epoch": 3.0,
125
+ "eval_loss": 0.19746434688568115,
126
+ "eval_macro_f1": 0.7849450206606753,
127
+ "eval_micro_f1": 0.8660578386605784,
128
+ "eval_runtime": 12.4428,
129
+ "eval_samples_per_second": 30.781,
130
+ "eval_steps_per_second": 0.964,
131
+ "step": 336
132
+ },
133
+ {
134
+ "epoch": 3.125,
135
+ "grad_norm": 1.2524009943008423,
136
+ "learning_rate": 8.373015873015875e-06,
137
+ "loss": 0.1961466598510742,
138
+ "step": 350
139
+ },
140
+ {
141
+ "epoch": 3.3482142857142856,
142
+ "grad_norm": 1.4880211353302002,
143
+ "learning_rate": 7.380952380952382e-06,
144
+ "loss": 0.1762843894958496,
145
+ "step": 375
146
+ },
147
+ {
148
+ "epoch": 3.571428571428571,
149
+ "grad_norm": 1.419501781463623,
150
+ "learning_rate": 6.3888888888888885e-06,
151
+ "loss": 0.1805323028564453,
152
+ "step": 400
153
+ },
154
+ {
155
+ "epoch": 3.794642857142857,
156
+ "grad_norm": 1.1280697584152222,
157
+ "learning_rate": 5.396825396825397e-06,
158
+ "loss": 0.16648523330688478,
159
+ "step": 425
160
+ },
161
+ {
162
+ "epoch": 4.0,
163
+ "eval_loss": 0.1824188232421875,
164
+ "eval_macro_f1": 0.8342735133305208,
165
+ "eval_micro_f1": 0.8823082763857252,
166
+ "eval_runtime": 14.2332,
167
+ "eval_samples_per_second": 26.909,
168
+ "eval_steps_per_second": 0.843,
169
+ "step": 448
170
+ }
171
+ ],
172
+ "logging_steps": 25,
173
+ "max_steps": 560,
174
+ "num_input_tokens_seen": 0,
175
+ "num_train_epochs": 5,
176
+ "save_steps": 500,
177
+ "stateful_callbacks": {
178
+ "TrainerControl": {
179
+ "args": {
180
+ "should_epoch_stop": false,
181
+ "should_evaluate": false,
182
+ "should_log": false,
183
+ "should_save": true,
184
+ "should_training_stop": false
185
+ },
186
+ "attributes": {}
187
+ }
188
+ },
189
+ "total_flos": 182184645486528.0,
190
+ "train_batch_size": 16,
191
+ "trial_name": null,
192
+ "trial_params": null
193
+ }
checkpoint-448/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ea11d82e0b8b24b4999106b3c615c65439c3ec832161929cf2a960e32a0e5b12
3
+ size 5265
checkpoint-560/config.json ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "gelu",
3
+ "architectures": [
4
+ "DistilBertForSequenceClassification"
5
+ ],
6
+ "attention_dropout": 0.1,
7
+ "bos_token_id": null,
8
+ "dim": 768,
9
+ "dropout": 0.1,
10
+ "dtype": "float32",
11
+ "eos_token_id": null,
12
+ "hidden_dim": 3072,
13
+ "id2label": {
14
+ "0": "prompt_injection",
15
+ "1": "sensitive_data_exposure",
16
+ "2": "unauthorized_tool_use",
17
+ "3": "policy_violation",
18
+ "4": "high_impact_action",
19
+ "5": "safe_request"
20
+ },
21
+ "initializer_range": 0.02,
22
+ "label2id": {
23
+ "high_impact_action": 4,
24
+ "policy_violation": 3,
25
+ "prompt_injection": 0,
26
+ "safe_request": 5,
27
+ "sensitive_data_exposure": 1,
28
+ "unauthorized_tool_use": 2
29
+ },
30
+ "max_position_embeddings": 512,
31
+ "model_type": "distilbert",
32
+ "n_heads": 12,
33
+ "n_layers": 6,
34
+ "pad_token_id": 0,
35
+ "problem_type": "multi_label_classification",
36
+ "qa_dropout": 0.1,
37
+ "seq_classif_dropout": 0.2,
38
+ "sinusoidal_pos_embds": false,
39
+ "tie_weights_": true,
40
+ "tie_word_embeddings": true,
41
+ "transformers_version": "5.8.1",
42
+ "use_cache": false,
43
+ "vocab_size": 30522
44
+ }
checkpoint-560/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e0e4e651b2a5185101fe50852a441c3f7f831a5938a1b5d524bb814f645d392c
3
+ size 267844872
checkpoint-560/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b4c652b4f29e8c06b6df7b2127dfb93d0b87d5e5a3d50ff1eb54ec95f193f447
3
+ size 535749451
checkpoint-560/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b07bd7d9e42639ecf3ad67693bef88a7de91c0464fe9b70c3e684e68445a1a48
3
+ size 14455
checkpoint-560/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:40476b5d6f3134c47ddd0ac698e7c83ed4d75f838612b706b508a9d236e7d282
3
+ size 1465
checkpoint-560/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-560/tokenizer_config.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "cls_token": "[CLS]",
4
+ "do_lower_case": true,
5
+ "is_local": false,
6
+ "local_files_only": false,
7
+ "mask_token": "[MASK]",
8
+ "model_max_length": 512,
9
+ "pad_token": "[PAD]",
10
+ "sep_token": "[SEP]",
11
+ "strip_accents": null,
12
+ "tokenize_chinese_chars": true,
13
+ "tokenizer_class": "BertTokenizer",
14
+ "unk_token": "[UNK]"
15
+ }
checkpoint-560/trainer_state.json ADDED
@@ -0,0 +1,238 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 448,
3
+ "best_metric": 0.8342735133305208,
4
+ "best_model_checkpoint": "outputs/models/risk_model\\checkpoint-448",
5
+ "epoch": 5.0,
6
+ "eval_steps": 500,
7
+ "global_step": 560,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.22321428571428573,
14
+ "grad_norm": 0.7896187901496887,
15
+ "learning_rate": 8.571428571428571e-06,
16
+ "loss": 0.6760891723632813,
17
+ "step": 25
18
+ },
19
+ {
20
+ "epoch": 0.44642857142857145,
21
+ "grad_norm": 0.5187107920646667,
22
+ "learning_rate": 1.7500000000000002e-05,
23
+ "loss": 0.5672797775268554,
24
+ "step": 50
25
+ },
26
+ {
27
+ "epoch": 0.6696428571428571,
28
+ "grad_norm": 0.9706220626831055,
29
+ "learning_rate": 1.928571428571429e-05,
30
+ "loss": 0.49257232666015627,
31
+ "step": 75
32
+ },
33
+ {
34
+ "epoch": 0.8928571428571429,
35
+ "grad_norm": 1.0596867799758911,
36
+ "learning_rate": 1.8293650793650794e-05,
37
+ "loss": 0.40760456085205077,
38
+ "step": 100
39
+ },
40
+ {
41
+ "epoch": 1.0,
42
+ "eval_loss": 0.33985912799835205,
43
+ "eval_macro_f1": 0.5031273386176547,
44
+ "eval_micro_f1": 0.7580645161290323,
45
+ "eval_runtime": 12.5726,
46
+ "eval_samples_per_second": 30.463,
47
+ "eval_steps_per_second": 0.954,
48
+ "step": 112
49
+ },
50
+ {
51
+ "epoch": 1.1160714285714286,
52
+ "grad_norm": 0.873076856136322,
53
+ "learning_rate": 1.7301587301587302e-05,
54
+ "loss": 0.367144889831543,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.3392857142857144,
59
+ "grad_norm": 1.0305687189102173,
60
+ "learning_rate": 1.630952380952381e-05,
61
+ "loss": 0.29081342697143553,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 1.5625,
66
+ "grad_norm": 1.1709494590759277,
67
+ "learning_rate": 1.531746031746032e-05,
68
+ "loss": 0.27378103256225583,
69
+ "step": 175
70
+ },
71
+ {
72
+ "epoch": 1.7857142857142856,
73
+ "grad_norm": 0.8700473308563232,
74
+ "learning_rate": 1.4325396825396826e-05,
75
+ "loss": 0.2479074478149414,
76
+ "step": 200
77
+ },
78
+ {
79
+ "epoch": 2.0,
80
+ "eval_loss": 0.2255277782678604,
81
+ "eval_macro_f1": 0.7545455310224004,
82
+ "eval_micro_f1": 0.8553940321346595,
83
+ "eval_runtime": 12.437,
84
+ "eval_samples_per_second": 30.795,
85
+ "eval_steps_per_second": 0.965,
86
+ "step": 224
87
+ },
88
+ {
89
+ "epoch": 2.0089285714285716,
90
+ "grad_norm": 0.8799751400947571,
91
+ "learning_rate": 1.3333333333333333e-05,
92
+ "loss": 0.2470851707458496,
93
+ "step": 225
94
+ },
95
+ {
96
+ "epoch": 2.232142857142857,
97
+ "grad_norm": 0.8738771677017212,
98
+ "learning_rate": 1.2341269841269844e-05,
99
+ "loss": 0.21093284606933593,
100
+ "step": 250
101
+ },
102
+ {
103
+ "epoch": 2.455357142857143,
104
+ "grad_norm": 1.715822696685791,
105
+ "learning_rate": 1.134920634920635e-05,
106
+ "loss": 0.21485193252563475,
107
+ "step": 275
108
+ },
109
+ {
110
+ "epoch": 2.678571428571429,
111
+ "grad_norm": 0.783058762550354,
112
+ "learning_rate": 1.0357142857142859e-05,
113
+ "loss": 0.20812702178955078,
114
+ "step": 300
115
+ },
116
+ {
117
+ "epoch": 2.9017857142857144,
118
+ "grad_norm": 1.1336286067962646,
119
+ "learning_rate": 9.365079365079366e-06,
120
+ "loss": 0.19541482925415038,
121
+ "step": 325
122
+ },
123
+ {
124
+ "epoch": 3.0,
125
+ "eval_loss": 0.19746434688568115,
126
+ "eval_macro_f1": 0.7849450206606753,
127
+ "eval_micro_f1": 0.8660578386605784,
128
+ "eval_runtime": 12.4428,
129
+ "eval_samples_per_second": 30.781,
130
+ "eval_steps_per_second": 0.964,
131
+ "step": 336
132
+ },
133
+ {
134
+ "epoch": 3.125,
135
+ "grad_norm": 1.2524009943008423,
136
+ "learning_rate": 8.373015873015875e-06,
137
+ "loss": 0.1961466598510742,
138
+ "step": 350
139
+ },
140
+ {
141
+ "epoch": 3.3482142857142856,
142
+ "grad_norm": 1.4880211353302002,
143
+ "learning_rate": 7.380952380952382e-06,
144
+ "loss": 0.1762843894958496,
145
+ "step": 375
146
+ },
147
+ {
148
+ "epoch": 3.571428571428571,
149
+ "grad_norm": 1.419501781463623,
150
+ "learning_rate": 6.3888888888888885e-06,
151
+ "loss": 0.1805323028564453,
152
+ "step": 400
153
+ },
154
+ {
155
+ "epoch": 3.794642857142857,
156
+ "grad_norm": 1.1280697584152222,
157
+ "learning_rate": 5.396825396825397e-06,
158
+ "loss": 0.16648523330688478,
159
+ "step": 425
160
+ },
161
+ {
162
+ "epoch": 4.0,
163
+ "eval_loss": 0.1824188232421875,
164
+ "eval_macro_f1": 0.8342735133305208,
165
+ "eval_micro_f1": 0.8823082763857252,
166
+ "eval_runtime": 14.2332,
167
+ "eval_samples_per_second": 26.909,
168
+ "eval_steps_per_second": 0.843,
169
+ "step": 448
170
+ },
171
+ {
172
+ "epoch": 4.017857142857143,
173
+ "grad_norm": 0.8061633706092834,
174
+ "learning_rate": 4.404761904761905e-06,
175
+ "loss": 0.17099233627319335,
176
+ "step": 450
177
+ },
178
+ {
179
+ "epoch": 4.241071428571429,
180
+ "grad_norm": 1.1085864305496216,
181
+ "learning_rate": 3.412698412698413e-06,
182
+ "loss": 0.1619624137878418,
183
+ "step": 475
184
+ },
185
+ {
186
+ "epoch": 4.464285714285714,
187
+ "grad_norm": 0.9997268915176392,
188
+ "learning_rate": 2.420634920634921e-06,
189
+ "loss": 0.1607685089111328,
190
+ "step": 500
191
+ },
192
+ {
193
+ "epoch": 4.6875,
194
+ "grad_norm": 1.134731650352478,
195
+ "learning_rate": 1.4285714285714286e-06,
196
+ "loss": 0.16787288665771485,
197
+ "step": 525
198
+ },
199
+ {
200
+ "epoch": 4.910714285714286,
201
+ "grad_norm": 1.194025993347168,
202
+ "learning_rate": 4.365079365079365e-07,
203
+ "loss": 0.1533247184753418,
204
+ "step": 550
205
+ },
206
+ {
207
+ "epoch": 5.0,
208
+ "eval_loss": 0.17899587750434875,
209
+ "eval_macro_f1": 0.8317158215809735,
210
+ "eval_micro_f1": 0.8801213960546282,
211
+ "eval_runtime": 13.6418,
212
+ "eval_samples_per_second": 28.075,
213
+ "eval_steps_per_second": 0.88,
214
+ "step": 560
215
+ }
216
+ ],
217
+ "logging_steps": 25,
218
+ "max_steps": 560,
219
+ "num_input_tokens_seen": 0,
220
+ "num_train_epochs": 5,
221
+ "save_steps": 500,
222
+ "stateful_callbacks": {
223
+ "TrainerControl": {
224
+ "args": {
225
+ "should_epoch_stop": false,
226
+ "should_evaluate": false,
227
+ "should_log": false,
228
+ "should_save": true,
229
+ "should_training_stop": true
230
+ },
231
+ "attributes": {}
232
+ }
233
+ },
234
+ "total_flos": 227810499962112.0,
235
+ "train_batch_size": 16,
236
+ "trial_name": null,
237
+ "trial_params": null
238
+ }
checkpoint-560/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ea11d82e0b8b24b4999106b3c615c65439c3ec832161929cf2a960e32a0e5b12
3
+ size 5265
config.json ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "gelu",
3
+ "architectures": [
4
+ "DistilBertForSequenceClassification"
5
+ ],
6
+ "attention_dropout": 0.1,
7
+ "bos_token_id": null,
8
+ "dim": 768,
9
+ "dropout": 0.1,
10
+ "dtype": "float32",
11
+ "eos_token_id": null,
12
+ "hidden_dim": 3072,
13
+ "id2label": {
14
+ "0": "prompt_injection",
15
+ "1": "sensitive_data_exposure",
16
+ "2": "unauthorized_tool_use",
17
+ "3": "policy_violation",
18
+ "4": "high_impact_action",
19
+ "5": "safe_request"
20
+ },
21
+ "initializer_range": 0.02,
22
+ "label2id": {
23
+ "high_impact_action": 4,
24
+ "policy_violation": 3,
25
+ "prompt_injection": 0,
26
+ "safe_request": 5,
27
+ "sensitive_data_exposure": 1,
28
+ "unauthorized_tool_use": 2
29
+ },
30
+ "max_position_embeddings": 512,
31
+ "model_type": "distilbert",
32
+ "n_heads": 12,
33
+ "n_layers": 6,
34
+ "pad_token_id": 0,
35
+ "problem_type": "multi_label_classification",
36
+ "qa_dropout": 0.1,
37
+ "seq_classif_dropout": 0.2,
38
+ "sinusoidal_pos_embds": false,
39
+ "tie_weights_": true,
40
+ "tie_word_embeddings": true,
41
+ "transformers_version": "5.8.1",
42
+ "use_cache": false,
43
+ "vocab_size": 30522
44
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3957158c3a1a1b9a666e3b59e1e444104402a043eba7952ebd8d711f3efdb8db
3
+ size 267844872
test_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 5.0,
3
+ "test_loss": 0.17423087358474731,
4
+ "test_macro_f1": 0.8512159238545282,
5
+ "test_micro_f1": 0.896807720861173,
6
+ "test_runtime": 12.366,
7
+ "test_samples_per_second": 30.972,
8
+ "test_steps_per_second": 0.97
9
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "cls_token": "[CLS]",
4
+ "do_lower_case": true,
5
+ "is_local": false,
6
+ "local_files_only": false,
7
+ "mask_token": "[MASK]",
8
+ "model_max_length": 512,
9
+ "pad_token": "[PAD]",
10
+ "sep_token": "[SEP]",
11
+ "strip_accents": null,
12
+ "tokenize_chinese_chars": true,
13
+ "tokenizer_class": "BertTokenizer",
14
+ "unk_token": "[UNK]"
15
+ }
trainer_state.json ADDED
@@ -0,0 +1,257 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 448,
3
+ "best_metric": 0.8342735133305208,
4
+ "best_model_checkpoint": "outputs/models/risk_model\\checkpoint-448",
5
+ "epoch": 5.0,
6
+ "eval_steps": 500,
7
+ "global_step": 560,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.22321428571428573,
14
+ "grad_norm": 0.7896187901496887,
15
+ "learning_rate": 8.571428571428571e-06,
16
+ "loss": 0.6760891723632813,
17
+ "step": 25
18
+ },
19
+ {
20
+ "epoch": 0.44642857142857145,
21
+ "grad_norm": 0.5187107920646667,
22
+ "learning_rate": 1.7500000000000002e-05,
23
+ "loss": 0.5672797775268554,
24
+ "step": 50
25
+ },
26
+ {
27
+ "epoch": 0.6696428571428571,
28
+ "grad_norm": 0.9706220626831055,
29
+ "learning_rate": 1.928571428571429e-05,
30
+ "loss": 0.49257232666015627,
31
+ "step": 75
32
+ },
33
+ {
34
+ "epoch": 0.8928571428571429,
35
+ "grad_norm": 1.0596867799758911,
36
+ "learning_rate": 1.8293650793650794e-05,
37
+ "loss": 0.40760456085205077,
38
+ "step": 100
39
+ },
40
+ {
41
+ "epoch": 1.0,
42
+ "eval_loss": 0.33985912799835205,
43
+ "eval_macro_f1": 0.5031273386176547,
44
+ "eval_micro_f1": 0.7580645161290323,
45
+ "eval_runtime": 12.5726,
46
+ "eval_samples_per_second": 30.463,
47
+ "eval_steps_per_second": 0.954,
48
+ "step": 112
49
+ },
50
+ {
51
+ "epoch": 1.1160714285714286,
52
+ "grad_norm": 0.873076856136322,
53
+ "learning_rate": 1.7301587301587302e-05,
54
+ "loss": 0.367144889831543,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.3392857142857144,
59
+ "grad_norm": 1.0305687189102173,
60
+ "learning_rate": 1.630952380952381e-05,
61
+ "loss": 0.29081342697143553,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 1.5625,
66
+ "grad_norm": 1.1709494590759277,
67
+ "learning_rate": 1.531746031746032e-05,
68
+ "loss": 0.27378103256225583,
69
+ "step": 175
70
+ },
71
+ {
72
+ "epoch": 1.7857142857142856,
73
+ "grad_norm": 0.8700473308563232,
74
+ "learning_rate": 1.4325396825396826e-05,
75
+ "loss": 0.2479074478149414,
76
+ "step": 200
77
+ },
78
+ {
79
+ "epoch": 2.0,
80
+ "eval_loss": 0.2255277782678604,
81
+ "eval_macro_f1": 0.7545455310224004,
82
+ "eval_micro_f1": 0.8553940321346595,
83
+ "eval_runtime": 12.437,
84
+ "eval_samples_per_second": 30.795,
85
+ "eval_steps_per_second": 0.965,
86
+ "step": 224
87
+ },
88
+ {
89
+ "epoch": 2.0089285714285716,
90
+ "grad_norm": 0.8799751400947571,
91
+ "learning_rate": 1.3333333333333333e-05,
92
+ "loss": 0.2470851707458496,
93
+ "step": 225
94
+ },
95
+ {
96
+ "epoch": 2.232142857142857,
97
+ "grad_norm": 0.8738771677017212,
98
+ "learning_rate": 1.2341269841269844e-05,
99
+ "loss": 0.21093284606933593,
100
+ "step": 250
101
+ },
102
+ {
103
+ "epoch": 2.455357142857143,
104
+ "grad_norm": 1.715822696685791,
105
+ "learning_rate": 1.134920634920635e-05,
106
+ "loss": 0.21485193252563475,
107
+ "step": 275
108
+ },
109
+ {
110
+ "epoch": 2.678571428571429,
111
+ "grad_norm": 0.783058762550354,
112
+ "learning_rate": 1.0357142857142859e-05,
113
+ "loss": 0.20812702178955078,
114
+ "step": 300
115
+ },
116
+ {
117
+ "epoch": 2.9017857142857144,
118
+ "grad_norm": 1.1336286067962646,
119
+ "learning_rate": 9.365079365079366e-06,
120
+ "loss": 0.19541482925415038,
121
+ "step": 325
122
+ },
123
+ {
124
+ "epoch": 3.0,
125
+ "eval_loss": 0.19746434688568115,
126
+ "eval_macro_f1": 0.7849450206606753,
127
+ "eval_micro_f1": 0.8660578386605784,
128
+ "eval_runtime": 12.4428,
129
+ "eval_samples_per_second": 30.781,
130
+ "eval_steps_per_second": 0.964,
131
+ "step": 336
132
+ },
133
+ {
134
+ "epoch": 3.125,
135
+ "grad_norm": 1.2524009943008423,
136
+ "learning_rate": 8.373015873015875e-06,
137
+ "loss": 0.1961466598510742,
138
+ "step": 350
139
+ },
140
+ {
141
+ "epoch": 3.3482142857142856,
142
+ "grad_norm": 1.4880211353302002,
143
+ "learning_rate": 7.380952380952382e-06,
144
+ "loss": 0.1762843894958496,
145
+ "step": 375
146
+ },
147
+ {
148
+ "epoch": 3.571428571428571,
149
+ "grad_norm": 1.419501781463623,
150
+ "learning_rate": 6.3888888888888885e-06,
151
+ "loss": 0.1805323028564453,
152
+ "step": 400
153
+ },
154
+ {
155
+ "epoch": 3.794642857142857,
156
+ "grad_norm": 1.1280697584152222,
157
+ "learning_rate": 5.396825396825397e-06,
158
+ "loss": 0.16648523330688478,
159
+ "step": 425
160
+ },
161
+ {
162
+ "epoch": 4.0,
163
+ "eval_loss": 0.1824188232421875,
164
+ "eval_macro_f1": 0.8342735133305208,
165
+ "eval_micro_f1": 0.8823082763857252,
166
+ "eval_runtime": 14.2332,
167
+ "eval_samples_per_second": 26.909,
168
+ "eval_steps_per_second": 0.843,
169
+ "step": 448
170
+ },
171
+ {
172
+ "epoch": 4.017857142857143,
173
+ "grad_norm": 0.8061633706092834,
174
+ "learning_rate": 4.404761904761905e-06,
175
+ "loss": 0.17099233627319335,
176
+ "step": 450
177
+ },
178
+ {
179
+ "epoch": 4.241071428571429,
180
+ "grad_norm": 1.1085864305496216,
181
+ "learning_rate": 3.412698412698413e-06,
182
+ "loss": 0.1619624137878418,
183
+ "step": 475
184
+ },
185
+ {
186
+ "epoch": 4.464285714285714,
187
+ "grad_norm": 0.9997268915176392,
188
+ "learning_rate": 2.420634920634921e-06,
189
+ "loss": 0.1607685089111328,
190
+ "step": 500
191
+ },
192
+ {
193
+ "epoch": 4.6875,
194
+ "grad_norm": 1.134731650352478,
195
+ "learning_rate": 1.4285714285714286e-06,
196
+ "loss": 0.16787288665771485,
197
+ "step": 525
198
+ },
199
+ {
200
+ "epoch": 4.910714285714286,
201
+ "grad_norm": 1.194025993347168,
202
+ "learning_rate": 4.365079365079365e-07,
203
+ "loss": 0.1533247184753418,
204
+ "step": 550
205
+ },
206
+ {
207
+ "epoch": 5.0,
208
+ "eval_loss": 0.17899587750434875,
209
+ "eval_macro_f1": 0.8317158215809735,
210
+ "eval_micro_f1": 0.8801213960546282,
211
+ "eval_runtime": 13.6418,
212
+ "eval_samples_per_second": 28.075,
213
+ "eval_steps_per_second": 0.88,
214
+ "step": 560
215
+ },
216
+ {
217
+ "epoch": 5.0,
218
+ "step": 560,
219
+ "total_flos": 227810499962112.0,
220
+ "train_loss": 0.26780529745987486,
221
+ "train_runtime": 1216.99,
222
+ "train_samples_per_second": 7.33,
223
+ "train_steps_per_second": 0.46
224
+ },
225
+ {
226
+ "epoch": 5.0,
227
+ "step": 560,
228
+ "test_loss": 0.17423087358474731,
229
+ "test_macro_f1": 0.8512159238545282,
230
+ "test_micro_f1": 0.896807720861173,
231
+ "test_runtime": 12.366,
232
+ "test_samples_per_second": 30.972,
233
+ "test_steps_per_second": 0.97
234
+ }
235
+ ],
236
+ "logging_steps": 25,
237
+ "max_steps": 560,
238
+ "num_input_tokens_seen": 0,
239
+ "num_train_epochs": 5,
240
+ "save_steps": 500,
241
+ "stateful_callbacks": {
242
+ "TrainerControl": {
243
+ "args": {
244
+ "should_epoch_stop": false,
245
+ "should_evaluate": false,
246
+ "should_log": false,
247
+ "should_save": true,
248
+ "should_training_stop": true
249
+ },
250
+ "attributes": {}
251
+ }
252
+ },
253
+ "total_flos": 227810499962112.0,
254
+ "train_batch_size": 16,
255
+ "trial_name": null,
256
+ "trial_params": null
257
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ea11d82e0b8b24b4999106b3c615c65439c3ec832161929cf2a960e32a0e5b12
3
+ size 5265