sft_lora_llama8b / trainer_state.json
rqadri's picture
Upload folder using huggingface_hub
814009e verified
Raw
History Blame Contribute Delete
17.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 980,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05102040816326531,
"grad_norm": 1.6478675603866577,
"learning_rate": 9.183673469387756e-06,
"loss": 1.7655,
"step": 10
},
{
"epoch": 0.10204081632653061,
"grad_norm": 1.4168596267700195,
"learning_rate": 1.9387755102040817e-05,
"loss": 1.8516,
"step": 20
},
{
"epoch": 0.15306122448979592,
"grad_norm": 1.299216389656067,
"learning_rate": 2.959183673469388e-05,
"loss": 1.5544,
"step": 30
},
{
"epoch": 0.20408163265306123,
"grad_norm": 2.037031650543213,
"learning_rate": 3.979591836734694e-05,
"loss": 1.7124,
"step": 40
},
{
"epoch": 0.25510204081632654,
"grad_norm": 2.0854408740997314,
"learning_rate": 5e-05,
"loss": 1.613,
"step": 50
},
{
"epoch": 0.30612244897959184,
"grad_norm": 1.9931455850601196,
"learning_rate": 6.0204081632653065e-05,
"loss": 1.5437,
"step": 60
},
{
"epoch": 0.35714285714285715,
"grad_norm": 2.0986239910125732,
"learning_rate": 7.040816326530612e-05,
"loss": 1.6174,
"step": 70
},
{
"epoch": 0.40816326530612246,
"grad_norm": 1.8815388679504395,
"learning_rate": 8.061224489795919e-05,
"loss": 1.3631,
"step": 80
},
{
"epoch": 0.45918367346938777,
"grad_norm": 1.4877045154571533,
"learning_rate": 9.081632653061225e-05,
"loss": 1.2272,
"step": 90
},
{
"epoch": 0.5102040816326531,
"grad_norm": 2.1016626358032227,
"learning_rate": 9.999968282268041e-05,
"loss": 1.2912,
"step": 100
},
{
"epoch": 0.5612244897959183,
"grad_norm": 2.0231621265411377,
"learning_rate": 9.996162641319984e-05,
"loss": 1.3782,
"step": 110
},
{
"epoch": 0.6122448979591837,
"grad_norm": 2.708197832107544,
"learning_rate": 9.986018985905901e-05,
"loss": 1.3209,
"step": 120
},
{
"epoch": 0.6632653061224489,
"grad_norm": 2.523878812789917,
"learning_rate": 9.969550184028572e-05,
"loss": 1.3508,
"step": 130
},
{
"epoch": 0.7142857142857143,
"grad_norm": 2.469815969467163,
"learning_rate": 9.946777127622874e-05,
"loss": 1.106,
"step": 140
},
{
"epoch": 0.7653061224489796,
"grad_norm": 2.893751859664917,
"learning_rate": 9.917728706052764e-05,
"loss": 1.1835,
"step": 150
},
{
"epoch": 0.8163265306122449,
"grad_norm": 2.7777068614959717,
"learning_rate": 9.882441769462912e-05,
"loss": 1.4436,
"step": 160
},
{
"epoch": 0.8673469387755102,
"grad_norm": 3.5251855850219727,
"learning_rate": 9.840961082031472e-05,
"loss": 1.204,
"step": 170
},
{
"epoch": 0.9183673469387755,
"grad_norm": 1.8896939754486084,
"learning_rate": 9.793339265183303e-05,
"loss": 1.0981,
"step": 180
},
{
"epoch": 0.9693877551020408,
"grad_norm": 2.6226091384887695,
"learning_rate": 9.73963673083566e-05,
"loss": 1.2019,
"step": 190
},
{
"epoch": 1.0204081632653061,
"grad_norm": 3.465203285217285,
"learning_rate": 9.679921604761057e-05,
"loss": 1.0944,
"step": 200
},
{
"epoch": 1.0714285714285714,
"grad_norm": 1.6008201837539673,
"learning_rate": 9.614269640164519e-05,
"loss": 0.8256,
"step": 210
},
{
"epoch": 1.1224489795918366,
"grad_norm": 4.0602192878723145,
"learning_rate": 9.542764121584844e-05,
"loss": 1.014,
"step": 220
},
{
"epoch": 1.1734693877551021,
"grad_norm": 2.46638560295105,
"learning_rate": 9.465495759241792e-05,
"loss": 0.9347,
"step": 230
},
{
"epoch": 1.2244897959183674,
"grad_norm": 2.008498191833496,
"learning_rate": 9.382562573963238e-05,
"loss": 0.9256,
"step": 240
},
{
"epoch": 1.2755102040816326,
"grad_norm": 2.8920962810516357,
"learning_rate": 9.294069772838253e-05,
"loss": 0.9951,
"step": 250
},
{
"epoch": 1.3265306122448979,
"grad_norm": 3.308896541595459,
"learning_rate": 9.200129615753859e-05,
"loss": 0.946,
"step": 260
},
{
"epoch": 1.3775510204081631,
"grad_norm": 2.5991311073303223,
"learning_rate": 9.10086127298478e-05,
"loss": 0.856,
"step": 270
},
{
"epoch": 1.4285714285714286,
"grad_norm": 2.902071237564087,
"learning_rate": 8.996390674016837e-05,
"loss": 0.8264,
"step": 280
},
{
"epoch": 1.4795918367346939,
"grad_norm": 1.8926688432693481,
"learning_rate": 8.886850347795758e-05,
"loss": 0.8702,
"step": 290
},
{
"epoch": 1.5306122448979593,
"grad_norm": 3.2254858016967773,
"learning_rate": 8.772379254604073e-05,
"loss": 1.0339,
"step": 300
},
{
"epoch": 1.5816326530612246,
"grad_norm": 3.8619120121002197,
"learning_rate": 8.653122609779363e-05,
"loss": 0.9021,
"step": 310
},
{
"epoch": 1.6326530612244898,
"grad_norm": 2.1868081092834473,
"learning_rate": 8.52923169949751e-05,
"loss": 0.9344,
"step": 320
},
{
"epoch": 1.683673469387755,
"grad_norm": 2.343775749206543,
"learning_rate": 8.400863688854597e-05,
"loss": 0.9109,
"step": 330
},
{
"epoch": 1.7346938775510203,
"grad_norm": 2.111229658126831,
"learning_rate": 8.268181422490968e-05,
"loss": 0.8071,
"step": 340
},
{
"epoch": 1.7857142857142856,
"grad_norm": 3.3613626956939697,
"learning_rate": 8.131353218010346e-05,
"loss": 0.8768,
"step": 350
},
{
"epoch": 1.836734693877551,
"grad_norm": 2.71939754486084,
"learning_rate": 7.990552652456081e-05,
"loss": 0.8713,
"step": 360
},
{
"epoch": 1.8877551020408163,
"grad_norm": 2.2052254676818848,
"learning_rate": 7.84595834211538e-05,
"loss": 1.0032,
"step": 370
},
{
"epoch": 1.9387755102040818,
"grad_norm": 2.8950488567352295,
"learning_rate": 7.697753715930906e-05,
"loss": 0.9022,
"step": 380
},
{
"epoch": 1.989795918367347,
"grad_norm": 4.645676612854004,
"learning_rate": 7.546126782807116e-05,
"loss": 0.8592,
"step": 390
},
{
"epoch": 2.0408163265306123,
"grad_norm": 3.2752647399902344,
"learning_rate": 7.391269893106592e-05,
"loss": 0.6323,
"step": 400
},
{
"epoch": 2.0918367346938775,
"grad_norm": 4.374820709228516,
"learning_rate": 7.233379494638891e-05,
"loss": 0.5927,
"step": 410
},
{
"epoch": 2.142857142857143,
"grad_norm": 2.7660672664642334,
"learning_rate": 7.072655883451478e-05,
"loss": 0.5641,
"step": 420
},
{
"epoch": 2.193877551020408,
"grad_norm": 2.855048179626465,
"learning_rate": 6.909302949738859e-05,
"loss": 0.489,
"step": 430
},
{
"epoch": 2.2448979591836733,
"grad_norm": 3.896364688873291,
"learning_rate": 6.743527919192286e-05,
"loss": 0.5466,
"step": 440
},
{
"epoch": 2.295918367346939,
"grad_norm": 3.3936707973480225,
"learning_rate": 6.575541090118105e-05,
"loss": 0.5776,
"step": 450
},
{
"epoch": 2.3469387755102042,
"grad_norm": 3.9539201259613037,
"learning_rate": 6.405555566658276e-05,
"loss": 0.6127,
"step": 460
},
{
"epoch": 2.3979591836734695,
"grad_norm": 2.619633913040161,
"learning_rate": 6.233786988451468e-05,
"loss": 0.6367,
"step": 470
},
{
"epoch": 2.4489795918367347,
"grad_norm": 3.806926727294922,
"learning_rate": 6.060453257077685e-05,
"loss": 0.6471,
"step": 480
},
{
"epoch": 2.5,
"grad_norm": 3.035620927810669,
"learning_rate": 5.885774259633432e-05,
"loss": 0.5689,
"step": 490
},
{
"epoch": 2.5510204081632653,
"grad_norm": 2.593433380126953,
"learning_rate": 5.709971589788136e-05,
"loss": 0.6244,
"step": 500
},
{
"epoch": 2.6020408163265305,
"grad_norm": 3.792491912841797,
"learning_rate": 5.533268266675601e-05,
"loss": 0.5528,
"step": 510
},
{
"epoch": 2.6530612244897958,
"grad_norm": 2.980825185775757,
"learning_rate": 5.355888451977203e-05,
"loss": 0.5852,
"step": 520
},
{
"epoch": 2.704081632653061,
"grad_norm": 3.557006359100342,
"learning_rate": 5.1780571655556356e-05,
"loss": 0.5846,
"step": 530
},
{
"epoch": 2.7551020408163263,
"grad_norm": 3.698631525039673,
"learning_rate": 5e-05,
"loss": 0.482,
"step": 540
},
{
"epoch": 2.806122448979592,
"grad_norm": 4.500897407531738,
"learning_rate": 4.821942834444366e-05,
"loss": 0.6085,
"step": 550
},
{
"epoch": 2.857142857142857,
"grad_norm": 3.9586455821990967,
"learning_rate": 4.644111548022798e-05,
"loss": 0.5226,
"step": 560
},
{
"epoch": 2.9081632653061225,
"grad_norm": 4.93420934677124,
"learning_rate": 4.466731733324399e-05,
"loss": 0.5919,
"step": 570
},
{
"epoch": 2.9591836734693877,
"grad_norm": 2.9894070625305176,
"learning_rate": 4.290028410211866e-05,
"loss": 0.6036,
"step": 580
},
{
"epoch": 3.010204081632653,
"grad_norm": 3.0854074954986572,
"learning_rate": 4.114225740366569e-05,
"loss": 0.5819,
"step": 590
},
{
"epoch": 3.061224489795918,
"grad_norm": 4.436528205871582,
"learning_rate": 3.9395467429223174e-05,
"loss": 0.3631,
"step": 600
},
{
"epoch": 3.1122448979591835,
"grad_norm": 4.937603950500488,
"learning_rate": 3.7662130115485314e-05,
"loss": 0.3608,
"step": 610
},
{
"epoch": 3.163265306122449,
"grad_norm": 3.6887364387512207,
"learning_rate": 3.594444433341725e-05,
"loss": 0.3731,
"step": 620
},
{
"epoch": 3.2142857142857144,
"grad_norm": 4.196841239929199,
"learning_rate": 3.424458909881897e-05,
"loss": 0.3705,
"step": 630
},
{
"epoch": 3.2653061224489797,
"grad_norm": 2.659254550933838,
"learning_rate": 3.256472080807716e-05,
"loss": 0.319,
"step": 640
},
{
"epoch": 3.316326530612245,
"grad_norm": 3.6014227867126465,
"learning_rate": 3.0906970502611426e-05,
"loss": 0.3712,
"step": 650
},
{
"epoch": 3.36734693877551,
"grad_norm": 2.9884817600250244,
"learning_rate": 2.9273441165485225e-05,
"loss": 0.298,
"step": 660
},
{
"epoch": 3.4183673469387754,
"grad_norm": 4.593911170959473,
"learning_rate": 2.7666205053611094e-05,
"loss": 0.3771,
"step": 670
},
{
"epoch": 3.4693877551020407,
"grad_norm": 2.160902261734009,
"learning_rate": 2.6087301068934106e-05,
"loss": 0.3602,
"step": 680
},
{
"epoch": 3.520408163265306,
"grad_norm": 3.9651639461517334,
"learning_rate": 2.4538732171928847e-05,
"loss": 0.2789,
"step": 690
},
{
"epoch": 3.571428571428571,
"grad_norm": 4.60761022567749,
"learning_rate": 2.3022462840690935e-05,
"loss": 0.3034,
"step": 700
},
{
"epoch": 3.622448979591837,
"grad_norm": 3.535362958908081,
"learning_rate": 2.1540416578846207e-05,
"loss": 0.3121,
"step": 710
},
{
"epoch": 3.673469387755102,
"grad_norm": 3.8185176849365234,
"learning_rate": 2.0094473475439202e-05,
"loss": 0.4003,
"step": 720
},
{
"epoch": 3.7244897959183674,
"grad_norm": 4.360795021057129,
"learning_rate": 1.868646781989654e-05,
"loss": 0.3756,
"step": 730
},
{
"epoch": 3.7755102040816326,
"grad_norm": 3.257051944732666,
"learning_rate": 1.7318185775090335e-05,
"loss": 0.3455,
"step": 740
},
{
"epoch": 3.826530612244898,
"grad_norm": 5.255533695220947,
"learning_rate": 1.599136311145402e-05,
"loss": 0.3618,
"step": 750
},
{
"epoch": 3.877551020408163,
"grad_norm": 3.5657150745391846,
"learning_rate": 1.4707683005024898e-05,
"loss": 0.3341,
"step": 760
},
{
"epoch": 3.928571428571429,
"grad_norm": 2.86902117729187,
"learning_rate": 1.3468773902206378e-05,
"loss": 0.3589,
"step": 770
},
{
"epoch": 3.979591836734694,
"grad_norm": 5.147337436676025,
"learning_rate": 1.2276207453959282e-05,
"loss": 0.3469,
"step": 780
},
{
"epoch": 4.030612244897959,
"grad_norm": 2.9211270809173584,
"learning_rate": 1.1131496522042424e-05,
"loss": 0.2567,
"step": 790
},
{
"epoch": 4.081632653061225,
"grad_norm": 1.5268677473068237,
"learning_rate": 1.0036093259831625e-05,
"loss": 0.254,
"step": 800
},
{
"epoch": 4.13265306122449,
"grad_norm": 3.26053524017334,
"learning_rate": 8.991387270152201e-06,
"loss": 0.1867,
"step": 810
},
{
"epoch": 4.183673469387755,
"grad_norm": 2.6653261184692383,
"learning_rate": 7.998703842461431e-06,
"loss": 0.2523,
"step": 820
},
{
"epoch": 4.23469387755102,
"grad_norm": 4.051778793334961,
"learning_rate": 7.059302271617485e-06,
"loss": 0.2978,
"step": 830
},
{
"epoch": 4.285714285714286,
"grad_norm": 3.9185943603515625,
"learning_rate": 6.1743742603676105e-06,
"loss": 0.2501,
"step": 840
},
{
"epoch": 4.336734693877551,
"grad_norm": 2.7363100051879883,
"learning_rate": 5.345042407582079e-06,
"loss": 0.2291,
"step": 850
},
{
"epoch": 4.387755102040816,
"grad_norm": 3.580591917037964,
"learning_rate": 4.572358784151571e-06,
"loss": 0.2377,
"step": 860
},
{
"epoch": 4.438775510204081,
"grad_norm": 3.524690628051758,
"learning_rate": 3.857303598354817e-06,
"loss": 0.2685,
"step": 870
},
{
"epoch": 4.489795918367347,
"grad_norm": 3.8094069957733154,
"learning_rate": 3.200783952389447e-06,
"loss": 0.1891,
"step": 880
},
{
"epoch": 4.540816326530612,
"grad_norm": 2.4790217876434326,
"learning_rate": 2.603632691643415e-06,
"loss": 0.2613,
"step": 890
},
{
"epoch": 4.591836734693878,
"grad_norm": 2.5656979084014893,
"learning_rate": 2.066607348166971e-06,
"loss": 0.2563,
"step": 900
},
{
"epoch": 4.642857142857143,
"grad_norm": 2.49578857421875,
"learning_rate": 1.5903891796852754e-06,
"loss": 0.203,
"step": 910
},
{
"epoch": 4.6938775510204085,
"grad_norm": 3.551103115081787,
"learning_rate": 1.175582305370887e-06,
"loss": 0.2152,
"step": 920
},
{
"epoch": 4.744897959183674,
"grad_norm": 2.3327748775482178,
"learning_rate": 8.227129394723642e-07,
"loss": 0.203,
"step": 930
},
{
"epoch": 4.795918367346939,
"grad_norm": 2.943146228790283,
"learning_rate": 5.322287237712665e-07,
"loss": 0.2194,
"step": 940
},
{
"epoch": 4.846938775510204,
"grad_norm": 3.0241503715515137,
"learning_rate": 3.0449815971428377e-07,
"loss": 0.2019,
"step": 950
},
{
"epoch": 4.8979591836734695,
"grad_norm": 4.050006866455078,
"learning_rate": 1.3981014094099353e-07,
"loss": 0.1838,
"step": 960
},
{
"epoch": 4.948979591836735,
"grad_norm": 2.9467973709106445,
"learning_rate": 3.837358680016112e-08,
"loss": 0.2243,
"step": 970
},
{
"epoch": 5.0,
"grad_norm": 2.1166837215423584,
"learning_rate": 3.171773195809191e-10,
"loss": 0.1711,
"step": 980
}
],
"logging_steps": 10,
"max_steps": 980,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.154012783312896e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}