Instructions to use rqadri/sft_lora_llama8b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use rqadri/sft_lora_llama8b with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-8B-Instruct") model = PeftModel.from_pretrained(base_model, "rqadri/sft_lora_llama8b") - Transformers
How to use rqadri/sft_lora_llama8b with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="rqadri/sft_lora_llama8b") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("rqadri/sft_lora_llama8b", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use rqadri/sft_lora_llama8b with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "rqadri/sft_lora_llama8b" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "rqadri/sft_lora_llama8b", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/rqadri/sft_lora_llama8b
- SGLang
How to use rqadri/sft_lora_llama8b with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "rqadri/sft_lora_llama8b" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "rqadri/sft_lora_llama8b", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "rqadri/sft_lora_llama8b" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "rqadri/sft_lora_llama8b", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use rqadri/sft_lora_llama8b with Docker Model Runner:
docker model run hf.co/rqadri/sft_lora_llama8b
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 980, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.05102040816326531, | |
| "grad_norm": 1.6478675603866577, | |
| "learning_rate": 9.183673469387756e-06, | |
| "loss": 1.7655, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.10204081632653061, | |
| "grad_norm": 1.4168596267700195, | |
| "learning_rate": 1.9387755102040817e-05, | |
| "loss": 1.8516, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.15306122448979592, | |
| "grad_norm": 1.299216389656067, | |
| "learning_rate": 2.959183673469388e-05, | |
| "loss": 1.5544, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.20408163265306123, | |
| "grad_norm": 2.037031650543213, | |
| "learning_rate": 3.979591836734694e-05, | |
| "loss": 1.7124, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.25510204081632654, | |
| "grad_norm": 2.0854408740997314, | |
| "learning_rate": 5e-05, | |
| "loss": 1.613, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.30612244897959184, | |
| "grad_norm": 1.9931455850601196, | |
| "learning_rate": 6.0204081632653065e-05, | |
| "loss": 1.5437, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.35714285714285715, | |
| "grad_norm": 2.0986239910125732, | |
| "learning_rate": 7.040816326530612e-05, | |
| "loss": 1.6174, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.40816326530612246, | |
| "grad_norm": 1.8815388679504395, | |
| "learning_rate": 8.061224489795919e-05, | |
| "loss": 1.3631, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.45918367346938777, | |
| "grad_norm": 1.4877045154571533, | |
| "learning_rate": 9.081632653061225e-05, | |
| "loss": 1.2272, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.5102040816326531, | |
| "grad_norm": 2.1016626358032227, | |
| "learning_rate": 9.999968282268041e-05, | |
| "loss": 1.2912, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.5612244897959183, | |
| "grad_norm": 2.0231621265411377, | |
| "learning_rate": 9.996162641319984e-05, | |
| "loss": 1.3782, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.6122448979591837, | |
| "grad_norm": 2.708197832107544, | |
| "learning_rate": 9.986018985905901e-05, | |
| "loss": 1.3209, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.6632653061224489, | |
| "grad_norm": 2.523878812789917, | |
| "learning_rate": 9.969550184028572e-05, | |
| "loss": 1.3508, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.7142857142857143, | |
| "grad_norm": 2.469815969467163, | |
| "learning_rate": 9.946777127622874e-05, | |
| "loss": 1.106, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.7653061224489796, | |
| "grad_norm": 2.893751859664917, | |
| "learning_rate": 9.917728706052764e-05, | |
| "loss": 1.1835, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.8163265306122449, | |
| "grad_norm": 2.7777068614959717, | |
| "learning_rate": 9.882441769462912e-05, | |
| "loss": 1.4436, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.8673469387755102, | |
| "grad_norm": 3.5251855850219727, | |
| "learning_rate": 9.840961082031472e-05, | |
| "loss": 1.204, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.9183673469387755, | |
| "grad_norm": 1.8896939754486084, | |
| "learning_rate": 9.793339265183303e-05, | |
| "loss": 1.0981, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.9693877551020408, | |
| "grad_norm": 2.6226091384887695, | |
| "learning_rate": 9.73963673083566e-05, | |
| "loss": 1.2019, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.0204081632653061, | |
| "grad_norm": 3.465203285217285, | |
| "learning_rate": 9.679921604761057e-05, | |
| "loss": 1.0944, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.0714285714285714, | |
| "grad_norm": 1.6008201837539673, | |
| "learning_rate": 9.614269640164519e-05, | |
| "loss": 0.8256, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.1224489795918366, | |
| "grad_norm": 4.0602192878723145, | |
| "learning_rate": 9.542764121584844e-05, | |
| "loss": 1.014, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.1734693877551021, | |
| "grad_norm": 2.46638560295105, | |
| "learning_rate": 9.465495759241792e-05, | |
| "loss": 0.9347, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.2244897959183674, | |
| "grad_norm": 2.008498191833496, | |
| "learning_rate": 9.382562573963238e-05, | |
| "loss": 0.9256, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.2755102040816326, | |
| "grad_norm": 2.8920962810516357, | |
| "learning_rate": 9.294069772838253e-05, | |
| "loss": 0.9951, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.3265306122448979, | |
| "grad_norm": 3.308896541595459, | |
| "learning_rate": 9.200129615753859e-05, | |
| "loss": 0.946, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.3775510204081631, | |
| "grad_norm": 2.5991311073303223, | |
| "learning_rate": 9.10086127298478e-05, | |
| "loss": 0.856, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.4285714285714286, | |
| "grad_norm": 2.902071237564087, | |
| "learning_rate": 8.996390674016837e-05, | |
| "loss": 0.8264, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 1.4795918367346939, | |
| "grad_norm": 1.8926688432693481, | |
| "learning_rate": 8.886850347795758e-05, | |
| "loss": 0.8702, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 1.5306122448979593, | |
| "grad_norm": 3.2254858016967773, | |
| "learning_rate": 8.772379254604073e-05, | |
| "loss": 1.0339, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.5816326530612246, | |
| "grad_norm": 3.8619120121002197, | |
| "learning_rate": 8.653122609779363e-05, | |
| "loss": 0.9021, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 1.6326530612244898, | |
| "grad_norm": 2.1868081092834473, | |
| "learning_rate": 8.52923169949751e-05, | |
| "loss": 0.9344, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.683673469387755, | |
| "grad_norm": 2.343775749206543, | |
| "learning_rate": 8.400863688854597e-05, | |
| "loss": 0.9109, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 1.7346938775510203, | |
| "grad_norm": 2.111229658126831, | |
| "learning_rate": 8.268181422490968e-05, | |
| "loss": 0.8071, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 1.7857142857142856, | |
| "grad_norm": 3.3613626956939697, | |
| "learning_rate": 8.131353218010346e-05, | |
| "loss": 0.8768, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.836734693877551, | |
| "grad_norm": 2.71939754486084, | |
| "learning_rate": 7.990552652456081e-05, | |
| "loss": 0.8713, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 1.8877551020408163, | |
| "grad_norm": 2.2052254676818848, | |
| "learning_rate": 7.84595834211538e-05, | |
| "loss": 1.0032, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 1.9387755102040818, | |
| "grad_norm": 2.8950488567352295, | |
| "learning_rate": 7.697753715930906e-05, | |
| "loss": 0.9022, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 1.989795918367347, | |
| "grad_norm": 4.645676612854004, | |
| "learning_rate": 7.546126782807116e-05, | |
| "loss": 0.8592, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 2.0408163265306123, | |
| "grad_norm": 3.2752647399902344, | |
| "learning_rate": 7.391269893106592e-05, | |
| "loss": 0.6323, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.0918367346938775, | |
| "grad_norm": 4.374820709228516, | |
| "learning_rate": 7.233379494638891e-05, | |
| "loss": 0.5927, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 2.142857142857143, | |
| "grad_norm": 2.7660672664642334, | |
| "learning_rate": 7.072655883451478e-05, | |
| "loss": 0.5641, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 2.193877551020408, | |
| "grad_norm": 2.855048179626465, | |
| "learning_rate": 6.909302949738859e-05, | |
| "loss": 0.489, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 2.2448979591836733, | |
| "grad_norm": 3.896364688873291, | |
| "learning_rate": 6.743527919192286e-05, | |
| "loss": 0.5466, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 2.295918367346939, | |
| "grad_norm": 3.3936707973480225, | |
| "learning_rate": 6.575541090118105e-05, | |
| "loss": 0.5776, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 2.3469387755102042, | |
| "grad_norm": 3.9539201259613037, | |
| "learning_rate": 6.405555566658276e-05, | |
| "loss": 0.6127, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 2.3979591836734695, | |
| "grad_norm": 2.619633913040161, | |
| "learning_rate": 6.233786988451468e-05, | |
| "loss": 0.6367, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 2.4489795918367347, | |
| "grad_norm": 3.806926727294922, | |
| "learning_rate": 6.060453257077685e-05, | |
| "loss": 0.6471, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "grad_norm": 3.035620927810669, | |
| "learning_rate": 5.885774259633432e-05, | |
| "loss": 0.5689, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 2.5510204081632653, | |
| "grad_norm": 2.593433380126953, | |
| "learning_rate": 5.709971589788136e-05, | |
| "loss": 0.6244, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.6020408163265305, | |
| "grad_norm": 3.792491912841797, | |
| "learning_rate": 5.533268266675601e-05, | |
| "loss": 0.5528, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 2.6530612244897958, | |
| "grad_norm": 2.980825185775757, | |
| "learning_rate": 5.355888451977203e-05, | |
| "loss": 0.5852, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 2.704081632653061, | |
| "grad_norm": 3.557006359100342, | |
| "learning_rate": 5.1780571655556356e-05, | |
| "loss": 0.5846, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 2.7551020408163263, | |
| "grad_norm": 3.698631525039673, | |
| "learning_rate": 5e-05, | |
| "loss": 0.482, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 2.806122448979592, | |
| "grad_norm": 4.500897407531738, | |
| "learning_rate": 4.821942834444366e-05, | |
| "loss": 0.6085, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 2.857142857142857, | |
| "grad_norm": 3.9586455821990967, | |
| "learning_rate": 4.644111548022798e-05, | |
| "loss": 0.5226, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 2.9081632653061225, | |
| "grad_norm": 4.93420934677124, | |
| "learning_rate": 4.466731733324399e-05, | |
| "loss": 0.5919, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 2.9591836734693877, | |
| "grad_norm": 2.9894070625305176, | |
| "learning_rate": 4.290028410211866e-05, | |
| "loss": 0.6036, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 3.010204081632653, | |
| "grad_norm": 3.0854074954986572, | |
| "learning_rate": 4.114225740366569e-05, | |
| "loss": 0.5819, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 3.061224489795918, | |
| "grad_norm": 4.436528205871582, | |
| "learning_rate": 3.9395467429223174e-05, | |
| "loss": 0.3631, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 3.1122448979591835, | |
| "grad_norm": 4.937603950500488, | |
| "learning_rate": 3.7662130115485314e-05, | |
| "loss": 0.3608, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 3.163265306122449, | |
| "grad_norm": 3.6887364387512207, | |
| "learning_rate": 3.594444433341725e-05, | |
| "loss": 0.3731, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 3.2142857142857144, | |
| "grad_norm": 4.196841239929199, | |
| "learning_rate": 3.424458909881897e-05, | |
| "loss": 0.3705, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 3.2653061224489797, | |
| "grad_norm": 2.659254550933838, | |
| "learning_rate": 3.256472080807716e-05, | |
| "loss": 0.319, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 3.316326530612245, | |
| "grad_norm": 3.6014227867126465, | |
| "learning_rate": 3.0906970502611426e-05, | |
| "loss": 0.3712, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 3.36734693877551, | |
| "grad_norm": 2.9884817600250244, | |
| "learning_rate": 2.9273441165485225e-05, | |
| "loss": 0.298, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 3.4183673469387754, | |
| "grad_norm": 4.593911170959473, | |
| "learning_rate": 2.7666205053611094e-05, | |
| "loss": 0.3771, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 3.4693877551020407, | |
| "grad_norm": 2.160902261734009, | |
| "learning_rate": 2.6087301068934106e-05, | |
| "loss": 0.3602, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 3.520408163265306, | |
| "grad_norm": 3.9651639461517334, | |
| "learning_rate": 2.4538732171928847e-05, | |
| "loss": 0.2789, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 3.571428571428571, | |
| "grad_norm": 4.60761022567749, | |
| "learning_rate": 2.3022462840690935e-05, | |
| "loss": 0.3034, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 3.622448979591837, | |
| "grad_norm": 3.535362958908081, | |
| "learning_rate": 2.1540416578846207e-05, | |
| "loss": 0.3121, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 3.673469387755102, | |
| "grad_norm": 3.8185176849365234, | |
| "learning_rate": 2.0094473475439202e-05, | |
| "loss": 0.4003, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 3.7244897959183674, | |
| "grad_norm": 4.360795021057129, | |
| "learning_rate": 1.868646781989654e-05, | |
| "loss": 0.3756, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 3.7755102040816326, | |
| "grad_norm": 3.257051944732666, | |
| "learning_rate": 1.7318185775090335e-05, | |
| "loss": 0.3455, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 3.826530612244898, | |
| "grad_norm": 5.255533695220947, | |
| "learning_rate": 1.599136311145402e-05, | |
| "loss": 0.3618, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 3.877551020408163, | |
| "grad_norm": 3.5657150745391846, | |
| "learning_rate": 1.4707683005024898e-05, | |
| "loss": 0.3341, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 3.928571428571429, | |
| "grad_norm": 2.86902117729187, | |
| "learning_rate": 1.3468773902206378e-05, | |
| "loss": 0.3589, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 3.979591836734694, | |
| "grad_norm": 5.147337436676025, | |
| "learning_rate": 1.2276207453959282e-05, | |
| "loss": 0.3469, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 4.030612244897959, | |
| "grad_norm": 2.9211270809173584, | |
| "learning_rate": 1.1131496522042424e-05, | |
| "loss": 0.2567, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 4.081632653061225, | |
| "grad_norm": 1.5268677473068237, | |
| "learning_rate": 1.0036093259831625e-05, | |
| "loss": 0.254, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 4.13265306122449, | |
| "grad_norm": 3.26053524017334, | |
| "learning_rate": 8.991387270152201e-06, | |
| "loss": 0.1867, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 4.183673469387755, | |
| "grad_norm": 2.6653261184692383, | |
| "learning_rate": 7.998703842461431e-06, | |
| "loss": 0.2523, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 4.23469387755102, | |
| "grad_norm": 4.051778793334961, | |
| "learning_rate": 7.059302271617485e-06, | |
| "loss": 0.2978, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 4.285714285714286, | |
| "grad_norm": 3.9185943603515625, | |
| "learning_rate": 6.1743742603676105e-06, | |
| "loss": 0.2501, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 4.336734693877551, | |
| "grad_norm": 2.7363100051879883, | |
| "learning_rate": 5.345042407582079e-06, | |
| "loss": 0.2291, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 4.387755102040816, | |
| "grad_norm": 3.580591917037964, | |
| "learning_rate": 4.572358784151571e-06, | |
| "loss": 0.2377, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 4.438775510204081, | |
| "grad_norm": 3.524690628051758, | |
| "learning_rate": 3.857303598354817e-06, | |
| "loss": 0.2685, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 4.489795918367347, | |
| "grad_norm": 3.8094069957733154, | |
| "learning_rate": 3.200783952389447e-06, | |
| "loss": 0.1891, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 4.540816326530612, | |
| "grad_norm": 2.4790217876434326, | |
| "learning_rate": 2.603632691643415e-06, | |
| "loss": 0.2613, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 4.591836734693878, | |
| "grad_norm": 2.5656979084014893, | |
| "learning_rate": 2.066607348166971e-06, | |
| "loss": 0.2563, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 4.642857142857143, | |
| "grad_norm": 2.49578857421875, | |
| "learning_rate": 1.5903891796852754e-06, | |
| "loss": 0.203, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 4.6938775510204085, | |
| "grad_norm": 3.551103115081787, | |
| "learning_rate": 1.175582305370887e-06, | |
| "loss": 0.2152, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 4.744897959183674, | |
| "grad_norm": 2.3327748775482178, | |
| "learning_rate": 8.227129394723642e-07, | |
| "loss": 0.203, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 4.795918367346939, | |
| "grad_norm": 2.943146228790283, | |
| "learning_rate": 5.322287237712665e-07, | |
| "loss": 0.2194, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 4.846938775510204, | |
| "grad_norm": 3.0241503715515137, | |
| "learning_rate": 3.0449815971428377e-07, | |
| "loss": 0.2019, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 4.8979591836734695, | |
| "grad_norm": 4.050006866455078, | |
| "learning_rate": 1.3981014094099353e-07, | |
| "loss": 0.1838, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 4.948979591836735, | |
| "grad_norm": 2.9467973709106445, | |
| "learning_rate": 3.837358680016112e-08, | |
| "loss": 0.2243, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 2.1166837215423584, | |
| "learning_rate": 3.171773195809191e-10, | |
| "loss": 0.1711, | |
| "step": 980 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 980, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.154012783312896e+16, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |