Buckets:
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 4.0, | |
| "eval_steps": 500, | |
| "global_step": 528, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.9595958828926086, | |
| "epoch": 0.0761904761904762, | |
| "grad_norm": 0.2734375, | |
| "learning_rate": 0.00011250000000000001, | |
| "loss": 3.240866851806641, | |
| "mean_token_accuracy": 0.4278678648173809, | |
| "num_tokens": 51393.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 2.182648551464081, | |
| "epoch": 0.1523809523809524, | |
| "grad_norm": 0.53125, | |
| "learning_rate": 0.000198828125, | |
| "loss": 2.1189529418945314, | |
| "mean_token_accuracy": 0.5594275712966919, | |
| "num_tokens": 103044.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.6100243799388408, | |
| "epoch": 0.22857142857142856, | |
| "grad_norm": 0.42578125, | |
| "learning_rate": 0.000194921875, | |
| "loss": 0.46256465911865235, | |
| "mean_token_accuracy": 0.8921082615852356, | |
| "num_tokens": 155372.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.15899799540638923, | |
| "epoch": 0.3047619047619048, | |
| "grad_norm": 0.1416015625, | |
| "learning_rate": 0.000191015625, | |
| "loss": 0.1338058352470398, | |
| "mean_token_accuracy": 0.9736817061901093, | |
| "num_tokens": 207071.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.10284539200365543, | |
| "epoch": 0.38095238095238093, | |
| "grad_norm": 0.154296875, | |
| "learning_rate": 0.00018710937500000002, | |
| "loss": 0.08890653848648071, | |
| "mean_token_accuracy": 0.9821673810482026, | |
| "num_tokens": 259220.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.08220231737941504, | |
| "epoch": 0.45714285714285713, | |
| "grad_norm": 0.0634765625, | |
| "learning_rate": 0.00018320312500000002, | |
| "loss": 0.07045174837112426, | |
| "mean_token_accuracy": 0.9850550860166549, | |
| "num_tokens": 311801.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.07667752653360367, | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.0634765625, | |
| "learning_rate": 0.000179296875, | |
| "loss": 0.0621734082698822, | |
| "mean_token_accuracy": 0.9880644738674164, | |
| "num_tokens": 364215.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.061628233082592486, | |
| "epoch": 0.6095238095238096, | |
| "grad_norm": 0.053466796875, | |
| "learning_rate": 0.000175390625, | |
| "loss": 0.04919908940792084, | |
| "mean_token_accuracy": 0.98963682949543, | |
| "num_tokens": 416786.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.05405457513406873, | |
| "epoch": 0.6857142857142857, | |
| "grad_norm": 0.042724609375, | |
| "learning_rate": 0.000171484375, | |
| "loss": 0.04051331579685211, | |
| "mean_token_accuracy": 0.989881506562233, | |
| "num_tokens": 469061.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.046604708209633826, | |
| "epoch": 0.7619047619047619, | |
| "grad_norm": 0.04443359375, | |
| "learning_rate": 0.000167578125, | |
| "loss": 0.03381928503513336, | |
| "mean_token_accuracy": 0.9901261985301971, | |
| "num_tokens": 520994.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.0436011403799057, | |
| "epoch": 0.8380952380952381, | |
| "grad_norm": 0.039794921875, | |
| "learning_rate": 0.000163671875, | |
| "loss": 0.02850658893585205, | |
| "mean_token_accuracy": 0.9906597018241883, | |
| "num_tokens": 573416.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.03658721894025803, | |
| "epoch": 0.9142857142857143, | |
| "grad_norm": 0.03857421875, | |
| "learning_rate": 0.000159765625, | |
| "loss": 0.02531660795211792, | |
| "mean_token_accuracy": 0.9907815054059028, | |
| "num_tokens": 626103.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.03238420016132295, | |
| "epoch": 0.9904761904761905, | |
| "grad_norm": 0.04052734375, | |
| "learning_rate": 0.00015585937500000002, | |
| "loss": 0.023946774005889893, | |
| "mean_token_accuracy": 0.9911120891571045, | |
| "num_tokens": 677931.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.0283962572245179, | |
| "epoch": 1.0609523809523809, | |
| "grad_norm": 0.037353515625, | |
| "learning_rate": 0.00015195312500000002, | |
| "loss": 0.022961416840553285, | |
| "mean_token_accuracy": 0.9910324973029059, | |
| "num_tokens": 725808.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.028231510194018483, | |
| "epoch": 1.1371428571428572, | |
| "grad_norm": 0.038818359375, | |
| "learning_rate": 0.000148046875, | |
| "loss": 0.0232963889837265, | |
| "mean_token_accuracy": 0.9910563603043556, | |
| "num_tokens": 777254.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.02743022874929011, | |
| "epoch": 1.2133333333333334, | |
| "grad_norm": 0.026611328125, | |
| "learning_rate": 0.000144140625, | |
| "loss": 0.022132843732833862, | |
| "mean_token_accuracy": 0.9908890873193741, | |
| "num_tokens": 829256.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.024864112539216877, | |
| "epoch": 1.2895238095238095, | |
| "grad_norm": 0.03271484375, | |
| "learning_rate": 0.000140234375, | |
| "loss": 0.022053052484989167, | |
| "mean_token_accuracy": 0.9913128837943077, | |
| "num_tokens": 882198.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.02531064748764038, | |
| "epoch": 1.3657142857142857, | |
| "grad_norm": 0.0361328125, | |
| "learning_rate": 0.000136328125, | |
| "loss": 0.02183598130941391, | |
| "mean_token_accuracy": 0.9910814210772514, | |
| "num_tokens": 934671.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.024810794834047557, | |
| "epoch": 1.441904761904762, | |
| "grad_norm": 0.0294189453125, | |
| "learning_rate": 0.000132421875, | |
| "loss": 0.021508647501468657, | |
| "mean_token_accuracy": 0.9913933798670769, | |
| "num_tokens": 986129.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.02357544139958918, | |
| "epoch": 1.518095238095238, | |
| "grad_norm": 0.0263671875, | |
| "learning_rate": 0.000128515625, | |
| "loss": 0.020876428484916686, | |
| "mean_token_accuracy": 0.9913628473877907, | |
| "num_tokens": 1039116.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.023903176514431836, | |
| "epoch": 1.5942857142857143, | |
| "grad_norm": 0.02880859375, | |
| "learning_rate": 0.00012460937500000002, | |
| "loss": 0.02106754332780838, | |
| "mean_token_accuracy": 0.9910304084420204, | |
| "num_tokens": 1091462.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.0234323940705508, | |
| "epoch": 1.6704761904761904, | |
| "grad_norm": 0.03173828125, | |
| "learning_rate": 0.000120703125, | |
| "loss": 0.020690058171749116, | |
| "mean_token_accuracy": 0.9912343874573708, | |
| "num_tokens": 1143513.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.023244570288807154, | |
| "epoch": 1.7466666666666666, | |
| "grad_norm": 0.03564453125, | |
| "learning_rate": 0.00011679687500000001, | |
| "loss": 0.020958010852336884, | |
| "mean_token_accuracy": 0.9910316273570061, | |
| "num_tokens": 1195705.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.024211456114426256, | |
| "epoch": 1.822857142857143, | |
| "grad_norm": 0.020751953125, | |
| "learning_rate": 0.00011289062500000001, | |
| "loss": 0.020894132554531097, | |
| "mean_token_accuracy": 0.9914289116859436, | |
| "num_tokens": 1247868.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.023242059536278246, | |
| "epoch": 1.899047619047619, | |
| "grad_norm": 0.09619140625, | |
| "learning_rate": 0.000108984375, | |
| "loss": 0.021041123569011687, | |
| "mean_token_accuracy": 0.9906927838921546, | |
| "num_tokens": 1300030.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.023394071217626333, | |
| "epoch": 1.9752380952380952, | |
| "grad_norm": 0.022705078125, | |
| "learning_rate": 0.000105078125, | |
| "loss": 0.021337199211120605, | |
| "mean_token_accuracy": 0.9910883501172065, | |
| "num_tokens": 1351744.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.023486525877504737, | |
| "epoch": 2.045714285714286, | |
| "grad_norm": 0.0303955078125, | |
| "learning_rate": 0.00010117187500000001, | |
| "loss": 0.020846356451511384, | |
| "mean_token_accuracy": 0.9910464737866376, | |
| "num_tokens": 1399205.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.022303093690425158, | |
| "epoch": 2.1219047619047617, | |
| "grad_norm": 0.0234375, | |
| "learning_rate": 9.726562500000001e-05, | |
| "loss": 0.020218101143836976, | |
| "mean_token_accuracy": 0.9912245735526085, | |
| "num_tokens": 1451326.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.022589343739673494, | |
| "epoch": 2.198095238095238, | |
| "grad_norm": 0.022705078125, | |
| "learning_rate": 9.3359375e-05, | |
| "loss": 0.020336566865444182, | |
| "mean_token_accuracy": 0.9916371747851371, | |
| "num_tokens": 1503498.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.022218059003353118, | |
| "epoch": 2.2742857142857145, | |
| "grad_norm": 0.019287109375, | |
| "learning_rate": 8.9453125e-05, | |
| "loss": 0.020144131779670716, | |
| "mean_token_accuracy": 0.991128446161747, | |
| "num_tokens": 1555619.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.022531974827870727, | |
| "epoch": 2.3504761904761904, | |
| "grad_norm": 0.0267333984375, | |
| "learning_rate": 8.5546875e-05, | |
| "loss": 0.020586799085140228, | |
| "mean_token_accuracy": 0.9912104174494744, | |
| "num_tokens": 1607621.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.022078307764604687, | |
| "epoch": 2.4266666666666667, | |
| "grad_norm": 0.02099609375, | |
| "learning_rate": 8.164062500000001e-05, | |
| "loss": 0.020096388459205628, | |
| "mean_token_accuracy": 0.9914543464779854, | |
| "num_tokens": 1659928.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.022692699311301114, | |
| "epoch": 2.5028571428571427, | |
| "grad_norm": 0.0185546875, | |
| "learning_rate": 7.7734375e-05, | |
| "loss": 0.020065692067146302, | |
| "mean_token_accuracy": 0.9914301604032516, | |
| "num_tokens": 1712029.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.021960999770089983, | |
| "epoch": 2.579047619047619, | |
| "grad_norm": 0.02490234375, | |
| "learning_rate": 7.3828125e-05, | |
| "loss": 0.01993292272090912, | |
| "mean_token_accuracy": 0.9912716716527938, | |
| "num_tokens": 1764966.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.021830143872648478, | |
| "epoch": 2.6552380952380954, | |
| "grad_norm": 0.023681640625, | |
| "learning_rate": 6.9921875e-05, | |
| "loss": 0.019897110760211945, | |
| "mean_token_accuracy": 0.9914486855268478, | |
| "num_tokens": 1817278.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.022162985149770977, | |
| "epoch": 2.7314285714285713, | |
| "grad_norm": 0.0203857421875, | |
| "learning_rate": 6.601562500000001e-05, | |
| "loss": 0.020072299242019653, | |
| "mean_token_accuracy": 0.9910245254635811, | |
| "num_tokens": 1869353.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.02198883257806301, | |
| "epoch": 2.8076190476190477, | |
| "grad_norm": 0.0257568359375, | |
| "learning_rate": 6.2109375e-05, | |
| "loss": 0.020215952396392824, | |
| "mean_token_accuracy": 0.991267018020153, | |
| "num_tokens": 1921266.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.02126058964058757, | |
| "epoch": 2.883809523809524, | |
| "grad_norm": 0.01806640625, | |
| "learning_rate": 5.8203125e-05, | |
| "loss": 0.019716666638851167, | |
| "mean_token_accuracy": 0.9915330603718757, | |
| "num_tokens": 1974173.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.022073809802532197, | |
| "epoch": 2.96, | |
| "grad_norm": 0.0194091796875, | |
| "learning_rate": 5.4296875000000004e-05, | |
| "loss": 0.02013145834207535, | |
| "mean_token_accuracy": 0.9911942318081856, | |
| "num_tokens": 2026508.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.022336994121606286, | |
| "epoch": 3.0304761904761905, | |
| "grad_norm": 0.02392578125, | |
| "learning_rate": 5.0390625e-05, | |
| "loss": 0.020002672076225282, | |
| "mean_token_accuracy": 0.990862129507838, | |
| "num_tokens": 2074114.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.02170365508645773, | |
| "epoch": 3.1066666666666665, | |
| "grad_norm": 0.0238037109375, | |
| "learning_rate": 4.6484375e-05, | |
| "loss": 0.019622784852981568, | |
| "mean_token_accuracy": 0.9913498371839523, | |
| "num_tokens": 2126252.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.021816531661897898, | |
| "epoch": 3.182857142857143, | |
| "grad_norm": 0.01904296875, | |
| "learning_rate": 4.2578125e-05, | |
| "loss": 0.019900180399417877, | |
| "mean_token_accuracy": 0.9917269065976143, | |
| "num_tokens": 2178311.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.021046800073236227, | |
| "epoch": 3.259047619047619, | |
| "grad_norm": 0.0186767578125, | |
| "learning_rate": 3.8671875e-05, | |
| "loss": 0.01920921206474304, | |
| "mean_token_accuracy": 0.9916461497545243, | |
| "num_tokens": 2231862.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.021922438265755774, | |
| "epoch": 3.335238095238095, | |
| "grad_norm": 0.0279541015625, | |
| "learning_rate": 3.4765625e-05, | |
| "loss": 0.019981184601783754, | |
| "mean_token_accuracy": 0.991122642159462, | |
| "num_tokens": 2283339.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.021684585325419902, | |
| "epoch": 3.4114285714285715, | |
| "grad_norm": 0.023193359375, | |
| "learning_rate": 3.0859375e-05, | |
| "loss": 0.019783757627010345, | |
| "mean_token_accuracy": 0.9912073120474816, | |
| "num_tokens": 2335373.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.022066454263404013, | |
| "epoch": 3.487619047619048, | |
| "grad_norm": 0.0201416015625, | |
| "learning_rate": 2.6953125000000003e-05, | |
| "loss": 0.019901323318481445, | |
| "mean_token_accuracy": 0.9912807777523994, | |
| "num_tokens": 2386943.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.021382719092071057, | |
| "epoch": 3.5638095238095238, | |
| "grad_norm": 0.0189208984375, | |
| "learning_rate": 2.3046875e-05, | |
| "loss": 0.019521698355674744, | |
| "mean_token_accuracy": 0.9913338109850883, | |
| "num_tokens": 2439487.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.021717160381376742, | |
| "epoch": 3.64, | |
| "grad_norm": 0.018798828125, | |
| "learning_rate": 1.9140625e-05, | |
| "loss": 0.019752655923366547, | |
| "mean_token_accuracy": 0.9913526356220246, | |
| "num_tokens": 2491108.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.021849045297130942, | |
| "epoch": 3.716190476190476, | |
| "grad_norm": 0.019287109375, | |
| "learning_rate": 1.5234375000000001e-05, | |
| "loss": 0.019617608189582823, | |
| "mean_token_accuracy": 0.9915902808308601, | |
| "num_tokens": 2542777.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.021322652604430913, | |
| "epoch": 3.7923809523809524, | |
| "grad_norm": 0.022216796875, | |
| "learning_rate": 1.1328125000000001e-05, | |
| "loss": 0.01927768290042877, | |
| "mean_token_accuracy": 0.9913811206817627, | |
| "num_tokens": 2595903.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.02207843461073935, | |
| "epoch": 3.8685714285714283, | |
| "grad_norm": 0.0223388671875, | |
| "learning_rate": 7.421875e-06, | |
| "loss": 0.020016531646251678, | |
| "mean_token_accuracy": 0.9907937526702881, | |
| "num_tokens": 2647278.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.021845509810373188, | |
| "epoch": 3.9447619047619047, | |
| "grad_norm": 0.0238037109375, | |
| "learning_rate": 3.5156250000000003e-06, | |
| "loss": 0.01967438906431198, | |
| "mean_token_accuracy": 0.991420166194439, | |
| "num_tokens": 2699258.0, | |
| "step": 520 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 528, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 4, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.29591337684992e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |
Xet Storage Details
- Size:
- 16.1 kB
- Xet hash:
- d826bb2b864a833dbddeedec50ccbc2519a7940de402dd2f795fe057254d282c
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.