Raiff1982's picture
download
raw
16.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.0,
"eval_steps": 500,
"global_step": 528,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.9595958828926086,
"epoch": 0.0761904761904762,
"grad_norm": 0.2734375,
"learning_rate": 0.00011250000000000001,
"loss": 3.240866851806641,
"mean_token_accuracy": 0.4278678648173809,
"num_tokens": 51393.0,
"step": 10
},
{
"entropy": 2.182648551464081,
"epoch": 0.1523809523809524,
"grad_norm": 0.53125,
"learning_rate": 0.000198828125,
"loss": 2.1189529418945314,
"mean_token_accuracy": 0.5594275712966919,
"num_tokens": 103044.0,
"step": 20
},
{
"entropy": 0.6100243799388408,
"epoch": 0.22857142857142856,
"grad_norm": 0.42578125,
"learning_rate": 0.000194921875,
"loss": 0.46256465911865235,
"mean_token_accuracy": 0.8921082615852356,
"num_tokens": 155372.0,
"step": 30
},
{
"entropy": 0.15899799540638923,
"epoch": 0.3047619047619048,
"grad_norm": 0.1416015625,
"learning_rate": 0.000191015625,
"loss": 0.1338058352470398,
"mean_token_accuracy": 0.9736817061901093,
"num_tokens": 207071.0,
"step": 40
},
{
"entropy": 0.10284539200365543,
"epoch": 0.38095238095238093,
"grad_norm": 0.154296875,
"learning_rate": 0.00018710937500000002,
"loss": 0.08890653848648071,
"mean_token_accuracy": 0.9821673810482026,
"num_tokens": 259220.0,
"step": 50
},
{
"entropy": 0.08220231737941504,
"epoch": 0.45714285714285713,
"grad_norm": 0.0634765625,
"learning_rate": 0.00018320312500000002,
"loss": 0.07045174837112426,
"mean_token_accuracy": 0.9850550860166549,
"num_tokens": 311801.0,
"step": 60
},
{
"entropy": 0.07667752653360367,
"epoch": 0.5333333333333333,
"grad_norm": 0.0634765625,
"learning_rate": 0.000179296875,
"loss": 0.0621734082698822,
"mean_token_accuracy": 0.9880644738674164,
"num_tokens": 364215.0,
"step": 70
},
{
"entropy": 0.061628233082592486,
"epoch": 0.6095238095238096,
"grad_norm": 0.053466796875,
"learning_rate": 0.000175390625,
"loss": 0.04919908940792084,
"mean_token_accuracy": 0.98963682949543,
"num_tokens": 416786.0,
"step": 80
},
{
"entropy": 0.05405457513406873,
"epoch": 0.6857142857142857,
"grad_norm": 0.042724609375,
"learning_rate": 0.000171484375,
"loss": 0.04051331579685211,
"mean_token_accuracy": 0.989881506562233,
"num_tokens": 469061.0,
"step": 90
},
{
"entropy": 0.046604708209633826,
"epoch": 0.7619047619047619,
"grad_norm": 0.04443359375,
"learning_rate": 0.000167578125,
"loss": 0.03381928503513336,
"mean_token_accuracy": 0.9901261985301971,
"num_tokens": 520994.0,
"step": 100
},
{
"entropy": 0.0436011403799057,
"epoch": 0.8380952380952381,
"grad_norm": 0.039794921875,
"learning_rate": 0.000163671875,
"loss": 0.02850658893585205,
"mean_token_accuracy": 0.9906597018241883,
"num_tokens": 573416.0,
"step": 110
},
{
"entropy": 0.03658721894025803,
"epoch": 0.9142857142857143,
"grad_norm": 0.03857421875,
"learning_rate": 0.000159765625,
"loss": 0.02531660795211792,
"mean_token_accuracy": 0.9907815054059028,
"num_tokens": 626103.0,
"step": 120
},
{
"entropy": 0.03238420016132295,
"epoch": 0.9904761904761905,
"grad_norm": 0.04052734375,
"learning_rate": 0.00015585937500000002,
"loss": 0.023946774005889893,
"mean_token_accuracy": 0.9911120891571045,
"num_tokens": 677931.0,
"step": 130
},
{
"entropy": 0.0283962572245179,
"epoch": 1.0609523809523809,
"grad_norm": 0.037353515625,
"learning_rate": 0.00015195312500000002,
"loss": 0.022961416840553285,
"mean_token_accuracy": 0.9910324973029059,
"num_tokens": 725808.0,
"step": 140
},
{
"entropy": 0.028231510194018483,
"epoch": 1.1371428571428572,
"grad_norm": 0.038818359375,
"learning_rate": 0.000148046875,
"loss": 0.0232963889837265,
"mean_token_accuracy": 0.9910563603043556,
"num_tokens": 777254.0,
"step": 150
},
{
"entropy": 0.02743022874929011,
"epoch": 1.2133333333333334,
"grad_norm": 0.026611328125,
"learning_rate": 0.000144140625,
"loss": 0.022132843732833862,
"mean_token_accuracy": 0.9908890873193741,
"num_tokens": 829256.0,
"step": 160
},
{
"entropy": 0.024864112539216877,
"epoch": 1.2895238095238095,
"grad_norm": 0.03271484375,
"learning_rate": 0.000140234375,
"loss": 0.022053052484989167,
"mean_token_accuracy": 0.9913128837943077,
"num_tokens": 882198.0,
"step": 170
},
{
"entropy": 0.02531064748764038,
"epoch": 1.3657142857142857,
"grad_norm": 0.0361328125,
"learning_rate": 0.000136328125,
"loss": 0.02183598130941391,
"mean_token_accuracy": 0.9910814210772514,
"num_tokens": 934671.0,
"step": 180
},
{
"entropy": 0.024810794834047557,
"epoch": 1.441904761904762,
"grad_norm": 0.0294189453125,
"learning_rate": 0.000132421875,
"loss": 0.021508647501468657,
"mean_token_accuracy": 0.9913933798670769,
"num_tokens": 986129.0,
"step": 190
},
{
"entropy": 0.02357544139958918,
"epoch": 1.518095238095238,
"grad_norm": 0.0263671875,
"learning_rate": 0.000128515625,
"loss": 0.020876428484916686,
"mean_token_accuracy": 0.9913628473877907,
"num_tokens": 1039116.0,
"step": 200
},
{
"entropy": 0.023903176514431836,
"epoch": 1.5942857142857143,
"grad_norm": 0.02880859375,
"learning_rate": 0.00012460937500000002,
"loss": 0.02106754332780838,
"mean_token_accuracy": 0.9910304084420204,
"num_tokens": 1091462.0,
"step": 210
},
{
"entropy": 0.0234323940705508,
"epoch": 1.6704761904761904,
"grad_norm": 0.03173828125,
"learning_rate": 0.000120703125,
"loss": 0.020690058171749116,
"mean_token_accuracy": 0.9912343874573708,
"num_tokens": 1143513.0,
"step": 220
},
{
"entropy": 0.023244570288807154,
"epoch": 1.7466666666666666,
"grad_norm": 0.03564453125,
"learning_rate": 0.00011679687500000001,
"loss": 0.020958010852336884,
"mean_token_accuracy": 0.9910316273570061,
"num_tokens": 1195705.0,
"step": 230
},
{
"entropy": 0.024211456114426256,
"epoch": 1.822857142857143,
"grad_norm": 0.020751953125,
"learning_rate": 0.00011289062500000001,
"loss": 0.020894132554531097,
"mean_token_accuracy": 0.9914289116859436,
"num_tokens": 1247868.0,
"step": 240
},
{
"entropy": 0.023242059536278246,
"epoch": 1.899047619047619,
"grad_norm": 0.09619140625,
"learning_rate": 0.000108984375,
"loss": 0.021041123569011687,
"mean_token_accuracy": 0.9906927838921546,
"num_tokens": 1300030.0,
"step": 250
},
{
"entropy": 0.023394071217626333,
"epoch": 1.9752380952380952,
"grad_norm": 0.022705078125,
"learning_rate": 0.000105078125,
"loss": 0.021337199211120605,
"mean_token_accuracy": 0.9910883501172065,
"num_tokens": 1351744.0,
"step": 260
},
{
"entropy": 0.023486525877504737,
"epoch": 2.045714285714286,
"grad_norm": 0.0303955078125,
"learning_rate": 0.00010117187500000001,
"loss": 0.020846356451511384,
"mean_token_accuracy": 0.9910464737866376,
"num_tokens": 1399205.0,
"step": 270
},
{
"entropy": 0.022303093690425158,
"epoch": 2.1219047619047617,
"grad_norm": 0.0234375,
"learning_rate": 9.726562500000001e-05,
"loss": 0.020218101143836976,
"mean_token_accuracy": 0.9912245735526085,
"num_tokens": 1451326.0,
"step": 280
},
{
"entropy": 0.022589343739673494,
"epoch": 2.198095238095238,
"grad_norm": 0.022705078125,
"learning_rate": 9.3359375e-05,
"loss": 0.020336566865444182,
"mean_token_accuracy": 0.9916371747851371,
"num_tokens": 1503498.0,
"step": 290
},
{
"entropy": 0.022218059003353118,
"epoch": 2.2742857142857145,
"grad_norm": 0.019287109375,
"learning_rate": 8.9453125e-05,
"loss": 0.020144131779670716,
"mean_token_accuracy": 0.991128446161747,
"num_tokens": 1555619.0,
"step": 300
},
{
"entropy": 0.022531974827870727,
"epoch": 2.3504761904761904,
"grad_norm": 0.0267333984375,
"learning_rate": 8.5546875e-05,
"loss": 0.020586799085140228,
"mean_token_accuracy": 0.9912104174494744,
"num_tokens": 1607621.0,
"step": 310
},
{
"entropy": 0.022078307764604687,
"epoch": 2.4266666666666667,
"grad_norm": 0.02099609375,
"learning_rate": 8.164062500000001e-05,
"loss": 0.020096388459205628,
"mean_token_accuracy": 0.9914543464779854,
"num_tokens": 1659928.0,
"step": 320
},
{
"entropy": 0.022692699311301114,
"epoch": 2.5028571428571427,
"grad_norm": 0.0185546875,
"learning_rate": 7.7734375e-05,
"loss": 0.020065692067146302,
"mean_token_accuracy": 0.9914301604032516,
"num_tokens": 1712029.0,
"step": 330
},
{
"entropy": 0.021960999770089983,
"epoch": 2.579047619047619,
"grad_norm": 0.02490234375,
"learning_rate": 7.3828125e-05,
"loss": 0.01993292272090912,
"mean_token_accuracy": 0.9912716716527938,
"num_tokens": 1764966.0,
"step": 340
},
{
"entropy": 0.021830143872648478,
"epoch": 2.6552380952380954,
"grad_norm": 0.023681640625,
"learning_rate": 6.9921875e-05,
"loss": 0.019897110760211945,
"mean_token_accuracy": 0.9914486855268478,
"num_tokens": 1817278.0,
"step": 350
},
{
"entropy": 0.022162985149770977,
"epoch": 2.7314285714285713,
"grad_norm": 0.0203857421875,
"learning_rate": 6.601562500000001e-05,
"loss": 0.020072299242019653,
"mean_token_accuracy": 0.9910245254635811,
"num_tokens": 1869353.0,
"step": 360
},
{
"entropy": 0.02198883257806301,
"epoch": 2.8076190476190477,
"grad_norm": 0.0257568359375,
"learning_rate": 6.2109375e-05,
"loss": 0.020215952396392824,
"mean_token_accuracy": 0.991267018020153,
"num_tokens": 1921266.0,
"step": 370
},
{
"entropy": 0.02126058964058757,
"epoch": 2.883809523809524,
"grad_norm": 0.01806640625,
"learning_rate": 5.8203125e-05,
"loss": 0.019716666638851167,
"mean_token_accuracy": 0.9915330603718757,
"num_tokens": 1974173.0,
"step": 380
},
{
"entropy": 0.022073809802532197,
"epoch": 2.96,
"grad_norm": 0.0194091796875,
"learning_rate": 5.4296875000000004e-05,
"loss": 0.02013145834207535,
"mean_token_accuracy": 0.9911942318081856,
"num_tokens": 2026508.0,
"step": 390
},
{
"entropy": 0.022336994121606286,
"epoch": 3.0304761904761905,
"grad_norm": 0.02392578125,
"learning_rate": 5.0390625e-05,
"loss": 0.020002672076225282,
"mean_token_accuracy": 0.990862129507838,
"num_tokens": 2074114.0,
"step": 400
},
{
"entropy": 0.02170365508645773,
"epoch": 3.1066666666666665,
"grad_norm": 0.0238037109375,
"learning_rate": 4.6484375e-05,
"loss": 0.019622784852981568,
"mean_token_accuracy": 0.9913498371839523,
"num_tokens": 2126252.0,
"step": 410
},
{
"entropy": 0.021816531661897898,
"epoch": 3.182857142857143,
"grad_norm": 0.01904296875,
"learning_rate": 4.2578125e-05,
"loss": 0.019900180399417877,
"mean_token_accuracy": 0.9917269065976143,
"num_tokens": 2178311.0,
"step": 420
},
{
"entropy": 0.021046800073236227,
"epoch": 3.259047619047619,
"grad_norm": 0.0186767578125,
"learning_rate": 3.8671875e-05,
"loss": 0.01920921206474304,
"mean_token_accuracy": 0.9916461497545243,
"num_tokens": 2231862.0,
"step": 430
},
{
"entropy": 0.021922438265755774,
"epoch": 3.335238095238095,
"grad_norm": 0.0279541015625,
"learning_rate": 3.4765625e-05,
"loss": 0.019981184601783754,
"mean_token_accuracy": 0.991122642159462,
"num_tokens": 2283339.0,
"step": 440
},
{
"entropy": 0.021684585325419902,
"epoch": 3.4114285714285715,
"grad_norm": 0.023193359375,
"learning_rate": 3.0859375e-05,
"loss": 0.019783757627010345,
"mean_token_accuracy": 0.9912073120474816,
"num_tokens": 2335373.0,
"step": 450
},
{
"entropy": 0.022066454263404013,
"epoch": 3.487619047619048,
"grad_norm": 0.0201416015625,
"learning_rate": 2.6953125000000003e-05,
"loss": 0.019901323318481445,
"mean_token_accuracy": 0.9912807777523994,
"num_tokens": 2386943.0,
"step": 460
},
{
"entropy": 0.021382719092071057,
"epoch": 3.5638095238095238,
"grad_norm": 0.0189208984375,
"learning_rate": 2.3046875e-05,
"loss": 0.019521698355674744,
"mean_token_accuracy": 0.9913338109850883,
"num_tokens": 2439487.0,
"step": 470
},
{
"entropy": 0.021717160381376742,
"epoch": 3.64,
"grad_norm": 0.018798828125,
"learning_rate": 1.9140625e-05,
"loss": 0.019752655923366547,
"mean_token_accuracy": 0.9913526356220246,
"num_tokens": 2491108.0,
"step": 480
},
{
"entropy": 0.021849045297130942,
"epoch": 3.716190476190476,
"grad_norm": 0.019287109375,
"learning_rate": 1.5234375000000001e-05,
"loss": 0.019617608189582823,
"mean_token_accuracy": 0.9915902808308601,
"num_tokens": 2542777.0,
"step": 490
},
{
"entropy": 0.021322652604430913,
"epoch": 3.7923809523809524,
"grad_norm": 0.022216796875,
"learning_rate": 1.1328125000000001e-05,
"loss": 0.01927768290042877,
"mean_token_accuracy": 0.9913811206817627,
"num_tokens": 2595903.0,
"step": 500
},
{
"entropy": 0.02207843461073935,
"epoch": 3.8685714285714283,
"grad_norm": 0.0223388671875,
"learning_rate": 7.421875e-06,
"loss": 0.020016531646251678,
"mean_token_accuracy": 0.9907937526702881,
"num_tokens": 2647278.0,
"step": 510
},
{
"entropy": 0.021845509810373188,
"epoch": 3.9447619047619047,
"grad_norm": 0.0238037109375,
"learning_rate": 3.5156250000000003e-06,
"loss": 0.01967438906431198,
"mean_token_accuracy": 0.991420166194439,
"num_tokens": 2699258.0,
"step": 520
}
],
"logging_steps": 10,
"max_steps": 528,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.29591337684992e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}

Xet Storage Details

Size:
16.1 kB
·
Xet hash:
d826bb2b864a833dbddeedec50ccbc2519a7940de402dd2f795fe057254d282c

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.