Files
2026-07-19 23:52:25 +04:00

302 lines
7.7 KiB
JSON

{
"best_global_step": 1500,
"best_metric": 0.4548405110836029,
"best_model_checkpoint": "./qwen3-4b-2507-ru-lora/checkpoint-1500",
"epoch": 3.4248394004282656,
"eval_steps": 500,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.11420413990007137,
"grad_norm": 0.1101919561624527,
"learning_rate": 9.900000000000001e-05,
"loss": 1.1473062133789063,
"step": 100
},
{
"epoch": 0.22840827980014275,
"grad_norm": 0.09405623376369476,
"learning_rate": 9.832203389830509e-05,
"loss": 0.797086181640625,
"step": 200
},
{
"epoch": 0.3426124197002141,
"grad_norm": 0.1505233645439148,
"learning_rate": 9.66271186440678e-05,
"loss": 0.8210951232910156,
"step": 300
},
{
"epoch": 0.4568165596002855,
"grad_norm": 0.09275370091199875,
"learning_rate": 9.493220338983051e-05,
"loss": 0.7762732696533203,
"step": 400
},
{
"epoch": 0.5710206995003569,
"grad_norm": 0.15582314133644104,
"learning_rate": 9.323728813559323e-05,
"loss": 0.79928955078125,
"step": 500
},
{
"epoch": 0.5710206995003569,
"eval_loss": 0.4887394309043884,
"eval_runtime": 85.2625,
"eval_samples_per_second": 4.328,
"eval_steps_per_second": 4.328,
"step": 500
},
{
"epoch": 0.6852248394004282,
"grad_norm": 0.06571248918771744,
"learning_rate": 9.154237288135593e-05,
"loss": 0.7494968414306641,
"step": 600
},
{
"epoch": 0.7994289793004996,
"grad_norm": 0.22434799373149872,
"learning_rate": 8.984745762711865e-05,
"loss": 0.7933966827392578,
"step": 700
},
{
"epoch": 0.913633119200571,
"grad_norm": 0.14180706441402435,
"learning_rate": 8.815254237288137e-05,
"loss": 0.7898688507080078,
"step": 800
},
{
"epoch": 1.0274089935760171,
"grad_norm": 0.09555750340223312,
"learning_rate": 8.645762711864407e-05,
"loss": 0.753864517211914,
"step": 900
},
{
"epoch": 1.1416131334760884,
"grad_norm": 0.13440796732902527,
"learning_rate": 8.476271186440679e-05,
"loss": 0.6366143798828126,
"step": 1000
},
{
"epoch": 1.1416131334760884,
"eval_loss": 0.4765624701976776,
"eval_runtime": 85.3281,
"eval_samples_per_second": 4.324,
"eval_steps_per_second": 4.324,
"step": 1000
},
{
"epoch": 1.25581727337616,
"grad_norm": 0.09627823531627655,
"learning_rate": 8.30677966101695e-05,
"loss": 0.6536759948730468,
"step": 1100
},
{
"epoch": 1.3700214132762314,
"grad_norm": 0.216465562582016,
"learning_rate": 8.137288135593221e-05,
"loss": 0.6386687850952149,
"step": 1200
},
{
"epoch": 1.4842255531763027,
"grad_norm": 0.16032801568508148,
"learning_rate": 7.967796610169492e-05,
"loss": 0.6274388885498047,
"step": 1300
},
{
"epoch": 1.598429693076374,
"grad_norm": 0.3502936065196991,
"learning_rate": 7.798305084745763e-05,
"loss": 0.6400037384033204,
"step": 1400
},
{
"epoch": 1.7126338329764454,
"grad_norm": 0.21663837134838104,
"learning_rate": 7.628813559322034e-05,
"loss": 0.6600186920166016,
"step": 1500
},
{
"epoch": 1.7126338329764454,
"eval_loss": 0.4548405110836029,
"eval_runtime": 85.2775,
"eval_samples_per_second": 4.327,
"eval_steps_per_second": 4.327,
"step": 1500
},
{
"epoch": 1.8268379728765167,
"grad_norm": 0.1811513453722,
"learning_rate": 7.459322033898304e-05,
"loss": 0.6541920471191406,
"step": 1600
},
{
"epoch": 1.941042112776588,
"grad_norm": 0.13848915696144104,
"learning_rate": 7.289830508474576e-05,
"loss": 0.6397422790527344,
"step": 1700
},
{
"epoch": 2.0548179871520342,
"grad_norm": 0.10245347768068314,
"learning_rate": 7.120338983050848e-05,
"loss": 0.5696288299560547,
"step": 1800
},
{
"epoch": 2.1690221270521057,
"grad_norm": 0.11742890626192093,
"learning_rate": 6.950847457627118e-05,
"loss": 0.44962631225585936,
"step": 1900
},
{
"epoch": 2.283226266952177,
"grad_norm": 0.20419853925704956,
"learning_rate": 6.78135593220339e-05,
"loss": 0.4812296676635742,
"step": 2000
},
{
"epoch": 2.283226266952177,
"eval_loss": 0.47145259380340576,
"eval_runtime": 85.3343,
"eval_samples_per_second": 4.324,
"eval_steps_per_second": 4.324,
"step": 2000
},
{
"epoch": 2.3974304068522483,
"grad_norm": 0.21591816842556,
"learning_rate": 6.61186440677966e-05,
"loss": 0.47923736572265624,
"step": 2100
},
{
"epoch": 2.51163454675232,
"grad_norm": 0.29100939631462097,
"learning_rate": 6.442372881355932e-05,
"loss": 0.4617042541503906,
"step": 2200
},
{
"epoch": 2.6258386866523913,
"grad_norm": 0.15308618545532227,
"learning_rate": 6.272881355932204e-05,
"loss": 0.501895751953125,
"step": 2300
},
{
"epoch": 2.740042826552463,
"grad_norm": 0.1499933898448944,
"learning_rate": 6.103389830508475e-05,
"loss": 0.4711552047729492,
"step": 2400
},
{
"epoch": 2.854246966452534,
"grad_norm": 0.24623849987983704,
"learning_rate": 5.9338983050847465e-05,
"loss": 0.47890899658203123,
"step": 2500
},
{
"epoch": 2.854246966452534,
"eval_loss": 0.47348523139953613,
"eval_runtime": 85.3423,
"eval_samples_per_second": 4.324,
"eval_steps_per_second": 4.324,
"step": 2500
},
{
"epoch": 2.9684511063526053,
"grad_norm": 0.14382973313331604,
"learning_rate": 5.764406779661017e-05,
"loss": 0.4821274185180664,
"step": 2600
},
{
"epoch": 3.0822269807280516,
"grad_norm": 0.17034879326820374,
"learning_rate": 5.594915254237289e-05,
"loss": 0.3882878112792969,
"step": 2700
},
{
"epoch": 3.1964311206281226,
"grad_norm": 0.22748088836669922,
"learning_rate": 5.42542372881356e-05,
"loss": 0.3157962989807129,
"step": 2800
},
{
"epoch": 3.310635260528194,
"grad_norm": 0.1980806142091751,
"learning_rate": 5.25593220338983e-05,
"loss": 0.3221218490600586,
"step": 2900
},
{
"epoch": 3.4248394004282656,
"grad_norm": 0.22527898848056793,
"learning_rate": 5.086440677966102e-05,
"loss": 0.32430213928222656,
"step": 3000
},
{
"epoch": 3.4248394004282656,
"eval_loss": 0.5339688062667847,
"eval_runtime": 85.3358,
"eval_samples_per_second": 4.324,
"eval_steps_per_second": 4.324,
"step": 3000
}
],
"logging_steps": 100,
"max_steps": 6000,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 3
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.5721880180944896e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}