Files
2026-07-19 23:52:25 +04:00

216 lines
5.5 KiB
JSON

{
"best_global_step": 1500,
"best_metric": 0.4548405110836029,
"best_model_checkpoint": "./qwen3-4b-2507-ru-lora/checkpoint-1500",
"epoch": 2.283226266952177,
"eval_steps": 500,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.11420413990007137,
"grad_norm": 0.1101919561624527,
"learning_rate": 9.900000000000001e-05,
"loss": 1.1473062133789063,
"step": 100
},
{
"epoch": 0.22840827980014275,
"grad_norm": 0.09405623376369476,
"learning_rate": 9.832203389830509e-05,
"loss": 0.797086181640625,
"step": 200
},
{
"epoch": 0.3426124197002141,
"grad_norm": 0.1505233645439148,
"learning_rate": 9.66271186440678e-05,
"loss": 0.8210951232910156,
"step": 300
},
{
"epoch": 0.4568165596002855,
"grad_norm": 0.09275370091199875,
"learning_rate": 9.493220338983051e-05,
"loss": 0.7762732696533203,
"step": 400
},
{
"epoch": 0.5710206995003569,
"grad_norm": 0.15582314133644104,
"learning_rate": 9.323728813559323e-05,
"loss": 0.79928955078125,
"step": 500
},
{
"epoch": 0.5710206995003569,
"eval_loss": 0.4887394309043884,
"eval_runtime": 85.2625,
"eval_samples_per_second": 4.328,
"eval_steps_per_second": 4.328,
"step": 500
},
{
"epoch": 0.6852248394004282,
"grad_norm": 0.06571248918771744,
"learning_rate": 9.154237288135593e-05,
"loss": 0.7494968414306641,
"step": 600
},
{
"epoch": 0.7994289793004996,
"grad_norm": 0.22434799373149872,
"learning_rate": 8.984745762711865e-05,
"loss": 0.7933966827392578,
"step": 700
},
{
"epoch": 0.913633119200571,
"grad_norm": 0.14180706441402435,
"learning_rate": 8.815254237288137e-05,
"loss": 0.7898688507080078,
"step": 800
},
{
"epoch": 1.0274089935760171,
"grad_norm": 0.09555750340223312,
"learning_rate": 8.645762711864407e-05,
"loss": 0.753864517211914,
"step": 900
},
{
"epoch": 1.1416131334760884,
"grad_norm": 0.13440796732902527,
"learning_rate": 8.476271186440679e-05,
"loss": 0.6366143798828126,
"step": 1000
},
{
"epoch": 1.1416131334760884,
"eval_loss": 0.4765624701976776,
"eval_runtime": 85.3281,
"eval_samples_per_second": 4.324,
"eval_steps_per_second": 4.324,
"step": 1000
},
{
"epoch": 1.25581727337616,
"grad_norm": 0.09627823531627655,
"learning_rate": 8.30677966101695e-05,
"loss": 0.6536759948730468,
"step": 1100
},
{
"epoch": 1.3700214132762314,
"grad_norm": 0.216465562582016,
"learning_rate": 8.137288135593221e-05,
"loss": 0.6386687850952149,
"step": 1200
},
{
"epoch": 1.4842255531763027,
"grad_norm": 0.16032801568508148,
"learning_rate": 7.967796610169492e-05,
"loss": 0.6274388885498047,
"step": 1300
},
{
"epoch": 1.598429693076374,
"grad_norm": 0.3502936065196991,
"learning_rate": 7.798305084745763e-05,
"loss": 0.6400037384033204,
"step": 1400
},
{
"epoch": 1.7126338329764454,
"grad_norm": 0.21663837134838104,
"learning_rate": 7.628813559322034e-05,
"loss": 0.6600186920166016,
"step": 1500
},
{
"epoch": 1.7126338329764454,
"eval_loss": 0.4548405110836029,
"eval_runtime": 85.2775,
"eval_samples_per_second": 4.327,
"eval_steps_per_second": 4.327,
"step": 1500
},
{
"epoch": 1.8268379728765167,
"grad_norm": 0.1811513453722,
"learning_rate": 7.459322033898304e-05,
"loss": 0.6541920471191406,
"step": 1600
},
{
"epoch": 1.941042112776588,
"grad_norm": 0.13848915696144104,
"learning_rate": 7.289830508474576e-05,
"loss": 0.6397422790527344,
"step": 1700
},
{
"epoch": 2.0548179871520342,
"grad_norm": 0.10245347768068314,
"learning_rate": 7.120338983050848e-05,
"loss": 0.5696288299560547,
"step": 1800
},
{
"epoch": 2.1690221270521057,
"grad_norm": 0.11742890626192093,
"learning_rate": 6.950847457627118e-05,
"loss": 0.44962631225585936,
"step": 1900
},
{
"epoch": 2.283226266952177,
"grad_norm": 0.20419853925704956,
"learning_rate": 6.78135593220339e-05,
"loss": 0.4812296676635742,
"step": 2000
},
{
"epoch": 2.283226266952177,
"eval_loss": 0.47145259380340576,
"eval_runtime": 85.3343,
"eval_samples_per_second": 4.324,
"eval_steps_per_second": 4.324,
"step": 2000
}
],
"logging_steps": 100,
"max_steps": 6000,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 1
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.0466065170051072e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}