130 lines
3.3 KiB
JSON
130 lines
3.3 KiB
JSON
{
|
|
"best_global_step": 1000,
|
|
"best_metric": 0.4765624701976776,
|
|
"best_model_checkpoint": "./qwen3-4b-2507-ru-lora/checkpoint-1000",
|
|
"epoch": 1.1416131334760884,
|
|
"eval_steps": 500,
|
|
"global_step": 1000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.11420413990007137,
|
|
"grad_norm": 0.1101919561624527,
|
|
"learning_rate": 9.900000000000001e-05,
|
|
"loss": 1.1473062133789063,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.22840827980014275,
|
|
"grad_norm": 0.09405623376369476,
|
|
"learning_rate": 9.832203389830509e-05,
|
|
"loss": 0.797086181640625,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 0.3426124197002141,
|
|
"grad_norm": 0.1505233645439148,
|
|
"learning_rate": 9.66271186440678e-05,
|
|
"loss": 0.8210951232910156,
|
|
"step": 300
|
|
},
|
|
{
|
|
"epoch": 0.4568165596002855,
|
|
"grad_norm": 0.09275370091199875,
|
|
"learning_rate": 9.493220338983051e-05,
|
|
"loss": 0.7762732696533203,
|
|
"step": 400
|
|
},
|
|
{
|
|
"epoch": 0.5710206995003569,
|
|
"grad_norm": 0.15582314133644104,
|
|
"learning_rate": 9.323728813559323e-05,
|
|
"loss": 0.79928955078125,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.5710206995003569,
|
|
"eval_loss": 0.4887394309043884,
|
|
"eval_runtime": 85.2625,
|
|
"eval_samples_per_second": 4.328,
|
|
"eval_steps_per_second": 4.328,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.6852248394004282,
|
|
"grad_norm": 0.06571248918771744,
|
|
"learning_rate": 9.154237288135593e-05,
|
|
"loss": 0.7494968414306641,
|
|
"step": 600
|
|
},
|
|
{
|
|
"epoch": 0.7994289793004996,
|
|
"grad_norm": 0.22434799373149872,
|
|
"learning_rate": 8.984745762711865e-05,
|
|
"loss": 0.7933966827392578,
|
|
"step": 700
|
|
},
|
|
{
|
|
"epoch": 0.913633119200571,
|
|
"grad_norm": 0.14180706441402435,
|
|
"learning_rate": 8.815254237288137e-05,
|
|
"loss": 0.7898688507080078,
|
|
"step": 800
|
|
},
|
|
{
|
|
"epoch": 1.0274089935760171,
|
|
"grad_norm": 0.09555750340223312,
|
|
"learning_rate": 8.645762711864407e-05,
|
|
"loss": 0.753864517211914,
|
|
"step": 900
|
|
},
|
|
{
|
|
"epoch": 1.1416131334760884,
|
|
"grad_norm": 0.13440796732902527,
|
|
"learning_rate": 8.476271186440679e-05,
|
|
"loss": 0.6366143798828126,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 1.1416131334760884,
|
|
"eval_loss": 0.4765624701976776,
|
|
"eval_runtime": 85.3281,
|
|
"eval_samples_per_second": 4.324,
|
|
"eval_steps_per_second": 4.324,
|
|
"step": 1000
|
|
}
|
|
],
|
|
"logging_steps": 100,
|
|
"max_steps": 6000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 7,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"EarlyStoppingCallback": {
|
|
"args": {
|
|
"early_stopping_patience": 3,
|
|
"early_stopping_threshold": 0.0
|
|
},
|
|
"attributes": {
|
|
"early_stopping_patience_counter": 0
|
|
}
|
|
},
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 5.202629618098176e+16,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|