Design
Which solid notes this experiment tests, and how.
Results
20260824-183902-qwen3_4b_gsm8k_fixed_batch_reward_signal_jean_zay-39c4380
commit: 39c4380
| metric | value |
|---|---|
| center_eval_do_sample | 0 |
| center_eval_every | 5 |
| center_eval_temperature | 1 |
| center_eval_top_k | 0 |
| completed | 0 |
| condition_0_best_center_eval_accuracy | 0.125 |
| condition_0_center_eval_accuracy_change | 0 |
| condition_0_center_train_accuracy_change | 0 |
| condition_0_condition_index | 0 |
| condition_0_final_center_eval_accuracy | 0.125 |
| condition_0_final_center_eval_parseable_rate | 1 |
| condition_0_final_center_train_accuracy | 0.0476190485060215 |
| condition_0_final_center_train_parseable_rate | 1 |
| condition_0_initial_center_eval_accuracy | 0.125 |
| condition_0_initial_center_eval_parseable_rate | 1 |
| condition_0_initial_center_train_accuracy | 0.0476190485060215 |
| condition_0_initial_center_train_parseable_rate | 1 |
| condition_0_lr | 0 |
| condition_0_mean_fitness_std | 0.8900124907493592 |
| condition_0_mean_perturbed_train_accuracy | 0.3293650925159454 |
| condition_0_mean_perturbed_train_parseable_rate | 1 |
| condition_0_mean_raw_score_std | 0.46796252876520156 |
| condition_0_nonzero_reward_epoch_fraction | 1 |
| condition_0_num_layers | 253 |
| condition_0_rank | 1 |
| condition_0_seed | 0 |
| condition_0_shaped_epoch_fraction | 0 |
| condition_1_best_center_eval_accuracy | 0.765625 |
| condition_1_center_eval_accuracy_change | 0.3671875 |
| condition_1_center_train_accuracy_change | 0.6666666828095913 |
| condition_1_condition_index | 1 |
| condition_1_final_center_eval_accuracy | 0.4921875 |
| condition_1_final_center_eval_parseable_rate | 1 |
| condition_1_final_center_train_accuracy | 0.7142857313156128 |
| condition_1_final_center_train_parseable_rate | 1 |
| condition_1_initial_center_eval_accuracy | 0.125 |
| condition_1_initial_center_eval_parseable_rate | 1 |
| condition_1_initial_center_train_accuracy | 0.0476190485060215 |
| condition_1_initial_center_train_parseable_rate | 1 |
| condition_1_lr | 1 |
| condition_1_mean_fitness_std | 0.8663099497556687 |
| condition_1_mean_perturbed_train_accuracy | 0.7007936924695969 |
| condition_1_mean_perturbed_train_parseable_rate | 1 |
| condition_1_mean_raw_score_std | 0.4381131261587143 |
| condition_1_nonzero_reward_epoch_fraction | 1 |
| condition_1_num_layers | 253 |
| condition_1_rank | 1 |
| condition_1_seed | 0 |
| condition_1_shaped_epoch_fraction | 0 |
| eggroll_sigma | 0.001 |
| epochs | 20 |
| eval_batch_size | 8 |
| eval_prompts | 128 |
| generations_per_prompt | 6 |
| max_new_tokens | 1024 |
| noise_reuse | 4 |
| num_center_eval_records | 10 |
| num_completed_runs | 2 |
| num_epoch_records | 40 |
| num_lr_conditions | 3 |
| num_target_module_patterns | 8 |
| parseability_shaping | 0 |
| population | 126 |
| positive_minus_zero_final_center_eval_accuracy | 0.3671875 |
| positive_minus_zero_final_center_train_accuracy | 0.6666666828095913 |
| prompts_per_epoch | 21 |
| rank | 1 |
| seed | 0 |
| temperature | 1 |
| top_k | 0 |
| train_batch_size | 6 |
| wall_clock_seconds | 44707.23344994802 |