Design

Which solid notes this experiment tests, and how.

Results

20260902-082442-qwen3_4b_gsm8k_robustness_plain_bf16_seed1_jean_zay-9765cbb

commit: 9765cbb

metricvalue
center_eval_do_sample0
center_eval_every5
center_eval_temperature1
center_eval_top_k0
completed0
decomposed_lr_direction0.25
decomposed_lr_magnitude0.5
decomposed_sigma_direction0.001
decomposed_sigma_magnitude0.001
decomposed_tangent_project_direction0
eggroll_lr1
eggroll_sigma0.001
epochs15
eval_batch_size8
eval_prompts128
generations_per_prompt6
max_new_tokens1024
method_decomposed_enabled0
method_plain_enabled1
noise_reuse4
num_center_eval_records0
num_completed_runs0
num_epoch_records0
num_methods1
num_ranks1
num_seeds1
num_target_module_patterns8
parseability_shaping0
population126
prompts_per_epoch21
temperature1
top_k0
torch_dtype_bfloat161
torch_dtype_float160
torch_dtype_float320
train_batch_size6
wall_clock_seconds36.2086274609901

20260902-082442-qwen3_4b_gsm8k_robustness_plain_bf16_seed1_jean_zay-9765cbb

commit: 9765cbb

metricvalue
center_eval_do_sample0
center_eval_every5
center_eval_temperature1
center_eval_top_k0
completed1
condition_0_best_center_eval_accuracy0.609375
condition_0_center_eval_accuracy_change0.40625
condition_0_center_train_accuracy_change0.571428582072258
condition_0_condition_index0
condition_0_final_center_eval_accuracy0.59375
condition_0_final_center_eval_parseable_rate1
condition_0_final_center_train_accuracy0.7142857313156128
condition_0_final_center_train_parseable_rate1
condition_0_initial_center_eval_accuracy0.1875
condition_0_initial_center_eval_parseable_rate1
condition_0_initial_center_train_accuracy0.1428571492433548
condition_0_initial_center_train_parseable_rate1
condition_0_lr1
condition_0_mean_fitness_std0.8704237858454387
condition_0_mean_perturbed_train_accuracy0.6433862785498301
condition_0_mean_perturbed_train_parseable_rate1
condition_0_mean_raw_score_std0.4666858077049255
condition_0_method_id0
condition_0_nonzero_reward_epoch_fraction1
condition_0_num_layers253
condition_0_rank1
condition_0_seed1
condition_0_shaped_epoch_fraction0
decomposed_lr_direction0.25
decomposed_lr_magnitude0.5
decomposed_sigma_direction0.001
decomposed_sigma_magnitude0.001
decomposed_tangent_project_direction0
eggroll_lr1
eggroll_sigma0.001
epochs15
eval_batch_size8
eval_prompts128
generations_per_prompt6
max_new_tokens1024
method_decomposed_enabled0
method_plain_enabled1
noise_reuse4
num_center_eval_records4
num_completed_runs1
num_epoch_records15
num_methods1
num_ranks1
num_seeds1
num_target_module_patterns8
parseability_shaping0
population126
prompts_per_epoch21
temperature1
top_k0
torch_dtype_bfloat161
torch_dtype_float160
torch_dtype_float320
train_batch_size6
wall_clock_seconds14487.26922753104

Interpretation

Completed after the later fetch. This plain baseline improves over its initial center evaluation but loses ground after the early peak, so it confirms the exact-answer reward signal is usable while also showing instability by the end of the short run.