Design

Which solid notes this experiment tests, and how.

Results

20260819-133615-qwen3_4b_gsm8k_plain_eggroll_repro_jean_zay-5329581

commit: 5329581

metricvalue
completed0
eggroll_lr1
eggroll_sigma0.001
epochs100
eval_batch_size5
eval_generations_per_prompt5
eval_prompts268
eval_samples1340
eval_temperature1
eval_top_k0
generations_per_prompt6
latest_epoch_epoch35
latest_epoch_fitness_std0.720064640045166
latest_epoch_rank1
latest_epoch_raw_score_mean0.2857142984867096
latest_epoch_raw_score_std0.45175397396087646
latest_epoch_seed0
latest_epoch_train_accuracy0.2857142984867096
latest_epoch_train_parseable_rate0.9920635223388672
latest_epoch_used_parseability_shaping0
latest_validation_accuracy0.20820896327495575
latest_validation_epoch30
latest_validation_num_correct279
latest_validation_num_parseable1339
latest_validation_parseable_rate0.9992537498474121
latest_validation_rank1
latest_validation_seed0
max_new_tokens1024
noise_reuse4
num_completed_runs0
num_epoch_records35
num_ranks1
num_seeds1
num_target_module_patterns8
num_validation_records4
parseability_shaping0
population126
prompts_per_epoch21
temperature1
top_k0
train_batch_size6
validate_every10
validation_epoch_0_accuracy0.32611939311027527
validation_epoch_0_parseable_rate1
validation_epoch_10_accuracy0.7149254083633423
validation_epoch_10_parseable_rate1
validation_epoch_20_accuracy0.49850746989250183
validation_epoch_20_parseable_rate1
validation_epoch_30_accuracy0.20820896327495575
validation_epoch_30_parseable_rate0.9992537498474121
wall_clock_seconds71261.713226076

20260820-183000-qwen3_4b_gsm8k_plain_eggroll_repro_jean_zay-00ed9dd

commit: 00ed9dd

metricvalue
center_eval_do_sample0
center_eval_epoch_0_eval_accuracy0.11567164212465286
center_eval_epoch_0_eval_parseable_rate1
center_eval_epoch_0_train_accuracy0.0476190485060215
center_eval_epoch_0_train_parseable_rate1
center_eval_epoch_10_eval_accuracy0.7388059496879578
center_eval_epoch_10_eval_parseable_rate1
center_eval_epoch_10_train_accuracy0.8571428656578064
center_eval_epoch_10_train_parseable_rate1
center_eval_epoch_20_eval_accuracy0.5074626803398132
center_eval_epoch_20_eval_parseable_rate1
center_eval_epoch_20_train_accuracy0.7142857313156128
center_eval_epoch_20_train_parseable_rate1
center_eval_prompts268
center_eval_temperature1
center_eval_top_k0
center_train_prompts21
completed0
eggroll_lr1
eggroll_sigma0.001
epochs100
eval_batch_size5
eval_generations_per_prompt5
eval_prompts268
eval_samples1340
eval_temperature1
eval_top_k0
generations_per_prompt6
latest_center_eval_epoch20
latest_center_eval_eval_accuracy0.5074626803398132
latest_center_eval_eval_num_correct136
latest_center_eval_eval_num_parseable268
latest_center_eval_eval_parseable_rate1
latest_center_eval_rank1
latest_center_eval_seed0
latest_center_eval_train_accuracy0.7142857313156128
latest_center_eval_train_num_correct15
latest_center_eval_train_num_parseable21
latest_center_eval_train_parseable_rate1
latest_epoch_epoch29
latest_epoch_fitness_std0.7261000871658325
latest_epoch_rank1
latest_epoch_raw_score_mean0.3809524178504944
latest_epoch_raw_score_std0.48562091588974
latest_epoch_seed0
latest_epoch_train_accuracy0.3809524178504944
latest_epoch_train_parseable_rate1
latest_epoch_used_parseability_shaping0
latest_validation_accuracy0.49850746989250183
latest_validation_epoch20
latest_validation_num_correct668
latest_validation_num_parseable1340
latest_validation_parseable_rate1
latest_validation_rank1
latest_validation_seed0
max_new_tokens1024
noise_reuse4
num_center_eval_records3
num_completed_runs0
num_epoch_records29
num_ranks1
num_seeds1
num_target_module_patterns8
num_validation_records3
parseability_shaping0
population126
prompts_per_epoch21
temperature1
top_k0
train_batch_size6
validate_every10
validation_epoch_0_accuracy0.32611939311027527
validation_epoch_0_parseable_rate1
validation_epoch_10_accuracy0.7149254083633423
validation_epoch_10_parseable_rate1
validation_epoch_20_accuracy0.49850746989250183
validation_epoch_20_parseable_rate1
wall_clock_seconds60604.74062844599

Interpretation

Both Qwen3 plain EGGROLL reruns timed out before completion, but the instrumentation recovered partial metrics. The validation trajectory is not a clean improvement: it improves early, then degrades by the latest recorded validation while parseability stays essentially saturated.

The center-model diagnostic confirms that the early gain is visible on the updated center model, not only in noisy population rollouts, but it also decays before timeout. Treat these runs as evidence that the streaming update and diagnostics work, and as a warning that this GSM8K exact-answer setup is unstable under the current hyperparameters, not as a successful reward-learning result.