Design

Which solid notes this experiment tests, and how.

Results

20260802-114517-pretrained_llm_gsm8k_grouped_reward_sweep_jean_zay-48f4f83

commit: 48f4f83

metricvalue
both_success_rate0.3333333333333333
decomposed_mean_accuracy_improvement0.008680556124697128
decomposed_mean_best_accuracy0.03645833395421505
decomposed_mean_final_accuracy0.026041667442768812
decomposed_mean_final_greedy_accuracy0.027777778605620067
decomposed_mean_final_greedy_parseable_rate0.9947916865348816
decomposed_mean_final_parseable_rate0.9774305621782938
decomposed_mean_finite_epoch_fraction1
decomposed_mean_greedy_accuracy_improvement0
decomposed_mean_greedy_parseable_rate_improvement-0.0017361044883728027
decomposed_mean_parseable_rate_improvement0.005208313465118408
decomposed_mean_shaped_epoch_fraction0.375
decomposed_mean_train_accuracy0.016276041666666668
decomposed_mean_train_parseable_rate0.9700520833333334
decomposed_median_final_accuracy0.02083333395421505
decomposed_success_rate0.3333333333333333
decomposed_win_rate0
eggroll_mean_accuracy_improvement0.012152778295179209
eggroll_mean_best_accuracy0.038194445272286735
eggroll_mean_final_accuracy0.029513889613250893
eggroll_mean_final_greedy_accuracy0.027777778605620067
eggroll_mean_final_greedy_parseable_rate0.9965277910232544
eggroll_mean_final_parseable_rate0.9809027910232544
eggroll_mean_finite_epoch_fraction1
eggroll_mean_greedy_accuracy_improvement0
eggroll_mean_greedy_parseable_rate_improvement0
eggroll_mean_parseable_rate_improvement0.00868054231007894
eggroll_mean_shaped_epoch_fraction0.4583333333333333
eggroll_mean_train_accuracy0.013997395833333334
eggroll_mean_train_parseable_rate0.9710286458333334
eggroll_median_final_accuracy0.026041666977107525
eggroll_success_rate0.3333333333333333
epochs8
eval_samples96
generations_per_prompt8
mean_accuracy_gap_decomposed_minus_eggroll-0.003472222170482079
mean_greedy_accuracy_gap_decomposed_minus_eggroll0
mean_greedy_improvement_gap_decomposed_minus_eggroll0
mean_improvement_gap_decomposed_minus_eggroll-0.003472222170482079
mean_parseable_gap_decomposed_minus_eggroll-0.0034722288449605307
num_pairs6
num_ranks2
num_seeds3
num_target_modules7
population64
prompts_per_epoch8
rank_1_decomposed_success_rate0.3333333333333333
rank_1_decomposed_win_rate0
rank_1_eggroll_success_rate0.3333333333333333
rank_1_mean_accuracy_gap_decomposed_minus_eggroll-0.0034722223257025084
rank_1_mean_greedy_accuracy_gap_decomposed_minus_eggroll0
rank_2_decomposed_success_rate0.3333333333333333
rank_2_decomposed_win_rate0
rank_2_eggroll_success_rate0.3333333333333333
rank_2_mean_accuracy_gap_decomposed_minus_eggroll-0.00347222201526165
rank_2_mean_greedy_accuracy_gap_decomposed_minus_eggroll0

Interpretation

Run 20260802-114517-pretrained_llm_gsm8k_grouped_reward_sweep_jean_zay-48f4f83 completed cleanly and confirms the grouped GSM8K reward path is stable. It does not support a decomposed advantage: plain EGGROLL was slightly ahead on sampled exact-answer accuracy, greedy accuracy was tied, and both methods remained in the same very-low-reward regime. The grouped sampling/reuse change helped the measurement plumbing more than the learning signal.