Design
This follow-up tests whether direction perturbations should be projected onto the DoRA direction tangent space before applying the grouped exact-answer GSM8K reward update. It keeps the grouped reward setup and plain EGGROLL comparison fixed, then enables tangent projection for the decomposed direction update.
Results
20260803-011912-pretrained_llm_gsm8k_grouped_tangent_sweep_jean_zay-afccaa6
commit: afccaa6
| metric | value |
|---|---|
| both_success_rate | 0.3333333333333333 |
| decomposed_lr_direction | 0.02 |
| decomposed_lr_magnitude | 0.02 |
| decomposed_lr_magnitude_0_mean_accuracy_gap_decomposed_minus_eggroll | -0.003472222170482079 |
| decomposed_lr_magnitude_0_mean_final_accuracy | 0.026041667442768812 |
| decomposed_lr_magnitude_0_success_rate | 0.3333333333333333 |
| decomposed_lr_magnitude_0_value | 0.02 |
| decomposed_lr_magnitude_0_win_rate | 0 |
| decomposed_mean_accuracy_improvement | 0.008680556124697128 |
| decomposed_mean_best_accuracy | 0.03645833395421505 |
| decomposed_mean_final_accuracy | 0.026041667442768812 |
| decomposed_mean_final_greedy_accuracy | 0.027777778605620067 |
| decomposed_mean_final_greedy_parseable_rate | 0.9965277910232544 |
| decomposed_mean_final_parseable_rate | 0.9774305621782938 |
| decomposed_mean_finite_epoch_fraction | 1 |
| decomposed_mean_greedy_accuracy_improvement | 0 |
| decomposed_mean_greedy_parseable_rate_improvement | 0 |
| decomposed_mean_parseable_rate_improvement | 0.005208313465118408 |
| decomposed_mean_shaped_epoch_fraction | 0.3958333333333333 |
| decomposed_mean_train_accuracy | 0.015950520833333332 |
| decomposed_mean_train_parseable_rate | 0.970703125 |
| decomposed_median_final_accuracy | 0.02083333395421505 |
| decomposed_success_rate | 0.3333333333333333 |
| decomposed_tangent_project_direction | 1 |
| decomposed_win_rate | 0 |
| eggroll_mean_accuracy_improvement | 0.012152778295179209 |
| eggroll_mean_best_accuracy | 0.038194445272286735 |
| eggroll_mean_final_accuracy | 0.029513889613250893 |
| eggroll_mean_final_greedy_accuracy | 0.027777778605620067 |
| eggroll_mean_final_greedy_parseable_rate | 0.9965277910232544 |
| eggroll_mean_final_parseable_rate | 0.9809027910232544 |
| eggroll_mean_finite_epoch_fraction | 1 |
| eggroll_mean_greedy_accuracy_improvement | 0 |
| eggroll_mean_greedy_parseable_rate_improvement | 0 |
| eggroll_mean_parseable_rate_improvement | 0.00868054231007894 |
| eggroll_mean_shaped_epoch_fraction | 0.4583333333333333 |
| eggroll_mean_train_accuracy | 0.013997395833333334 |
| eggroll_mean_train_parseable_rate | 0.9710286458333334 |
| eggroll_median_final_accuracy | 0.026041666977107525 |
| eggroll_success_rate | 0.3333333333333333 |
| epochs | 8 |
| eval_samples | 96 |
| generations_per_prompt | 8 |
| mean_accuracy_gap_decomposed_minus_eggroll | -0.003472222170482079 |
| mean_greedy_accuracy_gap_decomposed_minus_eggroll | 0 |
| mean_greedy_improvement_gap_decomposed_minus_eggroll | 0 |
| mean_improvement_gap_decomposed_minus_eggroll | -0.003472222170482079 |
| mean_parseable_gap_decomposed_minus_eggroll | -0.0034722288449605307 |
| num_decomposed_lr_magnitudes | 1 |
| num_pairs | 6 |
| num_ranks | 2 |
| num_seeds | 3 |
| num_target_modules | 7 |
| population | 64 |
| prompts_per_epoch | 8 |
| rank_1_decomposed_success_rate | 0.3333333333333333 |
| rank_1_decomposed_win_rate | 0 |
| rank_1_eggroll_success_rate | 0.3333333333333333 |
| rank_1_mean_accuracy_gap_decomposed_minus_eggroll | -0.0034722223257025084 |
| rank_1_mean_greedy_accuracy_gap_decomposed_minus_eggroll | 0 |
| rank_2_decomposed_success_rate | 0.3333333333333333 |
| rank_2_decomposed_win_rate | 0 |
| rank_2_eggroll_success_rate | 0.3333333333333333 |
| rank_2_mean_accuracy_gap_decomposed_minus_eggroll | -0.00347222201526165 |
| rank_2_mean_greedy_accuracy_gap_decomposed_minus_eggroll | 0 |
| wall_clock_seconds | 758.6868546763435 |
Interpretation
Run 20260803-011912-pretrained_llm_gsm8k_grouped_tangent_sweep_jean_zay-afccaa6 does not support tangent projection as a fix. The run stayed finite, but decomposed EGGROLL again trailed plain EGGROLL on sampled final accuracy, with no greedy-accuracy advantage. This reinforces the current conclusion that the grouped GSM8K exact-answer reward is stable but provides no evidence for a decomposed EGGROLL advantage.