Design

Which solid notes this experiment tests, and how.

Results

20260803-234737-pretrained_llm_gsm8k_qwen05_scale_smoke_jean_zay-ddff3bd

commit: ddff3bd

metricvalue
both_success_rate0
decomposed_grid_0_lr_direction0.01
decomposed_grid_0_lr_magnitude0.25
decomposed_grid_0_mean_accuracy_gap_decomposed_minus_eggroll-3.104408582051595e-10
decomposed_grid_0_mean_final_accuracy0.013888888992369175
decomposed_grid_0_success_rate0
decomposed_grid_0_win_rate0.3333333333333333
decomposed_lr_direction0.02
decomposed_lr_direction_0_mean_accuracy_gap_decomposed_minus_eggroll-3.104408582051595e-10
decomposed_lr_direction_0_mean_final_accuracy0.013888888992369175
decomposed_lr_direction_0_success_rate0
decomposed_lr_direction_0_value0.01
decomposed_lr_direction_0_win_rate0.3333333333333333
decomposed_lr_magnitude0.02
decomposed_lr_magnitude_0_mean_accuracy_gap_decomposed_minus_eggroll-3.104408582051595e-10
decomposed_lr_magnitude_0_mean_final_accuracy0.013888888992369175
decomposed_lr_magnitude_0_success_rate0
decomposed_lr_magnitude_0_value0.25
decomposed_lr_magnitude_0_win_rate0.3333333333333333
decomposed_mean_accuracy_improvement-0.010416666977107525
decomposed_mean_best_accuracy0.0243055559694767
decomposed_mean_final_accuracy0.013888888992369175
decomposed_mean_final_greedy_accuracy0.013888888992369175
decomposed_mean_final_greedy_parseable_rate1
decomposed_mean_final_parseable_rate0.9965277910232544
decomposed_mean_finite_epoch_fraction0
decomposed_mean_greedy_accuracy_improvement-0.0034722223257025084
decomposed_mean_greedy_parseable_rate_improvement0
decomposed_mean_parseable_rate_improvement-0.0034722089767456055
decomposed_mean_shaped_epoch_fraction0.6666666666666666
decomposed_mean_train_accuracy0.0078125
decomposed_mean_train_parseable_rate0.703125
decomposed_median_final_accuracy0.010416666977107525
decomposed_success_rate0
decomposed_tangent_project_direction0
decomposed_win_rate0.3333333333333333
eggroll_mean_accuracy_improvement-0.010416666666666666
eggroll_mean_best_accuracy0.027777778295179207
eggroll_mean_final_accuracy0.013888889302810034
eggroll_mean_final_greedy_accuracy0.013888888992369175
eggroll_mean_final_greedy_parseable_rate1
eggroll_mean_final_parseable_rate1
eggroll_mean_finite_epoch_fraction0
eggroll_mean_greedy_accuracy_improvement-0.0034722223257025084
eggroll_mean_greedy_parseable_rate_improvement0
eggroll_mean_parseable_rate_improvement0
eggroll_mean_shaped_epoch_fraction0.6666666666666666
eggroll_mean_train_accuracy0.0078125
eggroll_mean_train_parseable_rate0.81640625
eggroll_median_final_accuracy0.010416666977107525
eggroll_success_rate0.3333333333333333
epochs4
eval_interval0
eval_samples96
generations_per_prompt8
mean_accuracy_gap_decomposed_minus_eggroll-3.104408582051595e-10
mean_greedy_accuracy_gap_decomposed_minus_eggroll0
mean_greedy_improvement_gap_decomposed_minus_eggroll0
mean_improvement_gap_decomposed_minus_eggroll-3.104408582051595e-10
mean_parseable_gap_decomposed_minus_eggroll-0.0034722089767456055
num_decomposed_lr_directions1
num_decomposed_lr_magnitudes1
num_pairs3
num_ranks1
num_seeds3
num_target_modules7
population64
prompts_per_epoch8
rank_1_decomposed_success_rate0
rank_1_decomposed_win_rate0.3333333333333333
rank_1_eggroll_success_rate0.3333333333333333
rank_1_mean_accuracy_gap_decomposed_minus_eggroll-3.104408582051595e-10
rank_1_mean_greedy_accuracy_gap_decomposed_minus_eggroll0
wall_clock_seconds2063.914653176442

Interpretation

Run 20260803-234737-pretrained_llm_gsm8k_qwen05_scale_smoke_jean_zay-ddff3bd completed after the H100 CPU-memory allocation retry. The metrics do not show a decomposed advantage over plain EGGROLL: final sampled accuracy is effectively tied, greedy accuracy is tied, and plain EGGROLL has the only positive success-rate signal. Treat this as successful Qwen smoke plumbing under the larger allocation, not as evidence that the scale-calibrated decomposed setting wins.