2026-08-01

  • 04:15 fetched 20260731-234003-pretrained_llm_robustness_sweep_jean_zay-43386a3
  • 04:15 reported 20260731-234003-pretrained_llm_robustness_sweep_jean_zay-43386a3 in notes/experiments/pretrained_llm_robustness_sweep_jean_zay.md
  • 04:16 fetched and reported pretrained LLM robustness sweep run 20260731-234003-pretrained_llm_robustness_sweep_jean_zay-43386a3; both methods were stable and decomposed EGGROLL was slightly ahead overall, so the next step is a tiny real-reward benchmark rather than a stronger win claim
  • 09:47 consolidated the empirical evidence into an empirical-sketch-proofs note, merged matrix and LLM experiment pages, and refreshed the public project pages before the real-reward benchmark
  • 10:20 implemented pretrained_llm_exact_reward_smoke to replace answer-token likelihood with sampled numeric correctness before any long-context reward task
  • 11:33 submitted 20260801-113246-pretrained_llm_exact_reward_smoke_jean_zay-6224172 (job 510529 on jean-zay, commit 6224172)
  • 11:33 submitted pretrained_llm_exact_reward_smoke_jean_zay as 20260801-113246-pretrained_llm_exact_reward_smoke_jean_zay-6224172 on Jean Zay job 510529 after an initial local-config submit attempt failed before reaching the cluster
  • 14:12 fetched 20260801-113246-pretrained_llm_exact_reward_smoke_jean_zay-6224172
  • 14:12 reported 20260801-113246-pretrained_llm_exact_reward_smoke_jean_zay-6224172 in notes/experiments/pretrained_llm_exact_reward_smoke_jean_zay.md
  • 14:13 fetched and reported exact-reward smoke run 20260801-113246-pretrained_llm_exact_reward_smoke_jean_zay-6224172 and interpreted it as reward-only plumbing success without a strong decomposed win
  • 14:33 implemented a GSM8K-subset exact-answer reward smoke that reuses the sampled numeric reward path and caches the dataset only in the Jean Zay job workspace
  • 14:54 submitted 20260801-145407-pretrained_llm_gsm8k_reward_smoke_jean_zay-0cabfb5 (job 513119 on jean-zay, commit 0cabfb5)
  • 14:55 submitted GSM8K reward smoke as 20260801-145407-pretrained_llm_gsm8k_reward_smoke_jean_zay-0cabfb5 on Jean Zay job 513119 after fixing bootstrap quoting and the namespaced GSM8K dataset id
  • 16:40 fetched 20260801-145407-pretrained_llm_gsm8k_reward_smoke_jean_zay-0cabfb5
  • 16:40 reported 20260801-145407-pretrained_llm_gsm8k_reward_smoke_jean_zay-0cabfb5 in notes/experiments/pretrained_llm_gsm8k_reward_smoke_jean_zay.md
  • 16:41 interpreted GSM8K reward smoke run 20260801-145407-pretrained_llm_gsm8k_reward_smoke_jean_zay-0cabfb5 as successful reward plumbing but not evidence for a decomposed advantage
  • 17:54 added greedy-eval and reward-sparsity diagnostics to the exact-answer reward runners and prepared a larger GSM8K reward sweep config
  • 17:59 submitted 20260801-175851-pretrained_llm_gsm8k_reward_sweep_jean_zay-993bd00 (job 515120 on jean-zay, commit 993bd00)
  • 18:00 submitted larger GSM8K reward sweep as 20260801-175851-pretrained_llm_gsm8k_reward_sweep_jean_zay-993bd00 on Jean Zay job 515120 to test exact-reward movement with greedy diagnostics