@@ -36,24 +36,40 @@ train loss упал до **0.0088**, FP32 BPT=**0.00606** → модель пе
3636валиден только при baseline BPT ≥ 1.0. В скрипт добавлен GUARD:
3737` baseline_valid ` в meta + предупреждение при FP32 BPT < 1.0.
3838
39- ## Трек B — масштаб (NL=12, DMODEL=768) — OOM → пофикшено
39+ ## Трек B — масштаб (NL=12, DMODEL=768) — ВАЛИДНЫЙ ( OOM пофикшен)
4040
41- Первый прогон: ` torch.OutOfMemoryError ` (31.37 ГБ, tried 576 MiB) на forward
42- FFN. Причина: BATCH=48/SEQ=1024 фиксированы. Фикс в скрипте:
41+ Первый прогон: ` torch.OutOfMemoryError ` (31.37 ГБ). Фикс:
4342` PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True ` + авто-бюджет BATCH
44- (` _budget=9*512*48*1024 / (NL*D*1024) ` ) → для NL=12/d=768 авто BATCH=24;
45- базовый NL=9/d=512 остаётся BATCH=48 (прошлые числа не меняются). Также
46- BATCH/SEQ теперь env-override. ** Прогон трека B — за пользователем** (тот же
47- скрипт после git pull).
48-
49- ## Свод (2 из 3 конфигураций замерены)
50-
51- - ** Обобщение по чекпоинту ` [измерено — GPU] ` :** нейтральность ΔBPT(Hessian−MSE)
52- по model-BPT держится и на STEPS=6000. Инвариант №18 (SQNR выхода слоя был
53- суррогатом, downstream-BPT нейтрален) — НЕ артефакт одной точки обучения.
54- - ** Обобщение по сиду:** seed=123 дал коллапс → не проверено; нужен здоровый
55- 2-й сид (напр. seed=7 STEPS=6000). GUARD добавлен.
56- - ** Масштаб:** OOM пофикшен, замер на NL=12/d=768 ожидает прогона.
43+ (` 9*512*48*1024/(NL*D*1024) ` ) → NL=12/d=768 авто BATCH=24. Повторный прогон
44+ дошёл до конца: loss=3.89, FP32 BPT=** 5.66098** . 36 Linear, Hessian снят с 24/36.
45+
46+ | bits | ΔBPT(Hessian−MSE, все FFN) | ΔBPT(гибрид−MSE) |
47+ | ---| ---| ---|
48+ | 4 | −0.00001 | +0.00063 |
49+ | 6 | +0.00000 | +0.00009 |
50+ | 8 | +0.00000 | −0.00001 |
51+
52+ Все |ΔBPT| на 3–4 порядка ниже порога 0.0195. Нейтральность вектора 2 по
53+ model-BPT ** держится и на более крупной модели** .
54+
55+ ## Свод (3 из 3 конфигураций замерены — обобщение завершено)
56+
57+ | Конфиг | baseline BPT | max | ΔBPT| | Вывод |
58+ | ---| ---| ---| ---|
59+ | 9L/d512, 3000 шагов | 3.69 | 0.00022 | нейтрально |
60+ | 9L/d512, 6000 шагов (чекпоинт) | 5.26 | 0.00079 | нейтрально |
61+ | 12L/d768, 3000 шагов (масштаб) | 5.66 | 0.00063 | нейтрально |
62+ | 9L/d512, seed=123 | 0.006 | — | коллапс, отброшен |
63+
64+ - ** Обобщение по чекпоинту ` [измерено — GPU] ` :** нейтральность ΔBPT держится на
65+ STEPS=6000.
66+ - ** Обобщение по масштабу ` [измерено — GPU] ` :** держится и на 12L/d768; с ростом
67+ модели маржа ещё сжимается (max |ΔBPT| 0.00079→0.00063).
68+ - ** Главный вывод:** SQNR выхода слоя (инв. №18) — суррогат, НЕ переносится в
69+ потери модели даже на более глубокой/широкой сети. НЕ артефакт одной точки
70+ обучения по двум осям (чекпоинт + масштаб).
71+ - ** Оговорка по сиду:** seed=123 дал коллапс → 2-й ЗДОРОВЫЙ сид не проверен;
72+ нужен напр. seed=7 STEPS=6000. GUARD добавлен.
5773
5874## Границы (BINDING)
597529M PTQ-прокси, НЕ official Parameter Golf; PTQ ≠ QAT; BPB = BPT/3.9 ` [прокси] `
0 commit comments