Commit 191a8dd
committed
docs(nvfp4): mixed RtN backward on sm_121 is FEASIBLE — nanochat receipt + web research converge
Two corroborating analyses overturning the over-broad 'datacenter-only' verdict:
- NVFP4-NANOCHAT-RECIPE.md: nanochat already trained on GB10 with
NVFP4BlockScaling(disable_rht=True, disable_sr=True, override_linear_precision=(False,False,True))
= fprop+dgrad FP4 (RtN) + wgrad BF16; loss 11.09->6.58 / 22 steps (real receipt).
- NVFP4-GB10-MIXED-APPROACH.md: Brave/Exa/Perplexity/Tavily synthesis — SR-cvt + RHT are
separable pre-GEMM quant kernels; backward matmul == working forward TN FP4 GEMM. Ranked
impl plan + numeric gate (dgrad rel-err<=0.20, garbage-grad detector). Implementation in
progress (port to _nvfp4_route.py).1 parent 9f33d03 commit 191a8dd
2 files changed
Lines changed: 635 additions & 0 deletions
0 commit comments