Stanford AI Lab unveils Context-Sharded Block Parallelism delivering 7.59× faster DFlash2 training and 1.61× block diffusion fine-tuning gains that ...
According to StanfordAILab, CSBP speeds DFlash2 drafter training 7.59x, block diffusion finetuning 1.61x, and adaptation 1.33x, improving SWE-bench.