// dust
dust
Dust: Предобучение трансформеров без обратного распространения ошибки
Введение в парадигму Dust: Бросаем вызов классическому Backprop Когда в вашем ML-кластере в очередной раз «падает» обучение LLM из-за банальной нехватки VRAM под гигантские промежуточные активации (п…
dust