Встречается на собеседованиях • сегодня

Почему в рекуррентных сетях и трансформерах используют не Batch Normalization, а Layer Normalization

Batch Normalization (BN) неэффективна для рекуррентных сетей и трансформеров из-за зависимости от статистик батча. В RNN последовательности могут быть разной длины, а статистики батча меняются от шага к шагу, что нарушает стабильность обучения. Layer Normalization (LN) нормирует по слою для каждого примера независимо, что делает её устойчивой к переменной длине последовательностей и размерам батча. В трансформерах LN также применяется к каждому слою отдельно, обеспечивая стабильные градиенты.

Пример с LN в PyTorch:

python
import torch.nn as nn
layer_norm = nn.LayerNorm(normalized_shape=64)
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы