Встречается на собеседованиях • сегодня
Почему в рекуррентных сетях и трансформерах используют не Batch Normalization, а Layer Normalization
Batch Normalization (BN) неэффективна для рекуррентных сетей и трансформеров из-за зависимости от статистик батча. В RNN последовательности могут быть разной длины, а статистики батча меняются от шага к шагу, что нарушает стабильность обучения. Layer Normalization (LN) нормирует по слою для каждого примера независимо, что делает её устойчивой к переменной длине последовательностей и размерам батча. В трансформерах LN также применяется к каждому слою отдельно, обеспечивая стабильные градиенты.
Пример с LN в PyTorch:
python
import torch.nn as nn
layer_norm = nn.LayerNorm(normalized_shape=64)
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы