Встречается на собеседованиях • сегодня
Расскажи архитектуру декодера
Декодер в архитектуре трансформера (например, в GPT или BERT) состоит из нескольких идентичных слоёв, каждый из которых включает:
-
Masked Multi-Head Self-Attention:
- Обрабатывает входные токены с маскированием будущих позиций (чтобы модель не "подглядывала" вперед).
- Позволяет учитывать контекст слева.
-
Multi-Head Cross-Attention:
- Связывает декодер с энкодером (если есть), используя выход энкодера как ключи и значения.
-
Feed-Forward Network (FFN):
- Двухслойная нейросеть с активацией (например, ReLU или GELU).
-
Нормализация и Residual Connections:
- LayerNorm применяется перед каждым блоком.
- Residual connections (skip-connections) помогают избежать затухания градиентов.
Пример кода (PyTorch-стиль):
python
class DecoderLayer(nn.Module):
def __init__(self, d_model, nhead, ff_dim, dropout):
super().__init__()
self.self_attn = MultiHeadAttention(d_model, nhead, masked=True)
self.cross_attn = MultiHeadAttention(d_model, nhead)
self.ffn = nn.Sequential(
nn.Linear(d_model, ff_dim),
nn.ReLU(),
nn.Linear(ff_dim, d_model)
)
self.norm1 = nn.LayerNorm(d_model)
self.norm2 = nn.LayerNorm(d_model)
self.norm3 = nn.LayerNorm(d_model)
self.dropout = nn.Dropout(dropout)Примечание: В чисто декодерных моделях (GPT) cross-attention отсутствует.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы