Встречается на собеседованиях • сегодня

Расскажи архитектуру декодера

Декодер в архитектуре трансформера (например, в GPT или BERT) состоит из нескольких идентичных слоёв, каждый из которых включает:

  1. Masked Multi-Head Self-Attention:

    • Обрабатывает входные токены с маскированием будущих позиций (чтобы модель не "подглядывала" вперед).
    • Позволяет учитывать контекст слева.
  2. Multi-Head Cross-Attention:

    • Связывает декодер с энкодером (если есть), используя выход энкодера как ключи и значения.
  1. Feed-Forward Network (FFN):

    • Двухслойная нейросеть с активацией (например, ReLU или GELU).
  2. Нормализация и Residual Connections:

    • LayerNorm применяется перед каждым блоком.
    • Residual connections (skip-connections) помогают избежать затухания градиентов.

Пример кода (PyTorch-стиль):

python
class DecoderLayer(nn.Module):
    def __init__(self, d_model, nhead, ff_dim, dropout):
        super().__init__()
        self.self_attn = MultiHeadAttention(d_model, nhead, masked=True)
        self.cross_attn = MultiHeadAttention(d_model, nhead)
        self.ffn = nn.Sequential(
            nn.Linear(d_model, ff_dim),
            nn.ReLU(),
            nn.Linear(ff_dim, d_model)
        )
        self.norm1 = nn.LayerNorm(d_model)
        self.norm2 = nn.LayerNorm(d_model)
        self.norm3 = nn.LayerNorm(d_model)
        self.dropout = nn.Dropout(dropout)

Примечание: В чисто декодерных моделях (GPT) cross-attention отсутствует.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы