Встречается на собеседованиях • сегодня

Что было до модели трансформеров

До трансформеров (2017) доминировали рекуррентные (RNN, LSTM) и сверточные (CNN) архитектуры для NLP.

RNN/LSTM: Обрабатывали последовательности пошагово, сохраняя скрытое состояние. Недостатки:

  • Медленное обучение из-за последовательной природы
  • Проблемы с долгосрочными зависимостями

CNN: Применяли свертки к тексту, но плохо улавливали глобальные зависимости.

Attention механизмы: Появились в 2015 (Bahdanau Attention), затем Seq2Seq с Attention. Позволяли моделям "фокусироваться" на важных частях входа.

Пример LSTM с PyTorch:

python
import torch.nn as nn

class LSTMModel(nn.Module):
    def __init__(self, vocab_size, embed_dim, hidden_dim):
        super().__init__()
        self.embedding = nn.Embedding(vocab_size, embed_dim)
        self.lstm = nn.LSTM(embed_dim, hidden_dim, batch_first=True)
        self.fc = nn.Linear(hidden_dim, vocab_size)
    
    def forward(self, x):
        x = self.embedding(x)
        out, _ = self.lstm(x)
        return self.fc(out[:, -1, :])

Трансформеры заменили эти подходы, введя self-attention и параллельную обработку последовательностей.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы