Встречается на собеседованиях • сегодня

Какие знаешь этапы работы Transformer

  1. Токенизация: Текст разбивается на токены (слова/подслова) с помощью токенизатора (например, BPE в BERT).

  2. Встраивание (Embedding): Токены преобразуются в векторы через слои Embedding (токенные, позиционные, сегментные).

  3. Self-Attention: Вычисляются веса внимания между токенами для учета контекста. Пример:

python
attention_scores = torch.matmul(Q, K.transpose(-2, -1)) / sqrt(d_k)
  1. Feed Forward Networks: Каждый токен проходит через полносвязную сеть для нелинейных преобразований.

  2. Нормализация и Dropout: Применяются LayerNorm и Dropout для стабилизации обучения.

  3. Кодирование/Декодирование: В encoder-decoder архитектурах (например, T5) добавляется механизм внимания между encoder и decoder.

  4. Выходной слой: Для задач классификации — линейный слой + softmax, для генерации — вероятностный выбор токена.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы