Какие знаешь этапы работы Transformer
-
Токенизация: Текст разбивается на токены (слова/подслова) с помощью токенизатора (например, BPE в BERT).
-
Встраивание (Embedding): Токены преобразуются в векторы через слои Embedding (токенные, позиционные, сегментные).
-
Self-Attention: Вычисляются веса внимания между токенами для учета контекста. Пример:
attention_scores = torch.matmul(Q, K.transpose(-2, -1)) / sqrt(d_k)-
Feed Forward Networks: Каждый токен проходит через полносвязную сеть для нелинейных преобразований.
-
Нормализация и Dropout: Применяются LayerNorm и Dropout для стабилизации обучения.
-
Кодирование/Декодирование: В encoder-decoder архитектурах (например, T5) добавляется механизм внимания между encoder и decoder.
-
Выходной слой: Для задач классификации — линейный слой + softmax, для генерации — вероятностный выбор токена.

офферы быстрее!
Следующий вопрос
Это единственный вопрос по вашему фильтру