Какие знаешь архитектуры языковых моделей
Основные архитектуры языковых моделей:
-
RNN (Recurrent Neural Networks) – последовательная обработка текста с сохранением состояния. Проблема: забывание длинных зависимостей.
Пример: LSTM, GRU (улучшенные версии RNN). -
Transformer – основа современных LLM. Использует механизм внимания (self-attention) для параллельной обработки и улавливания зависимостей.
Пример: BERT (encoder-only), GPT (decoder-only), T5 (encoder-decoder).
-
BERT (Bidirectional Encoder Representations) – предобучение на masked language modeling (MLM). Подходит для классификации, NER.
-
GPT (Generative Pre-trained Transformer) – авторегрессионная модель, предобученная на предсказании следующего токена. Оптимизирована для генерации текста.
-
T5 (Text-to-Text Transfer Transformer) – унифицированный подход: все задачи формулируются как "текст → текст".
# Пример использования GPT-2 из Hugging Face
from transformers import GPT2LMHeadModel, GPT2Tokenizer
model = GPT2LMHeadModel.from_pretrained("gpt2")
tokenizer = GPT2Tokenizer.from_pretrained("gpt2")
inputs = tokenizer("Hello, world!", return_tensors="pt")
outputs = model.generate(**inputs)
print(tokenizer.decode(outputs[0]))
офферы быстрее!
Следующий вопрос
Это единственный вопрос по вашему фильтру