Встречается на собеседованиях • сегодня
Как построить классификатор для распознавания чувствительных данных в чат-боте
Для построения классификатора чувствительных данных (например, PII) можно использовать NLP-подходы:
-
Сбор данных: Разметьте датасет с примерами чувствительных (номера телефонов, emails) и обычных сообщений.
-
Предобработка:
python
import re
def preprocess(text):
text = text.lower()
text = re.sub(r'\d+', '[DIGIT]', text) # маскировка чисел
return text-
Выбор модели:
- Для простых случаев: логистическая регрессия + TF-IDF
- Для сложных: BERT или его облегченные версии (DistilBERT)
-
Обучение (пример с sklearn):
python
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
vectorizer = TfidfVectorizer(preprocessor=preprocess)
model = LogisticRegression()
X_train = vectorizer.fit_transform(texts)
model.fit(X_train, labels)- Дополнительно:
- Добавьте правила (регулярки) для явных паттернов типа номеров карт
- Используйте активное обучение для сложных случаев
- Реализуйте пост-обработку (например, проверку хэшей через bloom-фильтры)
Важно учитывать баланс между точностью и recall, чтобы минимизировать ложные срабатывания.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы