Встречается на собеседованиях • сегодня
Какие знаешь способы ускорения инференса
- Квантование – уменьшение битности весов (FP32 → FP16/INT8). Пример для PyTorch:
python
model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)- ONNX Runtime/TensorRT – оптимизированные движки для инференса. Конвертация модели:
python
torch.onnx.export(model, input, "model.onnx")- Прунинг – удаление малозначимых весов. Пример:
python
prune.l1_unstructured(module, name='weight', amount=0.3)-
Кеширование – сохранение результатов для повторяющихся запросов.
-
Батчинг – обработка нескольких запросов одновременно (особенно эффективно для GPU).
-
Оптимизация архитектуры – замена тяжелых слоев на более легкие (например, MobileNet вместо ResNet).
Для максимального ускорения часто комбинируют несколько методов, например квантование + TensorRT.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы