Встречается на собеседованиях • сегодня

Какие знаешь способы ускорения инференса

  1. Квантование – уменьшение битности весов (FP32 → FP16/INT8). Пример для PyTorch:
python
model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)
  1. ONNX Runtime/TensorRT – оптимизированные движки для инференса. Конвертация модели:
python
torch.onnx.export(model, input, "model.onnx")
  1. Прунинг – удаление малозначимых весов. Пример:
python
prune.l1_unstructured(module, name='weight', amount=0.3)
  1. Кеширование – сохранение результатов для повторяющихся запросов.

  2. Батчинг – обработка нескольких запросов одновременно (особенно эффективно для GPU).

  3. Оптимизация архитектуры – замена тяжелых слоев на более легкие (например, MobileNet вместо ResNet).

Для максимального ускорения часто комбинируют несколько методов, например квантование + TensorRT.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы