Встречается на собеседованиях • сегодня

Что такое Mixture of Experts

Mixture of Experts (MoE) — это архитектура нейронных сетей, где модель состоит из множества "экспертов" (подсетей) и механизма маршрутизации (gating network), который динамически выбирает, какие эксперты обрабатывают входные данные. Это позволяет эффективно масштабировать модель, активируя только часть параметров для каждого примера.

Пример с кодом (PyTorch):

python
import torch
import torch.nn as nn

class Expert(nn.Module):
def init(self, dim):
super().init()
self.net = nn.Sequential(nn.Linear(dim, dim), nn.ReLU())

text
def forward(self, x):
    return self.net(x)

class MoE(nn.Module):
def init(self, dim, num_experts=4):
super().init()
self.experts = nn.ModuleList([Expert(dim) for _ in range(num_experts)])
self.gate = nn.Linear(dim, num_experts)

text
def forward(self, x):
    gates = torch.softmax(self.gate(x), dim=-1)
    expert_outputs = torch.stack([expert(x) for expert in self.experts], dim=1)
    return (gates.unsqueeze(-1) * expert_outputs).sum(dim=1)
text

**Ключевые особенности:**
- Эффективность: активируются только выбранные эксперты (sparse computation).
- Масштабируемость: общее число параметров может быть огромным, но вычислительные затраты растут линейно.
- Применение: Google Switch Transformer, GPT-4 (предположительно).
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы