Встречается на собеседованиях • сегодня
Что такое Mixture of Experts
Mixture of Experts (MoE) — это архитектура нейронных сетей, где модель состоит из множества "экспертов" (подсетей) и механизма маршрутизации (gating network), который динамически выбирает, какие эксперты обрабатывают входные данные. Это позволяет эффективно масштабировать модель, активируя только часть параметров для каждого примера.
Пример с кодом (PyTorch):
python
import torch
import torch.nn as nn
class Expert(nn.Module):
def init(self, dim):
super().init()
self.net = nn.Sequential(nn.Linear(dim, dim), nn.ReLU())
text
def forward(self, x):
return self.net(x)class MoE(nn.Module):
def init(self, dim, num_experts=4):
super().init()
self.experts = nn.ModuleList([Expert(dim) for _ in range(num_experts)])
self.gate = nn.Linear(dim, num_experts)
text
def forward(self, x):
gates = torch.softmax(self.gate(x), dim=-1)
expert_outputs = torch.stack([expert(x) for expert in self.experts], dim=1)
return (gates.unsqueeze(-1) * expert_outputs).sum(dim=1)text
**Ключевые особенности:**
- Эффективность: активируются только выбранные эксперты (sparse computation).
- Масштабируемость: общее число параметров может быть огромным, но вычислительные затраты растут линейно.
- Применение: Google Switch Transformer, GPT-4 (предположительно).
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы