Вам нужна RAM, а не VRAM: параметр -cmoe для локального запуска больших MoE-LLM. Ускоряем GPT-OSS-120B

Переход к MoE (Mixture of Experts) меняет профиль ресурсов при локальном запуске LLM: меньше требований к VRAM, больше — к обычной RAM. В MoE на шаге генерации активируется лишь часть экспертов (напр., у GPT-OSS-120B — 4 из 128), что эквивалентно ~24× меньшим вычислениям против Dense-аналогов при сопоставимом общем размере модели. Ключ к ускорению без апгрейда железа — грамотное распределение тензоров между CPU и GPU.

В llama.cpp параметр -cmoe/--cpu-moe оставляет MoE-параметры (FFN-«экспертов») на CPU, а общие тензоры внимания/слои — на GPU; альтернативно -ncmoe N задаёт, сколько слоёв вернуть на CPU. Подход даёт существенный прирост скорости и экономит VRAM.

Итог: крупные MoE-LLM можно запускать локально на одной видеокарте (в т.ч. AMD через Vulkan/ROCm), упираясь прежде всего в объём RAM; VRAM используется эффективнее за счёт вынесения именно «общих» тензоров на GPU.

Читайте также

  1. Локальный запуск LLM для SOC: сколько GPU действительно нужно?
  2. Сколько стоит контроль над ИИ-агентом? Считаем экономику
  3. Локальные LLM на слабом железе: что ставить, как запускать и чего ждать
  4. Как я склеиваю 23 тысячи событий из пяти афиш — и почему дедуп нельзя делать необратимым
  5. Как выбрать между облаком, арендой GPU и своим железом для LLM-систем
Ключевые инсайты из новости (по версии ChatGPT)
  • MoE: упор на RAM, а не на VRAM: У MoE-LLM на генерацию активируется лишь часть экспертов, поэтому модель эффективнее использует VRAM, а «узким местом» становится системная RAM. Это позволяет запускать крупные MoE-модели на одной видеокарте при достаточном объёме оперативной памяти.
    [Архитектура моделей]
Для получения полного доступа оформите подписку PubMag PRO.
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться
Инсайты автоматически генерируются с помощью искусственного интеллекта на основе текста статьи.
← Назад в лентуЧитать оригинал →
✈️ Подписывайтесь на мой Telegram-канал — там еще больше интересного про AdTech, MarTech, AI и многое другое!