Локальный запуск LLM для SOC: сколько GPU действительно нужно?

Коротко

  • LLM в SOAR получает уже собранные события, артефакты и данные об инцидентах, а окончательный вердикт остаётся за аналитиком SOC.
  • RTX PRO 6000 Blackwell Max-Q потребляет 300 W вместо 600 W у базовой версии, теряя в описанном тесте около 10–15% скорости.
  • vLLM выделил 254 736 токенов KV-cache благодаря сочетанию DeltaNet, PagedAttention и восьмибитного формата FP8.
  • Chunked prefill обрабатывает длинные промпты частями, но при высокой конкуренции замедляет генерацию коротких ответов.
  • Полученные значения относятся к конкретной модели, оборудованию и SOC-нагрузке и не являются универсальной конфигурацией для продакшна.

R-Vision проверила, можно ли обслуживать крупную LLM для SOC на одной профессиональной GPU. На стенде с Qwen3.5-122B-A10B, vLLM и RTX PRO 6000 Blackwell Max-Q расчётный предел составил около семи одновременных запросов с контекстом до 120 тыс. токенов, а стабильный режим без резкого роста задержек — пять.

Qwen3.5-122B-A10B использует архитектуру Mixture of Experts: из 122 млрд параметров при генерации токена активируются около 10 млрд, хотя веса всех экспертов остаются в видеопамяти. Квантизация GPTQ-INT4 уменьшила размер весов примерно с 244 до 61 GB, а гибрид DeltaNet и GQA требует полноценного KV-cache только на каждом четвёртом слое. Вместе с PagedAttention и FP8-кэшем это позволило разместить модель и контекст до 120 тыс. токенов на карте с 96 GB VRAM.

В тестовой конфигурации веса заняли 68,36 GiB, под KV-cache осталось 11,76 GiB. При пяти параллельных запросах система работала стабильно, при семи время до первого токена доходило до двух минут, а при десяти vLLM начинал вытеснять кэш в оперативную память: задержка росла до 2,5 минуты, а генерация замедлялась примерно до 1,4 секунды на токен. Худшим сценарием оказался длинный входной контекст с коротким ответом, тогда как при генерации больших отчётов скорость достигала 30–38 токенов в секунду.

Multi-Token Prediction в этом профиле нагрузки не дало универсального ускорения. MTP потребовало ещё 4,7 GB VRAM и снизило расчётную конкурентность с 7,03 до 5,74 запроса; при коротких ответах принималось лишь 11,6% предложенных токенов, но при длинной генерации acceptance rate достигал 85%, а скорость росла на 10–12%. Поэтому R-Vision предлагает разделять быстрый оперативный чат и тяжёлый анализ логов, RAG и отчётов по разным пулам или профилям инференса.

FAQ

Зачем SOC нужна локальная LLM, если основные данные об инцидентах уже собираются средствами SIEM, SOAR и EDR?

Модель берёт подготовленный контекст и автоматизирует объяснение срабатываний, выделение артефактов, поиск похожих инцидентов и подготовку предварительного вердикта.

Почему модель на 122 млрд параметров удалось запустить на одной видеокарте с 96 GB памяти без выгрузки весов в RAM?

Архитектура MoE активирует около 10 млрд параметров на токен, а INT4-квантизация, DeltaNet и FP8 KV-cache сокращают вычислительную и память-составляющую инференса.

Почему увеличение конкурентности с семи до десяти запросов резко ухудшило задержки, хотя приложение не завершилось с ошибкой OOM?

После исчерпания доступного KV-cache vLLM начал вытеснять данные в оперативную память. Это сохранило работоспособность, но резко увеличило TTFT и время генерации каждого токена.

Читайте также

  1. Сколько железа нужно ИИ-агенту: как считали ресурсы для on-premise LLM и почему калькуляторы ошиблись в 5 раз
  2. Как я собрал LLM-печку на четырёх GPU и что она умеет
  3. AI R&D DAY: два трека об исследованиях и продуктизации ИИ
  4. Новый релиз Ollama 0.15.5
  5. Qwen3.6 27B MTP добавляет около 0,3 ГБ веса и ускоряет генерацию примерно в 2 раза: с 60 до 130 t/s без потерь
Ключевые инсайты из новости (по версии ChatGPT)
  • Оценка ресурсов LLM по профилю нагрузки: Инфраструктуру для локального LLM-инференса нужно рассчитывать по длине входного контекста, объёму ответа и числу одновременных запросов, а не только по количеству параметров модели. Для корпоративных сценариев полезно заранее выделить типовые классы запросов и проверить каждый из них нагрузочным тестом.
    [LLM-инфраструктура]
Для получения полного доступа оформите подписку PubMag PRO.
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться
Инсайты автоматически генерируются с помощью искусственного интеллекта на основе текста статьи.
← Назад в лентуЧитать оригинал →
✈️ Подписывайтесь на мой Telegram-канал — там еще больше интересного про AdTech, MarTech, AI и многое другое!