Локальный запуск openai/gpt-oss-20b MXFP4 GGUF на ноутбуке без дискретной видеокарты: тест с 32 GB RAM
Проверка шла на ASUS Vivobook S 16 M3607HA с Ryzen 7 260, встроенной Radeon 780M, 32 GB DDR5 5600 и Windows 11. Модель запускалась в LM Studio 0.4.16-1 x64 при Context Length 16384, 32768 и 65536; GPU Offload был выставлен в 20, CPU
Threads1 — 8, Unified KV Cache включён. Важно, что Context Length здесь был лимитом окна, а не фактически заполненным контекстом.
Скорость генерации в тестовых сценариях держалась в диапазоне 8,05–10,63 tok/sec, средние значения составили около 9,32 tok/sec при 16384, 9,09 tok/sec при 32768 и 9,55 tok/sec при 65536. Главный лимит — RAM: пик памяти вырос с 27,6 GB при 16384 до 28,7 GB при 32768 и 30,0 GB при 65536 из доступных 31,3 GB. Диск во время генерации почти не нагружался, NPU не использовался, CPU держался около 46–50%, а встроенная Radeon 780M — примерно 63–73%.
Для повседневной локальной работы с кодом и текстом автор считает более безопасными режимы 16384 или 32768. При 65536 модель тоже отвечает, но свободной памяти остаётся около 1,2–1,4 GB, поэтому параллельный браузер, IDE или Docker могут быстро привести систему к пределу. Больший Context Length не гарантирует лучшее качество: лучший Python-скрипт для обработки больших логов получился при 32768, а при 65536 код был рабочим, но более грубым.
Коротко
- openai/gpt-oss-20b MXFP4 GGUF запустилась на ноутбуке с Ryzen 7 260, Radeon 780M и 32 GB RAM без дискретной видеокарты.
- Средняя скорость генерации в трёх режимах Context Length держалась около 9 tok/sec без заметного падения при росте лимита окна.
- Пик потребления RAM вырос с 27,6 GB при 16384 до 30,0 GB при 65536 из доступных Windows 31,3 GB.
- В тесте с Python-скриптом модель соблюдала базовые требования, но качество реализации и самоаудита отличалось между режимами.
- Автор не считает эксперимент универсальным benchmark: это один ноутбук, один набор сценариев и замеры через LM Studio и Task Manager.
FAQ
Зачем запускать openai/gpt-oss-20b локально на ноутбуке без дискретной видеокарты, если есть облачные LLM-сервисы?
Локальный запуск полезен для работы с кодом и текстом без отправки данных в облако. Но в таком сценарии нужно мириться с умеренной скоростью и вручную проверять ответы.
Какой Context Length оказался наиболее практичным для ноутбука с 32 GB RAM в этом эксперименте?
Самым спокойным режимом автор считает 16384, а лучшим компромиссом в тестах — 32768. Режим 65536 работает, но почти исчерпывает запас RAM.
Можно ли считать результаты доказательством комфортной работы с реальным контекстом на 65k токенов?
Нет. В тесте был выставлен лимит 65536, но фактически к концу третьего prompt использовалось только 4809 токенов, то есть 7,3% окна.
Читайте также
ИИ-агенты для бизнеса в России: обзор 10 локальных платформ и решений
Обзор серверного ускорителя NVIDIA Tesla V100 16 ГБ в корпусе от RTX 4090: часть 3 — запуск локальных моделей ИИ
ИИ добрался до раритетов: цены на память DDR2 выросли на 60% за три месяца
Как перенести расчёт абсолютных валютных курсов на Kaggle и автоматизировать обзоры через Gemini API
Как я собрал LLM-печку на четырёх GPU и что она умеет
- Локальная 20B LLM может быть рабочей на ноутбуке без дискретной GPU: Практический тест openai/gpt-oss-20b MXFP4 GGUF показывает, что локальная 20B-модель может запускаться на ноутбуке с 32 GB RAM, CPU и встроенной Radeon 780M. Ожидаемый уровень скорости в таком сценарии около 9 tok/sec, чего достаточно для неспешной работы с кодом, текстом, требованиями и документацией без отправки данных в облако.
[Локальные LLM]
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться
Практический тест показал, что openai/gpt-oss-20b MXFP4 GGUF можно запустить на обычном ноутбуке с 32 GB RAM без дискретной видеокарты. На ASUS Vivobook S 16 модель работала локально через LM Studio со скоростью около 9 tok/sec, но упиралась прежде всего в память.