Стоит ли использовать Qwen: качество и цена
Все три модели нашли основную проблему: функция матчинга источников трафика на каждый запрос заново парсила URL-ы из статической конфигурации, которая меняется раз в сутки. На это приходилось около 45% аллокаций объектов, а базовый фикс у всех совпал: парсить конфиг один раз при загрузке, а не внутри обработки запроса.
Разница проявилась в глубине профилирования. Codex использовал -peek и -list, нашёл per-request логгер, лишний HGETALL ради трёх полей и возможность переиспользовать существующий LRU-кэш; Claude через -peek вышел на схожие причины и получил ту же итоговую оценку 46 из 50. Qwen ограничился -top -cum, корректно нашёл главный корень и не выдумывал API, но пропустил часть проблем, видимых только через разбор вызывающих.
Главная претензия к Qwen — небезопасный quick win: модель предложила переиспользовать объект в цикле и передавать указатель дальше, хотя путь оказался асинхронным и мог привести к порче данных. В субъективной оценке автора Qwen получил 43 из 50 против 46 у Codex и Claude, а по деньгам оказался неудобен: подписку за $50 купить не удалось, пакет за $200 в его сценарии хватил бы примерно на 33 часа работы в один поток и выглядел дороже подписок Claude и ChatGPT.
Коротко
- В тесте сравнивались Qwen 3.7 Max, Codex на GPT-5.5 и Claude Opus 4.8 на задаче анализа heap alloc_objects в Go-сервисе.
- Все модели нашли главный источник аллокаций: повторный парсинг URL-ов из статической конфигурации на каждый запрос.
- Codex и Claude использовали более глубокий разбор через -peek, а Qwen ограничился -top -cum и пропустил часть per-request причин.
- Qwen предложил небезопасный quick win с переиспользованием объекта и указателя в асинхронном пути сохранения.
- По субъективной шкале автора Codex и Claude получили по 46 из 50, Qwen — 43 из 50; это не бенчмарк, а разбор одного кейса.
FAQ
Зачем автор сравнивал Qwen с Codex и Claude на одной задаче профилирования Go-сервиса?
Чтобы проверить не абстрактное качество модели, а практическую пользу в реальной инженерной задаче: найти причины аллокаций по pprof-профилю и предложить фиксы по коду.
В чём Qwen оказался сопоставим с Codex и Claude, а где заметно отстал?
Он нашёл главный источник аллокаций и дал корректный базовый фикс. Но не дошёл до более глубокого -peek-разбора и предложил рискованный quick win для асинхронного кода.
Можно ли по этому сравнению считать Qwen полноценной заменой Claude или ChatGPT для coding-agent задач?
В описанном кейсе автор считает Qwen рабочим вариантом при отсутствии топовых альтернатив. Но при доступе к Codex, Claude или Gemini он не увидел выигрыша по качеству и цене.
Читайте также
Почему Fable 5, Opus 4.8 и GPT-5.x требуют разных промптов
ИИ-агенты для бизнеса в России: обзор 10 локальных платформ и решений
Как кодинг-агенты используют инструменты, память и контекст репозитория, чтобы писать код лучше
Субагенты в Claude Code
Как я добавил MAX в китайский AI-мост и запустил Claude прямо в мессенджере
- Оценивать кодинг-модели нужно на одинаковой прикладной задаче: Сравнение LLM для разработки полезнее проводить не на абстрактных бенчмарках, а на одной реальной задаче с одинаковым доступом к репозиторию, профилям и требованиям. Для PubMag это применимо при выборе AI-ассистентов: фиксировать входные данные, ожидаемый результат, время выполнения, качество находок и стоимость прогона.
[AI-инструменты разработки]
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться
Автор сравнил Qwen 3.7 Max, Codex на GPT-5.5 и Claude Opus 4.8 на одной практической задаче: разобрать pprof-профиль высоконагруженного Go-сервиса и предложить фиксы. Qwen нашёл главный источник аллокаций, но проиграл топовым моделям по глубине проверки, безопасности рекомендаций и итоговой экономике.