Как автор снизил стоимость обработки данных с помощью ИИ в 12 раз
Задача требовала извлекать из десятков тысяч объявлений даты, теги, стоимость и другие данные в строго валидный JSON. В тесте на нескольких сотнях реальных сообщений бесплатные модели примерно в 40% случаев нарушали схему, Qwen 3.5-Flash давала правильный результат в 95% запросов, Mistral 3.5 — в 80–85%, а GPT 5-nano — в 100%, но стоила 10–12 копеек за запрос.
OpenCode Go предлагает подписку за $5 в месяц с $60 кредитов на модели, что для первых $60 использования даёт 12-кратную разницу в цене относительно прямой оплаты токенов. Поскольку готового API для интеграции автор не нашёл, он написал сервер на Express.js и SQLite, который преобразует единый входной запрос в OpenAI- или Anthropic-совместимый формат в зависимости от выбранной модели.
Сервер также открывает через HTTP агентные функции OpenCode: системные инструкции из AGENTS.md, долговременный контекст в context.md, websearch, webfetch и structured output. В сравнении автора Qwen 3.6-plus через OpenCode Go стоила около 0,6 копейки за запрос при ответе за 15 секунд, Minimax-m2.7 — около 0,4 копейки за 8 секунд, а агентный режим — 1,7–2 копейки за 21–25 секунд; для асинхронной обработки такая задержка оказалась приемлемой.
Коротко
- В подписке OpenCode Go доступны 13 моделей, причём пять моделей Minimax и Qwen требуют Anthropic-совместимый формат запросов.
- Сервер автоматически выбирает нужный формат авторизации, системного промпта и обязательных параметров для каждой модели.
- Для каждого пользователя создаётся отдельное рабочее пространство с собственными файлами AGENTS.md и context.md.
- Решение разворачивается через Docker, использует SQLite и работает без отдельного PostgreSQL, прокси или VPN.
FAQ
Зачем автору понадобился собственный API поверх OpenCode Go, если сервис уже позволяет работать с моделями интерактивно?
Готового API для прямой интеграции в приложения автор не нашёл. Собственный сервер позволил вызывать модели и агентные функции обычными HTTP-запросами.
Как сервер скрывает различия между OpenAI-совместимыми и Anthropic-совместимыми моделями?
Клиент отправляет запрос в едином формате, а сервер сам преобразует системный промпт, заголовки авторизации и обязательные параметры под выбранного провайдера.
Как в многопользовательском режиме разделяются инструкции и долговременная память AI-агентов?
Для каждого пользователя создаётся отдельная директория с файлами AGENTS.md и context.md. Это не даёт инструкциям и контексту разных проектов смешиваться.
Читайте также
Локальный запуск LLM для SOC: сколько GPU действительно нужно?
Перевёз ИИ-агентов на российский сервер. Оказалось, полмира с ним разговаривать не хочет
Публичность или небытие: как ИИ меняет цену знания
Cannes Lions 2026: агентный AI приближается к принятию медиарешений
Meta* обсуждает продажу Anthropic вычислительных мощностей на сумму до $10 млрд
- Как оценивать LLM для извлечения структурированных данных: При выборе модели нужно отдельно проверять соблюдение JSON-схемы и правильность извлечённых значений: валидный JSON ещё не означает корректные даты, теги и описания. Тест следует проводить на нескольких сотнях реальных документов, а основной метрикой считать долю полностью пригодных результатов.
[Процессы и регламенты]
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться
Автор собрал self-hosted API поверх OpenCode Go для массовой обработки рекламных объявлений через LLM и в своём кейсе снизил стоимость запросов примерно в 12 раз. Решение объединяет модели с разными форматами API, поддерживает агентный режим и изолирует память нескольких пользователей.