Как автор снизил стоимость обработки данных с помощью ИИ в 12 раз

Автор собрал self-hosted API поверх OpenCode Go для массовой обработки рекламных объявлений через LLM и в своём кейсе снизил стоимость запросов примерно в 12 раз. Решение объединяет модели с разными форматами API, поддерживает агентный режим и изолирует память нескольких пользователей.

Задача требовала извлекать из десятков тысяч объявлений даты, теги, стоимость и другие данные в строго валидный JSON. В тесте на нескольких сотнях реальных сообщений бесплатные модели примерно в 40% случаев нарушали схему, Qwen 3.5-Flash давала правильный результат в 95% запросов, Mistral 3.5 — в 80–85%, а GPT 5-nano — в 100%, но стоила 10–12 копеек за запрос.

OpenCode Go предлагает подписку за $5 в месяц с $60 кредитов на модели, что для первых $60 использования даёт 12-кратную разницу в цене относительно прямой оплаты токенов. Поскольку готового API для интеграции автор не нашёл, он написал сервер на Express.js и SQLite, который преобразует единый входной запрос в OpenAI- или Anthropic-совместимый формат в зависимости от выбранной модели.

Сервер также открывает через HTTP агентные функции OpenCode: системные инструкции из AGENTS.md, долговременный контекст в context.md, websearch, webfetch и structured output. В сравнении автора Qwen 3.6-plus через OpenCode Go стоила около 0,6 копейки за запрос при ответе за 15 секунд, Minimax-m2.7 — около 0,4 копейки за 8 секунд, а агентный режим — 1,7–2 копейки за 21–25 секунд; для асинхронной обработки такая задержка оказалась приемлемой.

Коротко

  • В подписке OpenCode Go доступны 13 моделей, причём пять моделей Minimax и Qwen требуют Anthropic-совместимый формат запросов.
  • Сервер автоматически выбирает нужный формат авторизации, системного промпта и обязательных параметров для каждой модели.
  • Для каждого пользователя создаётся отдельное рабочее пространство с собственными файлами AGENTS.md и context.md.
  • Решение разворачивается через Docker, использует SQLite и работает без отдельного PostgreSQL, прокси или VPN.

FAQ

Зачем автору понадобился собственный API поверх OpenCode Go, если сервис уже позволяет работать с моделями интерактивно?

Готового API для прямой интеграции в приложения автор не нашёл. Собственный сервер позволил вызывать модели и агентные функции обычными HTTP-запросами.

Как сервер скрывает различия между OpenAI-совместимыми и Anthropic-совместимыми моделями?

Клиент отправляет запрос в едином формате, а сервер сам преобразует системный промпт, заголовки авторизации и обязательные параметры под выбранного провайдера.

Как в многопользовательском режиме разделяются инструкции и долговременная память AI-агентов?

Для каждого пользователя создаётся отдельная директория с файлами AGENTS.md и context.md. Это не даёт инструкциям и контексту разных проектов смешиваться.

Читайте также

  1. Локальный запуск LLM для SOC: сколько GPU действительно нужно?
  2. Перевёз ИИ-агентов на российский сервер. Оказалось, полмира с ним разговаривать не хочет
  3. Публичность или небытие: как ИИ меняет цену знания
  4. Cannes Lions 2026: агентный AI приближается к принятию медиарешений
  5. Meta* обсуждает продажу Anthropic вычислительных мощностей на сумму до $10 млрд
Ключевые инсайты из новости (по версии ChatGPT)
  • Как оценивать LLM для извлечения структурированных данных: При выборе модели нужно отдельно проверять соблюдение JSON-схемы и правильность извлечённых значений: валидный JSON ещё не означает корректные даты, теги и описания. Тест следует проводить на нескольких сотнях реальных документов, а основной метрикой считать долю полностью пригодных результатов.
    [Процессы и регламенты]
Для получения полного доступа оформите подписку PubMag PRO.
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться
Инсайты автоматически генерируются с помощью искусственного интеллекта на основе текста статьи.
← Назад в лентуЧитать оригинал →
✈️ Подписывайтесь на мой Telegram-канал — там еще больше интересного про AdTech, MarTech, AI и многое другое!