Как AI-агент и локальные модели помогли за вечер разобрать 36 000 фотографий и почту с 2005 года

Автор описывает практический кейс: AI-агент и локальные модели помогли разобрать почту с 2005 года и фотоархив примерно на 36 000 файлов. Главная ценность — не «AI всё сделал сам», а рабочая схема, где агент пишет скрипты и контролирует качество, локальные модели перемалывают массив, а человек принимает решения.

Задача началась с нехватки места в почте: агент получил доступ к Gmail API, проанализировал письма по отправителям, размерам и годам, отправил около 9 500 рекламных и уведомительных писем в Корзину и помог восстановить ошибочно задетую рабочую рассылку. Тяжёлые письма оказались отдельным фотоархивом: агент не просто вытащил вложения, а по темам, содержанию писем и выборочному просмотру фото объединил разрозненные письма в реальные события.

После этого в работу попал старый архив OneDrive: 36 659 файлов и 222 ГБ за 20 лет. Фронтир-модель не просматривала всё напрямую, потому что это дорого и бессмысленно по контексту; вместо этого тяжёлый разбор ушёл локальным моделям. Claude Code / Opus 4.8 выступал оркестратором: писал одноразовые скрипты, запускал czkawka для дедупликации, open_clip для грубих тегов, Qwen2.5-VL на MLX для описаний событий, InsightFace для лиц и exiftool для записи тегов в файлы.

В результате дубли ушли в карантин, документы и скриншоты отделились от фотографий, лица были сгруппированы в 2 153 кластера, а часто встречающиеся люди получили имена в XMP/IPTC-тегах. Для 1 754 видео использовали тот же стек через кадры из ffmpeg: после двух проходов людей нашли в 608 роликах. Итоговая структура — около 36 000 фото и видео примерно в 490 папках-событиях за 26 лет, с undo-логом для перемещений и обратимыми решениями; полный импорт в Apple Photos ещё не завершён, но основной бардак уже разобран.

Коротко

  • Архив вырос из задачи почистить почту: агент нашёл тяжёлые письма с фото и помог перенести их в Apple Photos.
  • В OneDrive разобрали 36 659 файлов и 222 ГБ: дубли ушли в карантин, документы отделены, события собраны в папки.
  • Локальные модели закрыли тяжёлую часть: open_clip тегировал фото, Qwen2.5-VL описывал события, InsightFace кластеризовал лица.
  • Распознавание лиц дало 2 153 кластера-персоны; после ручной разметки частых людей имена записали в XMP/IPTC-теги файлов.
  • Для 1 754 видео брали кадры через ffmpeg; после двух проходов людей удалось распознать в 608 роликах.

FAQ

Зачем в этом кейсе понадобились одновременно AI-агент, локальные модели и человек, а не один универсальный чат-бот?

Большой архив невыгодно прогонять через фронтир-модель целиком: это долго, дорого и плохо помещается в контекст. Агент управлял пайплайном, локальные модели обрабатывали массив, а человек подтверждал смысловые решения.

Как в кейсе снижали риск ошибочного удаления писем, дублей и важных файлов при автоматической обработке архива?

Все опасные действия сделали обратимыми: письма отправлялись в Корзину, дубли — в карантин, перемещения фиксировались в undo-логе. Финальное удаление без подтверждения человека не использовалось.

Почему автор не стал доверять только EXIF-датам при сортировке фотографий по годам и событиям?

У старых камер EXIF мог показывать неверную дату, например 2005-01-01, а у сканов часто отражал дату оцифровки. При расхождениях агенту предложили доверять названию исходной папки.

Читайте также

  1. ИИ-агенты для бизнеса в России: обзор 10 локальных платформ и решений
  2. Три четверти сотрудников рекламных агентств готовы уйти из-за тендеров
  3. Субагенты в Claude Code
  4. Несколько LLM-агентов в одном Chrome: как изолировать вкладки и сохранить логины
  5. Инструменты для подготовки сайта к работе с AI-агентами
Ключевые инсайты из новости (по версии ChatGPT)
  • Разделение ролей в AI-пайплайне для больших архивов: Для задач с десятками тысяч файлов фронтир-модель не нужно использовать как основной вычислительный движок: это дорого, медленно и плохо масштабируется по контексту. Более практичная схема — фронтир-агент пишет скрипты, связывает инструменты и проверяет качество, локальные модели выполняют массовую обработку, а человек принимает смысловые решения.
    [AI-процессы и автоматизация]
Для получения полного доступа оформите подписку PubMag PRO.
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться
Инсайты автоматически генерируются с помощью искусственного интеллекта на основе текста статьи.
← Назад в лентуЧитать оригинал →
✈️ Подписывайтесь на мой Telegram-канал — там еще больше интересного про AdTech, MarTech, AI и многое другое!