Как AI-агент и локальные модели помогли за вечер разобрать 36 000 фотографий и почту с 2005 года
Задача началась с нехватки места в почте: агент получил доступ к Gmail API, проанализировал письма по отправителям, размерам и годам, отправил около 9 500 рекламных и уведомительных писем в Корзину и помог восстановить ошибочно задетую рабочую рассылку. Тяжёлые письма оказались отдельным фотоархивом: агент не просто вытащил вложения, а по темам, содержанию писем и выборочному просмотру фото объединил разрозненные письма в реальные события.
После этого в работу попал старый архив OneDrive: 36 659 файлов и 222 ГБ за 20 лет. Фронтир-модель не просматривала всё напрямую, потому что это дорого и бессмысленно по контексту; вместо этого тяжёлый разбор ушёл локальным моделям. Claude Code / Opus 4.8 выступал оркестратором: писал одноразовые скрипты, запускал czkawka для дедупликации, open_clip для грубих тегов, Qwen2.5-VL на MLX для описаний событий, InsightFace для лиц и exiftool для записи тегов в файлы.
В результате дубли ушли в карантин, документы и скриншоты отделились от фотографий, лица были сгруппированы в 2 153 кластера, а часто встречающиеся люди получили имена в XMP/IPTC-тегах. Для 1 754 видео использовали тот же стек через кадры из ffmpeg: после двух проходов людей нашли в 608 роликах. Итоговая структура — около 36 000 фото и видео примерно в 490 папках-событиях за 26 лет, с undo-логом для перемещений и обратимыми решениями; полный импорт в Apple Photos ещё не завершён, но основной бардак уже разобран.
Коротко
- Архив вырос из задачи почистить почту: агент нашёл тяжёлые письма с фото и помог перенести их в Apple Photos.
- В OneDrive разобрали 36 659 файлов и 222 ГБ: дубли ушли в карантин, документы отделены, события собраны в папки.
- Локальные модели закрыли тяжёлую часть: open_clip тегировал фото, Qwen2.5-VL описывал события, InsightFace кластеризовал лица.
- Распознавание лиц дало 2 153 кластера-персоны; после ручной разметки частых людей имена записали в XMP/IPTC-теги файлов.
- Для 1 754 видео брали кадры через ffmpeg; после двух проходов людей удалось распознать в 608 роликах.
FAQ
Зачем в этом кейсе понадобились одновременно AI-агент, локальные модели и человек, а не один универсальный чат-бот?
Большой архив невыгодно прогонять через фронтир-модель целиком: это долго, дорого и плохо помещается в контекст. Агент управлял пайплайном, локальные модели обрабатывали массив, а человек подтверждал смысловые решения.
Как в кейсе снижали риск ошибочного удаления писем, дублей и важных файлов при автоматической обработке архива?
Все опасные действия сделали обратимыми: письма отправлялись в Корзину, дубли — в карантин, перемещения фиксировались в undo-логе. Финальное удаление без подтверждения человека не использовалось.
Почему автор не стал доверять только EXIF-датам при сортировке фотографий по годам и событиям?
У старых камер EXIF мог показывать неверную дату, например 2005-01-01, а у сканов часто отражал дату оцифровки. При расхождениях агенту предложили доверять названию исходной папки.
Читайте также
- Разделение ролей в AI-пайплайне для больших архивов: Для задач с десятками тысяч файлов фронтир-модель не нужно использовать как основной вычислительный движок: это дорого, медленно и плохо масштабируется по контексту. Более практичная схема — фронтир-агент пишет скрипты, связывает инструменты и проверяет качество, локальные модели выполняют массовую обработку, а человек принимает смысловые решения.
[AI-процессы и автоматизация]
Зарегистрированные пользователи видят только два тезиса.
Зарегистрироваться



Автор описывает практический кейс: AI-агент и локальные модели помогли разобрать почту с 2005 года и фотоархив примерно на 36 000 файлов. Главная ценность — не «AI всё сделал сам», а рабочая схема, где агент пишет скрипты и контролирует качество, локальные модели перемалывают массив, а человек принимает решения.