Большинство AI-инструментов не «видят» видео — они читают текстовую расшифровку. ChatGPT обрабатывает только транскрипт по ссылке на YouTube. Claude вообще не принимает видеофайл. Даже Gemini, который умеет работать с видео, по умолчанию берёт лишь один кадр в секунду и проглатывает быстрые склейки. Всё это работает либо через облако, либо через фиксированный интервал, что плохо: на статичной презентации получаешь 600 одинаковых картинок, а в динамичном ролике теряешь кучу сцен.
Инструмент claude-real-video (сокращённо crv) решает эту задачу иначе — и локально. Он не перебирает кадры по таймеру, а находит реальные смены сцен (scene-change detection), выбрасывает почти одинаковые дубликаты (sliding-window dedup), транскрибирует аудио через Whisper и собирает чистую папку, которую можно скормить любой LLM: Claude, ChatGPT или Gemini. Ничего никуда не загружается — всё на твоей машине.
Утилита анализирует каждый сюжетный стык и дополнительно гарантирует хотя бы один кадр каждые N секунд (параметр --fps-floor), чтобы не пропустить медленный слайд. Дубликаты отсекаются не хешем, а реальной попиксельной разницей (downscaled RGB) — это не слепнет на плоских заливках и цветных переходах. Если в клипе был монтаж A-B-A, скользящее окно из последних 4 сохранённых кадров (по умолчанию) не отправит модельке один и тот же шот дважды.
В итоге на выходе: папка с ключевыми *.jpg, MANIFEST.txt с кратким содержанием и transcript.txt. Аудиодорожку можно сохранить отдельно через --keep-audio — она пригодится мультимодальным моделям вроде Gemini, которые «слушают» не только слова, но и музыку с интонацией. Если в видео уже есть субтитры (встроенные или рядом с файлом), crv использует их — это точнее и быстрее перетранскрибации.
Система требует Python 3.10+ и ffmpeg в PATH. Установка — pip install claude-real-video (с опциональным [whisper] для расшифровки). Лицензия — MIT, код открыт. Единственное жёсткое правило: качать и обрабатывать можно только то, на что у тебя есть права.