Видеомонтаж в Claude Code: skill video-use

Надоело часами вырезать «эээ» и «ммм» из своих видео? Я сам через это проходил: записываешь ролик на десять минут, а потом полдня чистишь паузы, оговорки и повторы.
Разберём skill video-use для Claude Code: как его поставить, как он режет видео по границам слов, где реально экономит время, а где без человека не обойтись.
Что такое `video-use`
Claude Code — это не только про код. Он умеет забирать на себя любую рутину, которую можно описать алгоритмически, а монтаж разговорных видео — интервью, туториалов, вебинаров — под это описание подходит идеально: основной контент там речь.
video-use — открытый skill от команды browser-use, набор Python-скриптов поверх ffmpeg и транскрипции ElevenLabs Scribe. Лежит на GitHub под лицензией MIT, больше 17 тысяч звёзд: browser-use/video-use. Идея простая: вы кладёте исходники в папку, запускаете там Claude Code и разговариваете с ним про монтаж обычным текстом. На выходе — final.mp4.
Он сам транскрибирует материал, предлагает стратегию монтажа, режет по границам слов, накладывает цветокоррекцию, субтитры и анимационные оверлеи.
Установка
Установка — это клонирование репозитория и регистрация skill в Claude Code. Самый быстрый путь — открыть Claude Code и попросить его сделать это самому, в репозитории для этого лежит файл install.md:
Настрой мне https://github.com/browser-use/video-use. Сначала прочитай install.md, поставь репозиторий, подключи ffmpeg, зарегистрируй skill.
Дальше Claude всё делает руками, а у вас спросит только то, что не может сгенерировать сам: ключ ElevenLabs и подтверждение на brew install.
Если хочется сделать вручную, шаги такие:
git clone https://github.com/browser-use/video-use ~/Developer/video-use
cd ~/Developer/video-use
uv sync # или pip install -e .
brew install ffmpeg # ffmpeg и ffprobe обязательны
mkdir -p ~/.claude/skills
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
Последний шаг — положить ключ ElevenLabs в .env в корне репозитория:
printf 'ELEVENLABS_API_KEY=%s\n' "$KEY" > ~/Developer/video-use/.env
chmod 600 ~/Developer/video-use/.env
Симлинк делается на всю папку целиком, не на один SKILL.md: рядом должны лежать скрипты из helpers/. После этого skill вызывается в сессии как /video-use.
Как он монтирует: аудио первично, картинка по запросу
Главный принцип video-use — он не пересматривает видео покадрово. Основной источник решений — транскрипт со словными таймкодами, а в картинку он заглядывает точечно, когда надо принять спорное решение или проверить стык. Для этого есть отдельный помощник timeline_view.py, который собирает филмстрип и осциллограмму на нужном отрезке.
Это и экономит токены, и меняет саму логику: монтаж превращается в работу с текстом.
Шаг 1: инвентаризация исходников
Кладёте файлы в папку, запускаете Claude Code в ней и говорите: «сделай инвентаризацию этих дублей». Claude прогоняет ffprobe по каждому файлу и запускает транскрипцию через ElevenLabs Scribe.
Здесь принципиален word-level ASR. Обычная транскрипция даёт текст, а словное распознавание — ещё и таймкод каждого слова отдельно. Без этого невозможно резать по границам слов, а не посреди них.
Из сырых JSON собирается takes_packed.md — транскрипт, разбитый на фразы с диапазонами времени. Выглядит так:
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Девяносто процентов работы веб-агента уходит впустую.
[006.08-006.74] S0 Мы это починили.
Это и есть главный рабочий документ: по нему видно, что где сказано и в какую секунду. Решения о склейках принимаются по нему, а не по видео.
Шаг 2: разговор и стратегия
Дальше Claude описывает, что он увидел в материале, задаёт вопросы под конкретное видео (тип контента, целевая длина и формат кадра, темп, что обязательно оставить, что вырезать) и предлагает стратегию монтажа на 4–8 предложений обычным языком.
И вот здесь заложено жёсткое правило skill: пока вы не подтвердили стратегию, он не трогает нарезку. Это не мелочь. Именно поэтому не получается ситуации, когда агент час что-то рендерил, а результат вам не нужен.
Формулировать задачу можно так, как вы объяснили бы монтажёру:
Сделай короткое промо из этого интервью. Вырежи затянутые паузы, слова-паразиты и повторы. Оставь куски, где я говорю про внедрение ИИ и реальные кейсы. Финал — не больше трёх минут.
Кстати, об автоматизации рутины: я недавно писал, как Claude Sonnet 5 и n8n закрывают похожие задачи в других процессах.
Шаг 3: монтаж
После подтверждения решения записываются в edl.json (Edit Decision List) — список отрезков с источником, началом, концом и причиной, по которой кусок взят. Дальше render.py собирает по нему финал:
- Склейка по границам слов. Каждый край подрезки привязан к границе слова из транскрипта, плюс паддинг 30–200 мс. Таймкоды Scribe плавают на 50–100 мс, и этот запас гасит расхождение.
- Цветокоррекция. Применяется на этапе извлечения каждого отрезка, а не после склейки — иначе видео перекодируется дважды. Есть пресеты, есть возможность передать свою ffmpeg-цепочку.
- Анимации. Простые оверлеи (счётчики, текст с печатной машинкой, плашки) собираются через PIL и последовательность PNG. Для сложного есть HyperFrames, Remotion и Manim — движок выбирается под конкретный слот.
- Субтитры. Накладываются последними в цепочке фильтров. Если наложить их до оверлеев, оверлеи их просто закроют.
Ещё пара правил, которые вшиты в skill и снимают типовые косяки: 30-мс аудиофейд на каждом стыке (без него на склейках слышны щелчки) и запрет резать внутри слова.
Шаг 4: самопроверка
Skill не отдаёт файл сразу. Сначала он прогоняет timeline_view по собственному рендеру на каждом стыке и смотрит: нет ли скачка картинки, нет ли всплеска на осциллограмме (то есть щелчка, который проскочил мимо фейда), не спрятался ли субтитр за оверлеем. Плюс сверяет фактическую длительность с ожидаемой через ffprobe.
Если что-то не так — правит и рендерит заново, максимум три круга. Дальше выносит проблему вам. Черновик вы получаете уже проверенным, а не сырым.
Когда `video-use` заменяет монтажёра, а когда нет
ИИ-инструмент здесь не заменяет человека целиком, он снимает нижний слой работы.
Где он закрывает задачу
- Рутина. Вырезание пауз и слов-паразитов, перекодирование, субтитры по транскрипции. На разговорных видео это основная часть времени монтажа.
- Скорость. Не нужно ждать, пока освободится монтажёр, и не нужно писать ТЗ на правку одной склейки.
- Первичная сборка. Собрать «рыбу», посмотреть, что вообще получается из материала, и только потом решать, стоит ли доводить руками.
Где нужен человек
- Драматургия. Ритм, эмоциональное кадрирование, саунд-дизайн, подбор музыки под настроение.
- Выбор между хорошими дублями. Если два дубля равны по смыслу и отличаются интонацией, решение за вами.
- Сложная графика и VFX.
ffmpegи PIL закрывают оверлеи и простую моушн-графику, но не сложный композитинг.
Про ожидания от ИИ вообще: я разбирал это в статье ROI ИИ: формула, которую скрывают интеграторы — метрики и границы применимости надо определять до внедрения, а не после.
Как встроить это в работу
Если вы регулярно записываете вебинары, интервью или обучающие ролики, схема простая: сложили исходники в папку, запустили Claude Code в ней, описали желаемый результат словами, получили черновик за несколько минут вместо вечера ручной чистки.
Я использую это для коротких видео в соцсети и для внутренних туториалов. Ощутимая часть рутины уходит, а время освобождается под то, что дальше приходится делать головой: содержание, структура, подача.
Частые вопросы
Подойдёт ли `video-use` для игровых видео?
Он рассчитан на разговорные видео, где смысл несёт речь. Для динамичной картинки без внятной звуковой дорожки возможности ограничены: решения принимаются по транскрипту, а транскрибировать там нечего.
Какие форматы поддерживаются?
Всё, что умеет ffmpeg: MP4, MOV, AVI, MKV, WAV, MP3 и прочее. Отдельного списка ограничений у skill нет.
Нужно ли уметь программировать?
Для установки достаточно уметь работать с терминалом: клонировать репозиторий, поставить ffmpeg, прописать ключ. Дальше монтаж идёт разговором. Базовый Python и ffmpeg понадобятся, только если захотите свои цветокоррекционные цепочки или кастомные анимации.
Как он справляется с акцентами и плохим звуком?
Это зависит от движка распознавания. ElevenLabs Scribe держит удар неплохо, но идеального распознавания не бывает — на плохом звуке транскрипт придётся вычитывать глазами перед тем, как утверждать стратегию.
Можно ли работать с несколькими аудиодорожками?
ffmpeg это позволяет, так что технически да. Но это не готовая кнопка: multitrack-сценарий придётся проговаривать отдельно и проверять результат руками.
Сколько это стоит?
Сам skill бесплатный. Платить нужно за транскрипцию в ElevenLabs — расход считается по длительности исходников. Транскрипты кешируются, поэтому один и тот же материал не оплачивается дважды при повторных итерациях монтажа.
Хотите системно разобраться в работе с Claude, чтобы автоматизировать рутину и освободить время под стратегические задачи? У меня есть гайд «Claude как рабочий инструмент» — готовые системы и команды, которые настраиваются за вечер и применяются сразу.
AI-аудит
Автоматизируйте свой бизнес с AI
Напишите «Аудит» в Telegram — разберу ваши процессы и предложу конкретное решение
Написать в Telegram →