Видеомонтаж в Claude Code: skill video-use

Влад Лямин7 мин чтенияclaude code видеомонтаж видео нейросетьюclaude code skillsvideo-use skill
Видеомонтаж в Claude Code: skill video-use

Надоело часами вырезать «эээ» и «ммм» из своих видео? Я сам через это проходил: записываешь ролик на десять минут, а потом полдня чистишь паузы, оговорки и повторы.

Разберём skill video-use для Claude Code: как его поставить, как он режет видео по границам слов, где реально экономит время, а где без человека не обойтись.

Что такое `video-use`

Claude Code — это не только про код. Он умеет забирать на себя любую рутину, которую можно описать алгоритмически, а монтаж разговорных видео — интервью, туториалов, вебинаров — под это описание подходит идеально: основной контент там речь.

video-use — открытый skill от команды browser-use, набор Python-скриптов поверх ffmpeg и транскрипции ElevenLabs Scribe. Лежит на GitHub под лицензией MIT, больше 17 тысяч звёзд: browser-use/video-use. Идея простая: вы кладёте исходники в папку, запускаете там Claude Code и разговариваете с ним про монтаж обычным текстом. На выходе — final.mp4.

Он сам транскрибирует материал, предлагает стратегию монтажа, режет по границам слов, накладывает цветокоррекцию, субтитры и анимационные оверлеи.

Установка

Установка — это клонирование репозитория и регистрация skill в Claude Code. Самый быстрый путь — открыть Claude Code и попросить его сделать это самому, в репозитории для этого лежит файл install.md:

Настрой мне https://github.com/browser-use/video-use. Сначала прочитай install.md, поставь репозиторий, подключи ffmpeg, зарегистрируй skill.

Дальше Claude всё делает руками, а у вас спросит только то, что не может сгенерировать сам: ключ ElevenLabs и подтверждение на brew install.

Если хочется сделать вручную, шаги такие:

git clone https://github.com/browser-use/video-use ~/Developer/video-use
cd ~/Developer/video-use
uv sync                 # или pip install -e .
brew install ffmpeg     # ffmpeg и ffprobe обязательны
mkdir -p ~/.claude/skills
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use

Последний шаг — положить ключ ElevenLabs в .env в корне репозитория:

printf 'ELEVENLABS_API_KEY=%s\n' "$KEY" > ~/Developer/video-use/.env
chmod 600 ~/Developer/video-use/.env

Симлинк делается на всю папку целиком, не на один SKILL.md: рядом должны лежать скрипты из helpers/. После этого skill вызывается в сессии как /video-use.

Как он монтирует: аудио первично, картинка по запросу

Главный принцип video-use — он не пересматривает видео покадрово. Основной источник решений — транскрипт со словными таймкодами, а в картинку он заглядывает точечно, когда надо принять спорное решение или проверить стык. Для этого есть отдельный помощник timeline_view.py, который собирает филмстрип и осциллограмму на нужном отрезке.

Это и экономит токены, и меняет саму логику: монтаж превращается в работу с текстом.

Шаг 1: инвентаризация исходников

Кладёте файлы в папку, запускаете Claude Code в ней и говорите: «сделай инвентаризацию этих дублей». Claude прогоняет ffprobe по каждому файлу и запускает транскрипцию через ElevenLabs Scribe.

Здесь принципиален word-level ASR. Обычная транскрипция даёт текст, а словное распознавание — ещё и таймкод каждого слова отдельно. Без этого невозможно резать по границам слов, а не посреди них.

Из сырых JSON собирается takes_packed.md — транскрипт, разбитый на фразы с диапазонами времени. Выглядит так:

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Девяносто процентов работы веб-агента уходит впустую.
  [006.08-006.74] S0 Мы это починили.

Это и есть главный рабочий документ: по нему видно, что где сказано и в какую секунду. Решения о склейках принимаются по нему, а не по видео.

Шаг 2: разговор и стратегия

Дальше Claude описывает, что он увидел в материале, задаёт вопросы под конкретное видео (тип контента, целевая длина и формат кадра, темп, что обязательно оставить, что вырезать) и предлагает стратегию монтажа на 4–8 предложений обычным языком.

И вот здесь заложено жёсткое правило skill: пока вы не подтвердили стратегию, он не трогает нарезку. Это не мелочь. Именно поэтому не получается ситуации, когда агент час что-то рендерил, а результат вам не нужен.

Формулировать задачу можно так, как вы объяснили бы монтажёру:

Сделай короткое промо из этого интервью. Вырежи затянутые паузы, слова-паразиты и повторы. Оставь куски, где я говорю про внедрение ИИ и реальные кейсы. Финал — не больше трёх минут.

Кстати, об автоматизации рутины: я недавно писал, как Claude Sonnet 5 и n8n закрывают похожие задачи в других процессах.

Шаг 3: монтаж

После подтверждения решения записываются в edl.json (Edit Decision List) — список отрезков с источником, началом, концом и причиной, по которой кусок взят. Дальше render.py собирает по нему финал:

  • Склейка по границам слов. Каждый край подрезки привязан к границе слова из транскрипта, плюс паддинг 30–200 мс. Таймкоды Scribe плавают на 50–100 мс, и этот запас гасит расхождение.
  • Цветокоррекция. Применяется на этапе извлечения каждого отрезка, а не после склейки — иначе видео перекодируется дважды. Есть пресеты, есть возможность передать свою ffmpeg-цепочку.
  • Анимации. Простые оверлеи (счётчики, текст с печатной машинкой, плашки) собираются через PIL и последовательность PNG. Для сложного есть HyperFrames, Remotion и Manim — движок выбирается под конкретный слот.
  • Субтитры. Накладываются последними в цепочке фильтров. Если наложить их до оверлеев, оверлеи их просто закроют.

Ещё пара правил, которые вшиты в skill и снимают типовые косяки: 30-мс аудиофейд на каждом стыке (без него на склейках слышны щелчки) и запрет резать внутри слова.

Шаг 4: самопроверка

Skill не отдаёт файл сразу. Сначала он прогоняет timeline_view по собственному рендеру на каждом стыке и смотрит: нет ли скачка картинки, нет ли всплеска на осциллограмме (то есть щелчка, который проскочил мимо фейда), не спрятался ли субтитр за оверлеем. Плюс сверяет фактическую длительность с ожидаемой через ffprobe.

Если что-то не так — правит и рендерит заново, максимум три круга. Дальше выносит проблему вам. Черновик вы получаете уже проверенным, а не сырым.

Когда `video-use` заменяет монтажёра, а когда нет

ИИ-инструмент здесь не заменяет человека целиком, он снимает нижний слой работы.

Где он закрывает задачу

  • Рутина. Вырезание пауз и слов-паразитов, перекодирование, субтитры по транскрипции. На разговорных видео это основная часть времени монтажа.
  • Скорость. Не нужно ждать, пока освободится монтажёр, и не нужно писать ТЗ на правку одной склейки.
  • Первичная сборка. Собрать «рыбу», посмотреть, что вообще получается из материала, и только потом решать, стоит ли доводить руками.

Где нужен человек

  • Драматургия. Ритм, эмоциональное кадрирование, саунд-дизайн, подбор музыки под настроение.
  • Выбор между хорошими дублями. Если два дубля равны по смыслу и отличаются интонацией, решение за вами.
  • Сложная графика и VFX. ffmpeg и PIL закрывают оверлеи и простую моушн-графику, но не сложный композитинг.

Про ожидания от ИИ вообще: я разбирал это в статье ROI ИИ: формула, которую скрывают интеграторы — метрики и границы применимости надо определять до внедрения, а не после.

Как встроить это в работу

Если вы регулярно записываете вебинары, интервью или обучающие ролики, схема простая: сложили исходники в папку, запустили Claude Code в ней, описали желаемый результат словами, получили черновик за несколько минут вместо вечера ручной чистки.

Я использую это для коротких видео в соцсети и для внутренних туториалов. Ощутимая часть рутины уходит, а время освобождается под то, что дальше приходится делать головой: содержание, структура, подача.

Частые вопросы

Подойдёт ли `video-use` для игровых видео?

Он рассчитан на разговорные видео, где смысл несёт речь. Для динамичной картинки без внятной звуковой дорожки возможности ограничены: решения принимаются по транскрипту, а транскрибировать там нечего.

Какие форматы поддерживаются?

Всё, что умеет ffmpeg: MP4, MOV, AVI, MKV, WAV, MP3 и прочее. Отдельного списка ограничений у skill нет.

Нужно ли уметь программировать?

Для установки достаточно уметь работать с терминалом: клонировать репозиторий, поставить ffmpeg, прописать ключ. Дальше монтаж идёт разговором. Базовый Python и ffmpeg понадобятся, только если захотите свои цветокоррекционные цепочки или кастомные анимации.

Как он справляется с акцентами и плохим звуком?

Это зависит от движка распознавания. ElevenLabs Scribe держит удар неплохо, но идеального распознавания не бывает — на плохом звуке транскрипт придётся вычитывать глазами перед тем, как утверждать стратегию.

Можно ли работать с несколькими аудиодорожками?

ffmpeg это позволяет, так что технически да. Но это не готовая кнопка: multitrack-сценарий придётся проговаривать отдельно и проверять результат руками.

Сколько это стоит?

Сам skill бесплатный. Платить нужно за транскрипцию в ElevenLabs — расход считается по длительности исходников. Транскрипты кешируются, поэтому один и тот же материал не оплачивается дважды при повторных итерациях монтажа.


Хотите системно разобраться в работе с Claude, чтобы автоматизировать рутину и освободить время под стратегические задачи? У меня есть гайд «Claude как рабочий инструмент» — готовые системы и команды, которые настраиваются за вечер и применяются сразу.

Получить гайд «Claude как рабочий инструмент»

AI-аудит

Автоматизируйте свой бизнес с AI

Напишите «Аудит» в Telegram — разберу ваши процессы и предложу конкретное решение

Написать в Telegram →