- Adobe выпускает три новых аудиоинструмента с искусственным интеллектом для Firefly.
- Теперь авторы могут использовать функции «Создать музыку», «Создать речь» и «Создать звуковые эффекты».
- Я опробовал их, чтобы посмотреть, как они работают при создании видео
После некоторого пребывания в бета-версии Adobe Firefly теперь представила три новых аудиоинструмента на базе искусственного интеллекта, обещающих «звук студийного качества», доступных всем создателям. Я поиграл с каждым из них, чтобы увидеть, были ли результаты такими хорошими, как обещали, и в целом они оправдали себя, с некоторыми странностями.
«Создание музыки», «Создание звуковых эффектов» и «Создание речи» — это новейшие аудиофункции, появившиеся на браузерной платформе искусственного интеллекта Adobe (нет призов за то, что вы угадаете, что делает каждая из них (извините)). Судя по моим экспериментам со всеми тремя, Generate Music является здесь самым ярким моментом, он намного лучше, чем я думал, и я вижу, что маркетологи и создатели получают от него серьезную пользу. Вы можете попробовать их сами, нажав здесь.
Запуск совпадает с недавним опросом, проведенным Adobe совместно с музыкальным колледжем Беркли: 32,7% создателей видео, музыкантов и маркетологов подтвердили, что используют музыку, сгенерированную искусственным интеллектом, «в качестве финального трека в своих опубликованных работах». И я подозреваю, что именно эта значительная цифра является движущей силой этого конкретного обновления.
Итак, что нового?
Теперь каждому доступны три инструмента искусственного интеллекта. Все они говорят сами за себя, но вот что вам нужно знать.
- Создать музыку позволяет создавать лицензионные треки, соответствующие продолжительности и настроению ваших видео.
- Создать речь использует сценарии и превращает их в озвучку.
- Создавать звуковые эффекты создает – как вы уже догадались – звуковые эффекты, соответствующие действию и времени видео.
Но хороши ли они?
Ранее я писал о своем агностицизме по отношению к ИИ в целом и о своих проблемах с его использованием в творческой работе. Это факсимиле искусства.
Тем не менее, инструменты Adobe впечатлили даже самых скептиков искусственного интеллекта в моей команде, особенно такие функции, как Generative Extend в ее программном обеспечении для редактирования видео. И я никто, если не открытый. Итак, я решил опробовать эти инструменты на себе, чтобы выяснить, что здесь происходит на самом деле.
Основное внимание здесь, по крайней мере на данный момент, уделяется ускорению творческих рабочих процессов для маркетологов и создателей контента.
Создание музыки с использованием ИИ

Я начал с Создать музыку, где вы можете свободно подсказать или загрузить видео, а ИИ сам определит, какую музыку вы хотите. Я использовал короткий 27-секундный ролик, снятый мной для своего обзора reMarkable Paper Pure (в основном потому, что он все еще находился в моей папке загрузок).
Основываясь на этом, Firefly предложил идею «спокойной, вдумчивой песни в стиле эмбиент-электроники для демонстрации продукта».
Я нажал «Создать», и через пару секунд (это на самом деле впечатляюще быстро) мне предложили на выбор четыре трека, все разные, но с одной и той же атмосферой. Они были... ок. Немного стандартно, но в крайнем случае сгодятся. Или ускорить завершение проекта.
Я решил добавить в подсказку еще несколько терминов, например «джаз», «кинематографический», для использования в «влоге» и «трейлере». Я изменил Энергию с «низкой» на «среднюю». Результаты были большим улучшением.
Как и во всех инструментах искусственного интеллекта, чем больше подсказок, тем лучше результат, и есть возможность самостоятельно описать атмосферу, стиль и цель, если у вас есть идея.
Вы можете скачать музыку и видео или только музыку отсюда.
Создание озвучки с помощью ИИ

Переключившись на Создать речь, я сначала использовал боковую панель, чтобы определить, какую модель искусственного интеллекта использовать — на момент написания статьи существовала коммерчески безопасная модель Firefly от Adobe и партнерская модель ElevenLabs Multilingual V2.
Затем я выбрал говорящего из списка из 45 человек, каждый из которых по-разному описывался как мужчина, женщина, небинарный человек, молодой человек, средний возраст, пожилой и так далее.
Наконец, я вставил свой текст в текстовое поле — Firefly может определить, какой язык я использую, но у вас есть возможность выбрать его самостоятельно. Я использовал стихотворение Озимандиас (приношу величайшие извинения Шелли).
Что мне здесь понравилось, так это то, что, имея текст на месте, вы можете добавить дополнительный текст или попросить ИИ сделать паузу в определенных местах.
Для предварительного просмотра мне пришлось выделить весь отрывок и использовать для этого контекстное меню (здесь вы также исправляете произношение и регулируете тон голоса).
Несмотря на все разговоры об ускорении рабочих процессов, мне это кажется ошибкой. Для этого просто нужна кнопка воспроизведения внизу экрана.
Мне пришлось настроить паузы, чтобы текстовое пространство могло дышать, и, установив их, я мог изменить время, щелкнув паузу на экране предварительного просмотра. И по какой-то причине именно слово «земля» сбило с толку ИИ, где оно произносилось как «lan».
Создание AI SFX

Для этого теста я снова использовал видео, снятое для моего обзора reMarkable — на этот раз 12-секундный ролик, сравнивающий reMarkable 2 с Paper Pure.
Этот процесс гораздо более глубокий в том смысле, что ИИ не будет угадывать, какими должны быть вероятные звуковые эффекты. Мне пришлось вручную описывать то, что я хотел. После этого я нажал «Улучшить подсказку», что добавило больше описаний.
В итоге мы получаем «скользящий свист, мягко спускающийся с металлическим тембром и нежным резонансом». Нажав «Создать», сервис быстро создал четыре потрясающих варианта. Я не буду подвергать вас этим результатам. Это несправедливо по отношению к кому-либо.
Вместо этого я изменил подсказку на более успокаивающую «сверчки в поле» продолжительностью 12 секунд, чтобы заполнить длину видео.
Что хорошо в опции SFX, так это то, что вы можете добавить несколько звуковых дорожек и использовать маркеры для настройки их положения.
С временной шкалой, растянутой по нижней части экрана, он больше похож на настоящий аудиоредактор (по крайней мере, в некоторой степени). Потяните ручки звука, и вы сможете дополнительно отрегулировать громкость или удалить трек.
Стоит ли оно того?
В целом, я хотел бы увидеть здесь некоторые изменения пользовательского интерфейса, которые ускорят рабочие процессы.
Не думаю, что в ближайшее время они заменят профессиональных звукорежиссеров, композиторов и музыкантов. Но, работая в сфере маркетинга, я вижу, что у них есть место для маркетологов и повседневного создания видео.
Речь – это мир, далекий от времен роботов, похожих на Microsoft Sam, но в плане передачи нюансов ничто не сравнится с исполнителем в кабинке.
Однако у Sound Effects гораздо больше полезности. В разных поколениях я не мог отличить звуки AI от тех, которые воспроизводятся на моем старом компакт-диске SFX.
Настоящим победителем здесь является Generate Music. Даже базовая подсказка содержала звук, который не выглядел бы неуместным в демонстрации продукта, обзоре, бизнес-объяснении и т. д. И с каждым поколением, которое я создавал, ситуация становилась лучше.
Обновление, которое стоит изучить для быстрого производства видео. 