Adobe Firefly, AI 음성 생성 도구 3종을 일반 공개
어도비는 AI 플랫폼 'Firefly'에 음악·나레이션·효과음을 생성하는 3가지 AI 음성 도구를 일반 사용자에게 제공 개시했다. 생성 콘텐츠는 모두 로열티프리로 동영상 제작에 활용할 수 있다. 동시에 Google의 AI 모델 'Gemini 2.0 Flash'도 Firefly에 통합되었다.

어도비는 크리에이티브 향 AI 플랫폼 'Firefly'에서 음성 관련 AI 도구 3종을 광범위하게 일반 사용자에게 제공 개시했다. 추가된 것은 'Generate Music(음악 생성)', 'Generate Speech(음성·나레이션 생성)', 'Generate Sound Effects(효과음 생성)'의 3가지 기능으로, 모두 동영상 제작용으로 로열티프리 콘텐츠를 생성할 수 있다. 또한 동시에 Google의 AI 모델 'Gemini 2.0 Flash'도 Firefly 플랫폼에 통합되었다.
근년, 동영상 콘텐츠 제작은 전문가인 크리에이터뿐만 아니라 기업의 마케터, 교육자, 개인 크리에이터 등 광범위한 층으로 확산되고 있다. 그러나 지금까지 동영상에 맞는 음악이나 나레이션을 준비하려면 음악 제작자에게 의뢰하거나 음원 라이브러리를 구입할 필요가 있었으며, 비용과 수고 측면에서 진입 장벽이 높았다. 어도비가 이러한 음성 생성 기능을 Firefly에 포함시킨 배경에는 영상과 음의 양측면을 하나의 플랫폼에서 완결하고 싶다는 크리에이터의 수요가 있는 것으로 보인다.
이번 일반 공개된 3가지 도구를 구체적으로 확인해보면, Generate Music은 장면이나 분위기에 맞춘 곡을 자동 생성하는 기능이다. Generate Speech는 텍스트를 입력하기만 하면 자연스러운 나레이션 음성을 작성할 수 있으며, 동영상의 해설이나 프레젠테이션 자료 만들기에 활용할 수 있다. Generate Sound Effects는 장면에 따른 환경음이나 효과음을 생성하는 기능으로, 영상의 현실감이나 연출 효과를 높이기 위해 사용된다. 이 3종의 생성 콘텐츠는 모두 로열티프리, 즉 추가 라이선스료 없이 상용 이용 가능한 점이 특징이 된다.
나아가, Google의 AI 모델 'Gemini 2.0 Flash'가 Firefly에 추가된 것도 이번 발표의 하나이다. Gemini 2.0 Flash는 Google이 제공하는 고속·경량의 AI 모델로, 복수의 모달(텍스트·이미지·음성 등)을 다루는 '멀티모달' 설계가 특징인 것으로 알려져 있다. Firefly로의 통합에 의해, 어도비의 플랫폼이 더욱 다양한 AI 처리에 대응할 수 있는 가능성이 넓어진다.
이 움직임은 어도비가 Firefly를 텍스트나 이미지 생성뿐만 아니라 음성·영상 제작 전체를 커버하는 AI 통합 환경으로 포지셔닝하려고 하고 있음을 보여준다고 할 수 있다. 생성 AI 도구의 경쟁이 심화되는 가운데, 복수의 생성 기능을 한곳에서 다룰 수 있는 플랫폼의 가치는 높아지는 경향이 있다. 특히 동영상 제작의 장면에서는 영상·음악·효과음·나레이션을 따로따로의 도구로 준비하는 수고가 생략될 수 있다는 점은 제작 비용이나 시간의 절감으로 이어진다고 할 수 있는 견방이 있다.
또한 Google의 Gemini 모델을 외부에서 받아들이는 형태로의 통합은 어도비가 자사 모델의 개발뿐만 아니라 타사의 선진 모델을 적극적으로 받아들이는 접근 방식을 취하고 있음을 보여준다. 이러한 복수 모델을 조합하는 전략은 크리에이티브 도구 시장에서 독자성을 유지하면서 최신의 AI 기술을 빠르게 받아들이는 수단으로서 앞으로도 확산될 가능성이 있다.
Firefly의 음성 생성 도구 3종의 일반 제공 개시에 의해, 어도비의 크리에이티브 향 AI 플랫폼의 대응 범위는 이미지·텍스트 생성에서 음성 영역으로 확대되었다. 크리에이터나 기업 사용자가 이들 도구를 어떻게 활용하는가, 또한 앞으로 더욱 어떠한 기능이 추가될 것인가에 주목이 집중되고 있다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.