AI 기술Blackforestlabs2026년 7월 24일 04:24

Black Forest Labs, 음성 생성 지원 "Flux 3" 공개

Black Forest Labs는 이미지·영상·음성을 통합적으로 처리하는 멀티모달 AI 모델 "Flux 3"을 공개했다. 최대 20초의 동영상과 네이티브 음성을 동시에 생성할 수 있는 기능은 동사 최초다. BFL 자체 테스트에서는 Suno 2.0을 약간 상회하는 것으로 알려져 있으나, 제3자 검증은 아직 이루어지지 않았다.

Black Forest Labs, 음성 생성 지원 "Flux 3" 공개

Black Forest Labs(BFL)는 이미지·영상·음성을 결합하여 학습하는 멀티모달 기초 모델 "Flux 3"을 공개했다. 동 모델은 최대 20초의 동영상을 생성할 수 있을 뿐만 아니라, 영상에 맞춘 음성을 네이티브하게(별도 도구를 조합하지 않고) 동시에 생성할 수 있다. 이는 BFL로서 처음으로 음성 생성에 대응한 것이며, 동사에 있어 큰 기술적 이정표가 된다.

BFL은 원래 이미지 생성 AI로 높은 평가를 받은 "Flux" 시리즈를 담당해온 기업이다. 지금까지의 Flux 모델은 정지 이미지 생성을 장점으로 했으나, 동영상·음성에 대응 범위를 넓힌 Flux 3의 출현으로 동사는 이미지 생성의 틀을 벗어난 멀티모달 AI 개발 기업으로서 새로운 단계로 진입했다고 볼 수 있다. 동영상과 음성을 일체로 생성하는 기술은 콘텐츠 제작 및 엔터테인먼트 분야의 응용이 확대되는 영역으로, 각사의 개발 경쟁이 계속되고 있다.

BFL 자신이 실시한 벤치마크 테스트에서는 Flux 3의 성능이 동영상 생성 분야의 유력 모델로 알려진 Suno 2.0을 약간 상회하는 결과가 나왔다. 다만 현재 시점에서 제3자에 의한 독립적인 검증 결과는 공표되지 않았으며, 이 평가는 BFL 자신의 테스트에 기초한 것이라는 점에 유의할 필요가 있다. 또한 BFL은 이미 Flux 3을 로보틱스(로봇 기술) 작업에 적용하는 테스트를 진행 중임도 명시하고 있다.

BFL이 최종적으로 목표로 하는 것은 "월드 모델"의 구축이라고 한다. 월드 모델이란 현실 세계의 물리 법칙이나 인과 관계를 AI가 내부적으로 이해·재현할 수 있도록 하는 것을 가리키며, 자율 로봇이나 고도의 시뮬레이션 등에의 응용이 상정되는 개념이다. Flux 3의 로보틱스에 대한 시험적 적용은 그 장기 목표를 향한 초기 단계라는 포지셔닝으로 볼 수 있다.

동영상 생성에 음성을 결합하는 움직임은 AI 업계 전체에서 가속화하고 있다. 영상과 음성을 따로 생성해 연결하는 것이 아니라, 하나의 모델이 둘 다를 통합적으로 출력할 수 있다는 것은 품질의 일관성이나 워크플로우의 효율화라는 관점에서 의미를 가진다. BFL의 접근 방식은 단기능 모델의 조합에서 통합적인 생성 기반으로의 이행이라는 방향성을 보여주는 것이라고 할 수 있다.

향후 주목할 점은 BFL의 자체 평가에 머무르고 있는 Flux 3의 성능이 독립적인 검증에 의해 어떻게 평가될 것인가 하는 점이다. 또한 로보틱스 분야에의 응용이 어디까지 실용 수준에 도달하는지도 월드 모델의 실현 가능성을 측정하는 데 있어 중요한 지표가 될 것이다. 동영상·음성·로보틱스라는 복수의 영역을 횡단하는 움직임이 BFL의 향후 방향성을 더욱 명확히 보여주는 기회가 될 것이라는 관점이 있다.

#생성AI#동영상생성#멀티모달AI#BlackForestLabs#Flux#월드모델#로보틱스
AI issue 편집부

본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.

댓글

댓글을 작성하려면 로그인하세요