BFL, 이미지·영상·음성을 통합 생성하는 'FLUX 3' 발표
독일의 인공지능 기업 Black Forest Labs(BFL)는 이미지·영상(최장 20초·음성 포함)·로봇 동작 제어를 단일 모델로 처리하는 멀티모달 인공지능 'FLUX 3'을 발표했다. 현 시점에서는 일부 기능이 얼리 액세스로만 제공되고 있으며, 가격과 오픈웨이트 버전 공개는 뒤로 미뤄진 상태다.

독일의 인공지능 기업 Black Forest Labs(BFL)는 멀티모달 모델 'FLUX 3'을 발표했다. 해당 모델은 하나의 프롬프트로부터 이미지 또는 음성이 포함된 영상(최장 20초)을 생성할 수 있다. 동사가 영상 생성 모델을 공개하는 것은 처음이다.
BFL은 지금까지 이미지 생성 모델 'FLUX' 시리즈로 알려져 왔다. 이번 FLUX 3은 이미지·영상·음성을 각각 별도의 모델로 처리하는 것이 아니라, 단일한 아키텍처(설계 기반) 위에서 통합적으로 학습하고 있다는 점이 특징이다. 동사는 이러한 접근 방식을 '비주얼 인텔리전스'라 부르며, 창작물 제작에서 기업용 시뮬레이션, 컴퓨터 조작, 나아가 로봇의 동작 제어까지를 하나의 능력으로 아우르는 구상을 그리고 있다.
FLUX 3은 'FLUX 3 Video', 'FLUX 3 Image', 'FLUX 3 Action', 그리고 추후 공개 예정인 오픈소스 버전 'FLUX 3 Dev'의 4가지 제품 라인으로 제공된다. 현 시점에서는 음성 생성 옵션이 포함된 FLUX 3 Video와 FLUX 3 Action이 '얼리 액세스' 프로그램에 포함되어 있으며, 신청은 누구나 할 수 있지만 이용하려면 BFL의 승인이 필요하다. API나 외부 파트너를 통한 일반 공개는 아직 이루어지지 않았으며, FLUX 3 Image는 수주 내에, 그 이후 일반 제공 순으로 전개될 예정이라고 BFL은 설명하고 있다.
한편 현 단계에서는 몇 가지 중요한 정보가 공개되지 않았다. 가격, 서비스 품질 보증(SLA), 평가 방법론의 세부 사항, 벤치마크의 샘플 수 및 평가자 수, 이미지 모델로서의 비교 지표 등 기업이 도입 비용과 성능을 객관적으로 판단하기 위해 필요한 정보들이 미공개 상태로 남아 있다. 또한 모델의 가중치 데이터(로컬 환경에서 동작시키기 위한 파일)도 현 시점에서는 공개되지 않았다. 오픈웨이트 버전은 올해 하반기 출시 예정으로 알려져 있으며, FLUX 3 Dev는 FLUX의 첫 멀티모달 대응 오픈 버전이 될 것이라고 BFL은 밝히고 있다. 다만 이전의 FLUX Dev 시리즈가 이미지만을 대상으로 했던 데 비해, 이번에는 영상·음성·동작 예측까지 대상 범위가 확대되어 더욱 광범위한 약속이 되고 있다.
단계적 공개라는 이번 방침은 Anthropic, OpenAI 등 미국의 주요 인공지능 연구소가 최근 취하고 있는 출시 전략과 유사하다. 다만 그들의 경우 안전성에 대한 우려나 정부의 요청이 배경으로 언급되었었다. BFL이 이번 단계적 공개의 이유로 무엇을 제시하고 있는지는 현 시점에서 명확하게 드러나지 않았다.
FLUX 시리즈는 지금까지 모델의 가중치를 무료로 공개하는 오픈웨이트 전략으로 개발자 커뮤니티의 지지를 얻어 왔다. 이러한 관점에서 보면, 이번 출시에서 오픈 버전 제공이 뒤로 미뤄진 것은 기존 사용자층에게는 아쉬운 점으로 다가올 수 있다. BFL의 개발 커뮤니티에 대한 기여 자세 자체가 부정된 것은 아니지만, 오픈 버전 공개 지연에 따른 영향은 무시할 수 없다는 평가가 가능하다.
멀티모달 통합이라는 설계 사상은 개별 모델을 조합하는 접근 방식에 비해 일관성과 개발 효율성 측면에서 우위를 가진다고 위치지어지고 있다. 다만 그러한 우위성이 실제 제품 품질에 어떻게 반영되는지는 가격과 벤치마크의 세부 정보가 공개되고 기업이나 개발자가 독립적으로 검증할 수 있게 되어야만 판단할 수 있다. 향후 정보 공개의 내용과 속도가 FLUX 3의 실제 보급 정도를 좌우하는 중요한 요소가 될 것이라는 평가가 가능하다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.