FLUX 3 출시, 무엇이 달라졌나? FLUX 2와 비교해 본 핵심 변화

Black Forest Labs가 2026년 7월 23일 FLUX 3를 Early Access로 공개했습니다. 이번 발표는 단순히 이미지 생성 모델의 업그레이드가 아니라, FLUX 시리즈가 이미지 생성 AI에서 멀티모달(이미지·영상·오디오) 기반 AI로 확장됐다는 점에서 의미가 큽니다.

FLUX 2가 “최고 수준의 이미지 생성”을 목표로 했다면, FLUX 3는 현실 세계(Real World)를 이해하는 AI를 지향합니다.


FLUX 2와 FLUX 3 비교

항목FLUX 2FLUX 3
핵심 목적이미지 생성이미지·영상·오디오 통합 생성
학습 방식이미지 중심이미지+비디오+오디오 공동 학습
출력이미지이미지, 영상, 음성 포함 콘텐츠
편집이미지 편집이미지 및 영상 편집(예정)
오디오지원 안 함네이티브 오디오 생성
물리 이해제한적현실 세계와 움직임 이해 강화
상태상용 서비스Early Access

가장 큰 변화는 ‘멀티모달’

Black Forest Labs는 FLUX 3를 “하나의 모델이 이미지, 비디오, 오디오를 동시에 학습하는 최초의 FLUX”라고 소개했습니다.

기존에는

  • 이미지 모델
  • 영상 모델
  • 음성 모델

을 각각 따로 사용하는 구조였다면,

FLUX 3는 동일한 아키텍처에서 세 가지 정보를 함께 학습합니다.

즉,

사진만 보는 AI가 아니라

움직임과 소리까지 이해하는 AI가 된 것입니다.


영상 생성도 지원

이번 발표에서 공개된 내용 가운데 가장 주목받는 기능은 Video Generation입니다.

현재 Early Access에서는

  • Text to Video
  • Image to Video
  • Video Editing

기능이 순차적으로 제공될 예정입니다.

특히 최대 20초 분량의 영상을 네이티브 오디오와 함께 생성하는 것이 특징입니다.


FLUX 2보다 좋아진 점

1. 현실 이해 능력

기존 이미지 모델은

“예쁜 이미지”

생성에는 강했지만,

FLUX 3는

  • 물체의 움직임
  • 충돌
  • 시간의 흐름
  • 소리의 원인

까지 하나의 개념으로 학습합니다.


2. 캐릭터 일관성

영상 생성에서 가장 어려운 부분은

  • 얼굴 유지
  • 의상 유지
  • 스타일 유지

입니다.

Black Forest Labs는 FLUX 3가 이러한 시간 축에서의 일관성을 크게 개선했다고 설명했습니다.


3. 음성까지 함께 생성

기존 워크플로는

이미지 생성 →
영상 생성 →
음성 생성 →
Lip Sync

를 각각 처리해야 했습니다.

FLUX 3는 이를 하나의 모델에서 처리하는 방향을 제시했습니다.


로봇 AI에도 사용

흥미로운 점은 FLUX 3가 단순 생성 AI가 아니라는 것입니다.

Black Forest Labs는

mimic Robotics

와 협력하여 FLUX 3 기반의 비디오-액션 모델을 공개했습니다.

이 모델은 실제 Audi 생산 환경에서 테스트되고 있다고 발표했습니다.

즉,

생성 AI를 넘어

현실 세계에서 행동을 예측하는 기반 모델로도 발전하고 있습니다.


FLUX 2는 서비스가 끝날까?

아닙니다.

현재는

  • FLUX 2 Pro
  • FLUX 2 Flex
  • FLUX 2 Max
  • FLUX 2 Klein

모델들이 계속 업데이트되고 있습니다.

특히 올해에는

  • 속도 2배 개선
  • Flex 3배 성능 향상
  • Klein 공개

등 지속적인 업데이트가 진행됐습니다.

따라서 당분간은

  • 이미지 생성 → FLUX 2
  • 영상·멀티모달 → FLUX 3

구도가 이어질 가능성이 큽니다.


아직은 Early Access

현재 FLUX 3는 일반 공개가 아닙니다.

공개된 내용은

  • Early Access
  • 연구 공개
  • 일부 데모

수준이며,

향후

  • 오픈 웨이트
  • 경량 모델
  • API 확대

도 계획하고 있다고 밝혔습니다.

FLUX 3 Early Access 바로가기

RTX 5090에서도 영상 생성은 쉽지 않을 수 있다

FLUX 2는 RTX 5090 기준 이미지 생성에서 상당히 빠른 추론 성능을 보여줍니다. 1024×1024 해상도의 단일 이미지는 최적화 환경에서 수 초 내 생성이 가능한 수준입니다.

하지만 FLUX 3는 이미지 뿐 아니라 오디오와 비디오를 함께 처리하는 멀티모달 구조를 채택하고 있어, 동일한 GPU에서도 이미지 전용 모델보다 연산량이 크게 증가할 가능성이 있습니다.

따라서 RTX 5090급 GPU를 사용하더라도 이미지 생성처럼 ‘몇 초 만에 영상 완성’을 기대하기는 어렵고, 실제 생성 속도는 모델 최적화 수준과 해상도, 프레임 수, 샘플링 설정에 따라 크게 달라질 것으로 예상됩니다.


기대할 수 있는 변화

반대로 긍정적인 요소도 있습니다.

  • Black Forest Labs는 FLUX 2에서 추론 속도 최적화를 지속적으로 개선해 왔습니다.
  • NVIDIA Blackwell(RTX 50 시리즈)의 Tensor Core 성능과 FP8 지원은 대규모 생성 모델 추론에 유리합니다.
  • 향후 TensorRT, GGUF, 양자화, Flash Attention 등 최적화가 적용되면 초기 버전보다 생성 시간이 크게 단축될 가능성이 있습니다.

즉, 초기 Early Access에서는 속도보다 품질을 우선할 가능성이 높고, 이후 최적화 업데이트를 통해 실사용 속도가 개선되는 흐름을 예상하는 것이 합리적입니다.

앞으로의 의미

FLUX 3의 핵심은 이미지 품질 향상보다 AI가 현실 세계를 이해하는 방식의 변화에 있습니다.

지금까지 생성형 AI는 이미지, 영상, 음성을 각각 다른 모델로 처리하는 경우가 많았지만, FLUX 3는 이를 하나의 기반 모델에서 통합하려는 방향을 제시했습니다. 이는 향후 AI 영상 제작, 콘텐츠 생성, 로보틱스까지 연결되는 중요한 전환점이 될 가능성이 있습니다. 다만 현재는 Early Access 단계이므로 실제 성능과 활용성은 정식 공개 및 사용자 검증을 통해 계속 확인될 필요가 있습니다.

호재
호재

AI와 크리에이티브 도구를 더 쉽게 활용할 수 있도록
문제 해결 가이드와 실사용 리뷰를 제공합니다.

정확하고 오래 도움이 되는 콘텐츠를 만듭니다.

댓글 1개

댓글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다