Có gì mới
FLUX 3 là model multimodal mới của Black Forest Labs, được thiết kế để học image, video và audio trong cùng một kiến trúc. Ý tưởng cốt lõi: mỗi modality chỉ là một lát cắt của thế giới thật. Image cho cấu trúc không gian, video thêm thời gian và động lực học, audio bổ sung quan hệ nhân quả giữa chuyển động và âm thanh, còn language gắn các quan sát đó với mục tiêu và instruction.
Bản Early Access tập trung vào video trước. FLUX 3 Video có thể sinh clip dài tối đa 20 giây với audio native trong một lần generation. Các chế độ được nêu gồm text-to-video, image-to-video, video-to-video, video/audio continuation, keyframe-to-video, multilingual dialogue, nhiều aspect ratio, typography động và chaining nhiều clip thành sequence dài hơn.
Với image, Black Forest Labs nói FLUX 3 cải thiện khả năng xử lý prompt phức tạp và text rendering so với các đời trước. FLUX 3 Image sẽ được mở Early Access trong vài tuần tiếp theo. Xa hơn, họ dự kiến phát hành video/audio API, private weight access, action prediction cho đối tác, image API và một bản open-weight multimodal backbone tên FLUX 3 Dev.
Đánh giá ban đầu
Các số liệu trong bài là preliminary và do vendor công bố. Trong so sánh preference cho clip text-to-video 10 giây ở 720p có audio, FLUX 3 được chọn hơn Grok Imagine Video tới 69%, Kling v3 Pro 60%, Runway Gen-4.5 77% và Luma Ray 3.2 93%. Đây là tín hiệu đáng kiểm tra, không phải kết luận cuối cùng.
Điểm kỹ thuật quan trọng hơn benchmark là hướng Self-Flow. Black Forest Labs mô tả Self-Flow như cách align generation và understanding trong cùng một architecture, thay vì train từng modality rời rạc. Nếu cách này giữ được khi scale, model không chỉ tạo media đẹp hơn mà còn có representation tốt hơn cho task cần hiểu dynamics.
Action và Physical AI
FLUX 3 không chỉ nhắm tới content creation. BFL cũng dùng backbone này cho action prediction qua FLUX-mimic, hợp tác với mimic robotics. Luận điểm là video model muốn tạo chuyển động thuyết phục thì phải học contact, mass, motion và cause-effect; action của robot cũng là một dạng biểu diễn thấp chiều của cùng thực tại đó.
Trong roadmap, FLUX 3 Action và FLUX-mimic sẽ đi qua research/commercial partners trước. Đây là phần đáng theo dõi nếu bạn làm robotics, simulation, computer use hoặc visual agent. Một backbone vừa dự đoán tương lai trong video vừa trích được action hữu dụng sẽ làm giảm khoảng cách giữa media generation và embodied AI.
Cách dev nên đánh giá
Đừng chỉ xem demo đẹp. Khi API mở ra, hãy test những case vốn làm video model yếu: consistency của character qua nhiều shot, text nhỏ trong frame, audio khớp va chạm, chuyển cảnh theo keyframe, prompt nhiều ràng buộc, và khả năng tái dùng reference video/image.
Nếu bạn build tool tạo media, điểm cần đo là latency, chi phí mỗi clip, mức kiểm soát được qua API, policy/safety filter, quyền dùng output thương mại, và khả năng batch hóa. Nếu bạn build agent hoặc simulation, hãy xem model có trả về representation/action interface thật sự dùng được không, hay chỉ là một lớp demo quanh video generation.