Chuyển đến nội dung
tinAI
Quay lại

FLUX 3: model multimodal cho image, video, audio và action

bfl.ai · Loại nguồn: công ty/blog 2026-07-24T11:43:16.907Z
Bản dịch tiếng Việt của tinAI · Từ FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. (bfl.ai) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. (bfl.ai)

Tác giả: Black Forest Labs

Ngày đăng: Dịch ngày:

TL;DR

FLUX 3 là foundation model multimodal của Black Forest Labs, train chung image, video và audio để tạo video có âm thanh, chỉnh sửa ảnh/video và làm backbone cho action prediction. Bản hiện tại đang Early Access, các benchmark do vendor công bố cần được kiểm chứng khi API và weights mở rộng hơn.

Ước tính đọc: 3 phút

Có gì mới

FLUX 3 là model multimodal mới của Black Forest Labs, được thiết kế để học image, video và audio trong cùng một kiến trúc. Ý tưởng cốt lõi: mỗi modality chỉ là một lát cắt của thế giới thật. Image cho cấu trúc không gian, video thêm thời gian và động lực học, audio bổ sung quan hệ nhân quả giữa chuyển động và âm thanh, còn language gắn các quan sát đó với mục tiêu và instruction.

Bản Early Access tập trung vào video trước. FLUX 3 Video có thể sinh clip dài tối đa 20 giây với audio native trong một lần generation. Các chế độ được nêu gồm text-to-video, image-to-video, video-to-video, video/audio continuation, keyframe-to-video, multilingual dialogue, nhiều aspect ratio, typography động và chaining nhiều clip thành sequence dài hơn.

Với image, Black Forest Labs nói FLUX 3 cải thiện khả năng xử lý prompt phức tạp và text rendering so với các đời trước. FLUX 3 Image sẽ được mở Early Access trong vài tuần tiếp theo. Xa hơn, họ dự kiến phát hành video/audio API, private weight access, action prediction cho đối tác, image API và một bản open-weight multimodal backbone tên FLUX 3 Dev.

Đánh giá ban đầu

Các số liệu trong bài là preliminary và do vendor công bố. Trong so sánh preference cho clip text-to-video 10 giây ở 720p có audio, FLUX 3 được chọn hơn Grok Imagine Video tới 69%, Kling v3 Pro 60%, Runway Gen-4.5 77% và Luma Ray 3.2 93%. Đây là tín hiệu đáng kiểm tra, không phải kết luận cuối cùng.

Điểm kỹ thuật quan trọng hơn benchmark là hướng Self-Flow. Black Forest Labs mô tả Self-Flow như cách align generation và understanding trong cùng một architecture, thay vì train từng modality rời rạc. Nếu cách này giữ được khi scale, model không chỉ tạo media đẹp hơn mà còn có representation tốt hơn cho task cần hiểu dynamics.

Action và Physical AI

FLUX 3 không chỉ nhắm tới content creation. BFL cũng dùng backbone này cho action prediction qua FLUX-mimic, hợp tác với mimic robotics. Luận điểm là video model muốn tạo chuyển động thuyết phục thì phải học contact, mass, motion và cause-effect; action của robot cũng là một dạng biểu diễn thấp chiều của cùng thực tại đó.

Trong roadmap, FLUX 3 Action và FLUX-mimic sẽ đi qua research/commercial partners trước. Đây là phần đáng theo dõi nếu bạn làm robotics, simulation, computer use hoặc visual agent. Một backbone vừa dự đoán tương lai trong video vừa trích được action hữu dụng sẽ làm giảm khoảng cách giữa media generation và embodied AI.

Cách dev nên đánh giá

Đừng chỉ xem demo đẹp. Khi API mở ra, hãy test những case vốn làm video model yếu: consistency của character qua nhiều shot, text nhỏ trong frame, audio khớp va chạm, chuyển cảnh theo keyframe, prompt nhiều ràng buộc, và khả năng tái dùng reference video/image.

Nếu bạn build tool tạo media, điểm cần đo là latency, chi phí mỗi clip, mức kiểm soát được qua API, policy/safety filter, quyền dùng output thương mại, và khả năng batch hóa. Nếu bạn build agent hoặc simulation, hãy xem model có trả về representation/action interface thật sự dùng được không, hay chỉ là một lớp demo quanh video generation.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. (bfl.ai) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (2 bài). Loại nguồn: GitHub 2