Có gì mới
Google giới thiệu Gemini Omni 1.1 Flash như một bản nâng cấp tập trung vào khả năng kiểm soát video qua Gemini API và Google AI Studio. Thay vì chỉ sinh một clip từ prompt, model bổ sung các thao tác phù hợp hơn với workflow dựng video: nối dài cảnh, nội suy giữa hai frame, tạo bản nháp độ phân giải thấp, upscale đầu ra và dùng video tham chiếu.
Các thay đổi chính:
- Dùng tối đa 10 giây video trước đó làm ngữ cảnh khi nối cảnh; thế hệ trước chỉ tham chiếu giây cuối.
- Nối thêm từng đoạn 10 giây, với tổng thời lượng tích lũy tối đa 40 giây.
- Nhận frame đầu và frame cuối để sinh chuyển động liên tục ở giữa, phù hợp cho camera orbit, zoom transition hoặc loop.
- Sinh bản nháp 360p nhanh hơn tới 60% theo system throughput của Google và có chi phí bằng một phần ba 720p.
- Upscale đầu ra lên 1080p hoặc 4K.
- Nhận tối đa ba giây video tham chiếu trong multimodal input để giữ chuyển động, visual context hoặc nhân vật.
Nối cảnh với nhiều ngữ cảnh hơn
Scene extension là thay đổi đáng chú ý nhất cho các pipeline cần nhiều shot liên tục. Khi chỉ nhìn frame cuối, model dễ mất quỹ đạo camera, vị trí vật thể hoặc nhịp hành động. Omni 1.1 Flash có thể phân tích 10 giây trước đó rồi sinh đoạn tiếp theo, giúp giữ logic của cảnh qua nhiều lần nối.
Google cho phép nối theo từng bước 10 giây đến 40 giây tổng cộng. Đây vẫn là một giới hạn cần thiết kế quanh nó: ứng dụng nên lưu mỗi interaction, kiểm tra clip vừa sinh và chỉ chuyển previous_interaction_id sang bước tiếp theo khi kết quả đạt yêu cầu.
Ví dụ API tối giản:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[
{"type": "text", "text": "Continue the scene."}
],
response_format={
"resolution": "360p",
},
)
Frame đầu-cuối và video tham chiếu
Với first/last-frame interpolation, dev chỉ định điểm xuất phát và điểm kết thúc của shot, còn model dựng chuyển động nối giữa hai điểm. Cách này hữu ích khi sản phẩm cần kiểm soát bố cục cuối thay vì chấp nhận một clip tự do hoàn toàn.
Video tham chiếu giải bài toán khác: người dùng có thể đưa tối đa ba giây chuyển động mẫu cùng image hoặc text prompt. Bài công bố minh họa việc ánh xạ các động tác từ nhiều clip vào các nhân vật được cung cấp. Với tool sáng tạo, đây là primitive phù hợp cho motion transfer và giữ visual context; chất lượng nhất quán qua nhiều lần sinh vẫn cần được đo trên asset thật.
Nháp rẻ trước, render sau
Chế độ 360p dành cho storyboard và vòng lặp prompt nhanh. Google công bố mức tăng throughput tới 60% và chi phí chỉ bằng một phần ba 720p, nên một pipeline hợp lý có thể sinh nhiều phương án ở 360p, chọn clip đạt yêu cầu rồi mới xuất 1080p hoặc 4K.
Con số này là so sánh nội bộ giữa hai resolution, không phải benchmark độc lập về chất lượng. Trước khi tự động hóa production, dev nên đo continuity sau nhiều lần nối cảnh, identity drift, tỷ lệ clip phải bỏ và chi phí trên mỗi clip được chấp nhận.
Cách bắt đầu
Omni 1.1 Flash đang được triển khai trong Google AI Studio, Gemini API và Agent Platform API. Google cũng cung cấp tài liệu API, cookbook và prompting guide cho scene extension, video reference và upscaling. Không có breaking change hoặc migration bắt buộc được nêu trong bài công bố; cách an toàn là thêm model mới như một backend thử nghiệm, chạy eval trên storyboard hiện có rồi mới mở cho workflow tự động.