Tham chiếu đa năng thành video: AI tạo video từ ảnh, clip và âm thanh
Kết hợp ảnh tham chiếu, clip video và âm thanh với prompt để tạo một video AI. Khu vực tải lên chỉ hiện những gì mô hình đã chọn hỗ trợ.
Mô hình được hỗ trợ: Seedance 2.5 · Seedance 2.0 · Seedance 2.0 Fast · Seedance 2.0 Mini · MiniMax H3 · Wan 3.0 · Wan 3.0 Prime · Kling v3 · Kling v3 Omni · Veo 3 · Veo 3.1 Fast · Gemini Omni Flash · Grok Video 1.5 · Grok Video 1.0 · Wan 2.6 · Wan 2.6 Flash · HappyHorse 1.0 · HappyHorse 1.1
Tham chiếu đa năng thành video là gì?
Tham chiếu đa năng thành video tạo một video AI từ prompt văn bản cùng nhiều loại tham chiếu: ảnh cho nhân vật và phong cách, clip video cho chuyển động, âm thanh cho nhịp điệu hoặc giọng nói. Tạo video từ văn bản bắt đầu từ chữ, tạo video từ ảnh làm một ảnh chuyển động, còn tham chiếu thành video cho phép bạn điều khiển nhiều khía cạnh của kết quả cùng lúc.
Mỗi mô hình nhận các loại tham chiếu khác nhau. Wan 3.0 nhận đến 21 tham chiếu gồm ảnh, clip và âm thanh; MiniMax H3 nhận đến 9 ảnh, 3 clip video và 3 tệp âm thanh; HappyHorse 1.0 nhận đến 9 ảnh tham chiếu. Khu vực tải lên tự điều chỉnh và chỉ hiện các ô mà mô hình đã chọn dùng được.
Bạn có thể làm gì với tham chiếu thành video
Nhân vật nhất quán
Giữ nguyên khuôn mặt, trang phục và đạo cụ qua nhiều cảnh bằng cách tham chiếu ảnh nhân vật.
Mô phỏng chuyển động từ clip
Dùng video tham chiếu để định hướng chuyển động, vũ đạo hoặc cách di chuyển máy quay.
Hình ảnh theo nhạc
Thêm tham chiếu âm thanh để nhịp độ và không khí khớp với bài hát.
Video sản phẩm từ tư liệu thật
Kết hợp ảnh sản phẩm với tham chiếu cảnh sử dụng để làm quảng cáo đúng thương hiệu.
Chuyển phong cách sang video
Áp dụng phong cách của tác phẩm nghệ thuật hoặc hình ảnh thương hiệu vào cảnh mới.
Từ storyboard đến cảnh hoàn chỉnh
Biến khung storyboard và clip thô thành chuỗi cảnh hoàn thiện.
Mô hình AI cho tham chiếu thành video
Giới hạn tham chiếu khác nhau theo mô hình. Cột Đầu ra liệt kê dải độ phân giải và thời lượng clip.
| Mô hình | Phù hợp nhất cho | Đầu ra |
|---|---|---|
| Wan 3.0 | Kết hợp rộng nhất: đến 21 tham chiếu ảnh, video và âm thanh, clip đến 30 giây | 480p–1080p · 2–30s |
| MiniMax H3 | Ảnh, clip và âm thanh cùng lúc: đến 9 ảnh, 3 clip và 3 tệp âm thanh | 480p–4K · 4–15s |
| HappyHorse 1.0 | Tham chiếu nhân vật với tối đa 9 ảnh | 720p–1080p · 3–15s |
| Veo 3.1 Fast | Đến 3 ảnh tham chiếu kèm âm thanh được tạo | 720p–4K · 4–8s |
| Wan 2.6 | Clip video tham chiếu định hướng chuyển động | 720p–1080p · 5–10s |
Cách tạo video từ tham chiếu
- 1
Chọn mô hình
Chọn mô hình video. Các ô tham chiếu thay đổi theo loại ảnh, clip và âm thanh mà mô hình nhận.
- 2
Thêm tham chiếu và prompt
Tải tham chiếu lên rồi mô tả cách mỗi tham chiếu định hình video. Nếu được hỗ trợ, gõ @ để nhắc đến ảnh đã thêm trong prompt.
- 3
Tạo và tải xuống
Kiểm tra số tín dụng ước tính, tạo video rồi tải xuống từ lịch sử khi hoàn tất.
Mẹo làm việc với tham chiếu
- Giao cho mỗi tham chiếu một vai trò trong prompt, ví dụ: ảnh 1 là nhân vật, clip dùng cho động tác nhảy.
- Dùng tham chiếu gọn gàng: ảnh chân dung chính diện hoặc bảng thiết kế nhân vật hiệu quả hơn ảnh nhóm đông người.
- Giữ clip tham chiếu ngắn và tập trung vào đúng một chuyển động bạn muốn mô phỏng.
- Dùng tham chiếu âm thanh cho nhịp độ và không khí, rồi mô tả hình ảnh mong muốn trong prompt.
- Bắt đầu với ít tham chiếu và thêm dần khi kết quả cơ bản đã ổn.
Dùng ảnh 1 làm nhân vật chính và clip tham chiếu cho động tác nhảy; sân thượng rực đèn neon về đêm, máy quay cầm tay, video dọc
Thử thêm công cụ AI khác
- Tạo video AI từ ảnhLàm ảnh chuyển động bằng AI tạo video từ ảnh. Tải ảnh lên, mô tả chuyển động và tạo với Wan 3.0 Prime, Kling v3, HappyHorse hoặc Veo 3.1 Fast.
- Tạo video AI từ văn bảnTạo video AI từ văn bản. So sánh MiniMax H3, Wan 3.0, Kling v3 và Veo 3.1 Fast, đặt thời lượng và độ phân giải, xem số tín dụng trước khi tạo.
- Chỉnh sửa video bằng AIChỉnh sửa video trực tuyến bằng AI: đổi phong cách, chỉnh màu và phối lại clip trong vài phút mà không cần cài phần mềm.
Câu hỏi thường gặp
- Tham chiếu đa năng thành video là gì?
- Tính năng này tạo một video AI từ prompt văn bản cùng ảnh tham chiếu, clip video và âm thanh, giúp kiểm soát nhân vật, chuyển động và không khí tốt hơn so với chỉ dùng văn bản hoặc một ảnh.
- Khác gì với tạo video từ ảnh?
- Tạo video từ ảnh làm một ảnh chuyển động và chỉ nhận ảnh. Tham chiếu thành video kết hợp nhiều tham chiếu như ảnh, clip và âm thanh để định hướng một cảnh mới.
- Có thể thêm những tham chiếu nào, bao nhiêu?
- Tùy mô hình. Wan 3.0 nhận tổng cộng đến 21 tham chiếu, MiniMax H3 đến 9 ảnh, 3 clip video và 3 tệp âm thanh, HappyHorse 1.0 đến 9 ảnh. Khu vực tải lên chỉ hiện những gì mô hình đã chọn hỗ trợ.
- Hỗ trợ định dạng tệp nào?
- Ảnh ở các định dạng phổ biến như JPG, PNG và WebP, clip video MP4, MOV hoặc M4V, và tệp âm thanh như MP3.
- Tốn bao nhiêu tín dụng?
- Chi phí tùy mô hình, độ phân giải và thời lượng; với một số mô hình, thời lượng clip tham chiếu cũng được tính vào thời lượng tính phí. Ước tính hiển thị trước khi tạo.
- Tạo mất bao lâu?
- Thường từ dưới một phút đến vài phút, tùy mô hình, tham chiếu và thời lượng. Quá trình chạy nền nên bạn có thể xem lịch sử sau.
- Video có watermark không?
- Tải xuống không có watermark được bao gồm trong các gói trả phí. Xem trang giá để biết mỗi gói gồm những gì.
- Có dùng cùng một nhân vật cho nhiều video được không?
- Được. Dùng cùng ảnh nhân vật làm tham chiếu ở mỗi lần tạo và mô tả nhân vật theo cùng một cách trong prompt.