Kiến thức AI
AI local làm video: máy nào chạy được, dùng model gì, có đáng không?
AI local làm video là gì, cần card đồ hoạ bao nhiêu GB, nên dùng Wan 2.2, LTX-2.5 hay HunyuanVideo, ComfyUI hay…

Cập nhật lần cuối: 25/09/2026
Tóm tắt nhanh
Kênh mẹ và bé của mình có 2 nhân vật cố định: mẹ và bé Bin. Từ 18 đến 23/09 mình làm hơn chục video cho kênh này bằng Google Flow. Ảnh dưới là ảnh mẫu và ảnh khung đầu lấy từ 4 video làm ở các ngày khác nhau.

Mẹ vẫn búi tóc, mặc bộ pijama lụa hồng viền trắng. Bin vẫn má phúng phính, áo xanh in mây có miếng vá hình gấu. Dưới đây là 5 việc mình làm để giữ được như vậy.
Ảnh mẫu tốt nhất là ảnh chụp nửa người, nhìn thẳng, nền xám trơn, ánh sáng đều. Không đeo kính râm, không đội mũ che tóc, không cầm đồ vật.
Trang phục trong ảnh mẫu chính là trang phục mặc định trong video. Muốn nhân vật mặc đồ gì trong hầu hết các cảnh thì cho mặc bộ đó ngay trong ảnh mẫu.
Đây là điều quan trọng nhất mình rút ra: Flow vẽ người theo chữ trong prompt nhiều hơn theo ảnh mẫu. Ảnh mẫu chỉ là tham chiếu.
Vì vậy mỗi nhân vật có một đoạn mô tả bằng tiếng Anh, viết một lần, rồi dán y nguyên vào prompt của mọi cảnh. Đây là đoạn mô tả thật của nhân vật mẹ:
young Vietnamese mother, about 28, fair skin, slim, long black hair tied in a loose messy high bun with a few loose strands, soft round face, expressive eyes; wearing a dusty-pink short-sleeve satin pajama shirt with white piping and a collar
Để ý là mình tả cả trang phục rất cụ thể: màu hồng phấn, chất lụa, tay ngắn, viền trắng, có cổ. Quần áo đổi màu giữa các cảnh là chỗ người xem nhận ra nhanh nhất.
Sau đoạn mô tả, prompt ảnh của mình luôn có thêm câu này:
Keep each person EXACTLY like their reference photo: same face, age, hair and outfit. Exactly 2 people, nobody else.
Câu “Exactly 2 people, nobody else” giúp Flow không tự thêm người lạ vào cảnh.
Ngày 23/09 mình gặp đúng lỗi này. Mình đổi ảnh mẫu của một nhân vật, nhưng video tạo ra vẫn là gương mặt cũ.
Lý do là đoạn mô tả vẫn tả người cũ, và Flow đi theo chữ. Từ hôm đó, mỗi lần đổi ảnh mẫu, phần mềm của mình nhờ AI nhìn ảnh mới rồi viết lại đoạn mô tả. Bạn làm tay thì nhớ tả lại tuổi, tóc, khuôn mặt và trang phục theo ảnh mới.
Mình không tạo video thẳng từ chữ. Mỗi cảnh đi theo 3 bước:
Video bắt đầu từ một ảnh đã đúng mặt nên ít bị “trôi” mặt giữa chừng. Prompt video của mình mở đầu bằng câu:
The attached image is the LITERAL FIRST FRAME; continue it as one continuous vertical 9:16 shot, same people, faces, outfits and room for the whole clip.
Và phần cần tránh có ghi rõ: morphing faces, extra people appearing, the baby looking older. Dòng cuối để bé không bị vẽ lớn hơn 1 tuổi ở cuối clip.
Người xem nhận ra nhân vật qua cả căn nhà của họ. Kênh mẹ và bé dùng chung một đoạn mô tả căn hộ: phòng ngủ có chăn kẻ ô màu be, gấu bông, đèn ngủ vàng và bức tranh nhỏ “Good night my baby”, bếp trắng có ghế ăn dặm. Nhìn lại ảnh ở trên là thấy căn phòng lặp lại qua các video.
Trong một video, mình cũng giữ một nơi, một thời điểm, trừ khi câu chuyện thật sự cần chuyển cảnh.
Kênh sa bàn của mình có một nhân vật chỉ xuất hiện ở cảnh cuối: cô thợ đeo kính, mặc tạp dề nâu. Cùng một ảnh mẫu và một đoạn mô tả, cô giữ gần như nguyên gương mặt qua các video:

Với kênh thời trang thì ngược lại: người mẫu phải đổi đồ liên tục. Mẹo ở đây là đoạn mô tả người mẫu chỉ tả mặt và tóc, không tả quần áo. Quần áo lấy từ ảnh sản phẩm của từng video.

Nói thật là nhìn kỹ vẫn thấy khác. Có cảnh mẹ trông già hơn một chút, có cảnh mặt tròn hơn, tuỳ ánh sáng và góc máy. Với video ngắn lướt trên TikTok hay Shorts thì người xem chấp nhận được. Còn cần giống tuyệt đối như phim thì các cách trên vẫn chưa đủ.
Phần mềm Kênh Mẹ & Bé của mình làm sẵn các bước này: khoá nhân vật, tự dán mô tả và tạo ảnh trước khi tạo video.
Nên có cả hai. Mô tả quyết định phần lớn, nhưng ảnh mẫu giúp Flow giữ các chi tiết khó tả bằng chữ như dáng mặt hay kiểu tóc.
Chỉ khi người đó đồng ý. TikTok cấm video AI dùng hình ảnh của người thường khi chưa xin phép và hình ảnh của trẻ dưới 18 tuổi. Mình đã tóm tắt trong bài TikTok gắn nhãn video AI. Nhân vật của mình đều do AI tạo ra.
Thường là do đoạn mô tả bị viết lại mỗi lần, hoặc bỏ qua bước ảnh khung đầu. Kiểm tra xem prompt của 2 video có cùng một đoạn mô tả không.
Kiến thức AI
AI local làm video là gì, cần card đồ hoạ bao nhiêu GB, nên dùng Wan 2.2, LTX-2.5 hay HunyuanVideo, ComfyUI hay…
Kiến thức AI
So sánh các model tạo video AI mới nhất 2026: chức năng, loại video phù hợp và giá thật của Google Flow…
Kiến thức AI
Nhân vật AI tự tạo mà Flow vẫn báo vi phạm chính sách người nổi tiếng? Vì sao bị nhận nhầm và…
Có bản miễn phí để dùng thử, tải về cài là chạy.