Bỏ qua đến nội dung
Kiến thức AI

Cách viết prompt video AI có thoại tiếng Việt trên Google Flow (prompt thật)

25/09/2026 · 7 phút đọc
Ảnh khung đầu và khung hình video AI tạo từ prompt trên Google Flow

Cập nhật lần cuối: 25/09/2026

Tóm tắt nhanh

  • Phần mô tả mình viết bằng tiếng Anh. Lời thoại giữ nguyên tiếng Việt, đặt trong dấu nháy đơn.
  • Chia prompt thành từng khối: [SYSTEM] [ACTION] [DIALOGUE] [VOICE] [LIP_SYNC] [AUDIO] [AVOID].
  • Ghi rõ ai nói câu đầu và chỉ người đang nói mới mấp máy môi. Thiếu dòng này là dễ nói nhầm người.
  • Clip 8 giây: tối đa khoảng 22 từ thoại, mỗi câu 4–12 từ.

Bài này không có prompt mẫu tự nghĩ ra. Mọi prompt dưới đây mình chép từ video thật đã làm cho kênh mẹ và bé và kênh sa bàn, kèm khung hình của chính clip đó.

Ảnh khung đầu và 2 khung hình trong clip mẹ và bé có thoại tiếng Việt
Khung hình thật: ảnh khung đầu (trái) và clip tạo từ ảnh đó bằng Omni 1.1 Flash trên Google Flow.

Clip trên làm bằng Omni 1.1 Flash, vì kênh mẹ và bé cần thoại. Video sa bàn ở cuối bài làm bằng Veo 3.1 Lite. Cách viết prompt giống nhau cho cả hai.

Bước 1: Prompt ảnh khung đầu

Mình luôn tạo ảnh trước, rồi dùng ảnh đó làm khung đầu cho video. Đây là prompt ảnh của cảnh ở trên, rút gọn phần mô tả nhân vật:

[TASK] Single photorealistic vertical 9:16 film frame for a Vietnamese mother-and-baby comedy sketch.
[CHARACTERS] Mẹ = the young mother: (đoạn mô tả cố định) | Bin = the 1-year-old baby boy: (đoạn mô tả cố định).
  Keep each person EXACTLY like their reference photo: same face, age, hair and outfit. Exactly 2 people, nobody else.
[SCENE] Vertical 9:16 frame, cozy dim bedroom at 2 AM with warm bedside lamp glow. Bin sitting upright on the beige checked duvet, looking super serious at camera. Mẹ sitting beside him on left, rubbing her eyes sleepily.
[STYLE] Real people, real skin texture, cinematic warm color grade, soft shallow depth of field, like a polished film still.
[BABY] The baby sits upright, face toward the camera, mouth clearly visible (never lying down, never from behind).
[MOUTHS] the 1-year-old baby boy (Bin) is about to speak (mouth slightly open); everyone else has their mouth CLOSED.
[AVOID] text, captions, watermark, logo, cartoon, 3D render, extra people, extra fingers, distorted baby anatomy.

Hai khối đáng chú ý nhất:

  • [BABY]: khi bé có thoại thì bé phải ngồi thẳng, mặt hướng về máy quay. Bé nằm hoặc quay lưng thì model video hay bỏ luôn câu thoại của bé.
  • [MOUTHS]: chỉ người sắp nói câu đầu hé miệng, người còn lại ngậm miệng. Lý do ở phần lỗi bên dưới.

Bước 2: Prompt video có thoại tiếng Việt

Đây là prompt video thật của cùng cảnh đó:

[SYSTEM] The attached image is the LITERAL FIRST FRAME; continue it as one continuous vertical 9:16 shot, same people, faces, outfits and room for the whole clip.
[ACTION] Bin sits tall and gestures with his small hand firmly. Mẹ yawns heavily and rubs her forehead in disbelief.
[DIALOGUE] The FIRST words of the clip are spoken by the 1-year-old baby boy (Bin), NOT by anyone else. Spoken word for word, in this exact order, natural real-time speed, all finished within 8 seconds:
  1) the 1-year-old baby boy (Bin) speaks in a cute high-pitched TODDLER voice: 'Mẹ ơi họp khẩn! Bỉm này làm mất dáng chủ tịch của em.' - only the baby's lips move, the young mother's mouth stays closed
  Then 2) the young mother (Mẹ) speaks in an adult young woman's voice: 'Hai giờ sáng rồi, đòi hỏi vừa thôi con!' - only the young mother's lips move, the baby's mouth stays closed.
[VOICE] the baby: cute, high-pitched toddler voice with a Northern Vietnamese accent | the young mother: warm, lively young Northern Vietnamese female voice. The baby's lines are ALWAYS in the toddler voice from the baby's own mouth; the mother never says the baby's lines.
[LIP_SYNC] Only the person saying a line moves their lips, only while saying it; the other listens and reacts.
[AUDIO] Only these voices plus soft room ambience, no music.
[AVOID] subtitles, on-screen text, other voices, slow motion, morphing faces, extra people appearing, the baby looking older.

Mỗi khối làm một việc:

  • [SYSTEM]: nói với model rằng ảnh đính kèm là khung đầu, phải giữ nguyên người, mặt, đồ và căn phòng.
  • [ACTION]: một hành động chính của mỗi người, thứ nhìn thấy được.
  • [DIALOGUE]: ai nói trước, nói nguyên văn câu gì, theo thứ tự nào, trong bao nhiêu giây.
  • [VOICE]: giọng từng người, có cả vùng miền. Muốn giọng Bắc thì ghi “Northern Vietnamese accent”.
  • [LIP_SYNC]: chỉ người đang nói mới mấp máy môi.
  • [AUDIO] và [AVOID]: không nhạc nền, không phụ đề, không mặt biến dạng.

Lỗi thật mình gặp và dòng prompt đã sửa nó

Câu của bé bị mẹ nói mất

Ngày 18/09, một clip có câu đầu là của Bin, nhưng người nói lại là mẹ. Nhìn lại ảnh khung đầu thì thấy mẹ đang há miệng, nên model cho mẹ nói trước.

Cách sửa là 3 chỗ cùng lúc: thêm [MOUTHS] vào prompt ảnh để chỉ bé hé miệng, thêm câu “The FIRST words of the clip are spoken by…”, và ghi sau mỗi câu thoại “only … lips move”. Mình ghi luôn vị trí người nói (bên trái, bên phải) khi trong cảnh có 2 người.

Bé nằm thì mất thoại

Cảnh bé nằm trên giường hoặc quay lưng thường ra clip không có câu thoại của bé. Từ đó mình đặt quy tắc: cảnh nào bé nói thì bé ngồi thẳng, mặt hướng về máy quay.

Giữ câu thoại ngắn

Đây là quy tắc mình đặt từ đầu chứ chưa phải lỗi: clip chỉ 8 giây, nên mình giới hạn 2–3 câu mỗi cảnh, mỗi câu 4–12 từ, tổng không quá khoảng 22 từ, và ghi rõ trong prompt là phải nói xong trong 8 giây. Mỗi câu cũng viết đủ chủ ngữ, xưng hô rõ ràng (“Mẹ ơi, con thấy…”) cho dễ hiểu.

Prompt cho video không có thoại

Kênh sa bàn thu nhỏ không có lời nói, chỉ có tiếng động nhẹ. Prompt video ngắn hơn nhiều, và phần quan trọng là giữ cho mô hình không “sống dậy”:

[SYSTEM] The attached image is the LITERAL FIRST FRAME; continue it as one continuous vertical 9:16 shot.
[ACTION] The tweezers carefully lower and place the tiny milk tin upright inside the chalk circle on the soil, release it, and the hand smoothly retracts out of frame.
[CAMERA] slow gentle push-in, very steady. Everything stays a real handmade miniature: figurines do not come alive, only tiny natural motion (water ripples, leaves swaying, smoke curling).
[AUDIO] Only soft ASMR sounds: tweezers clicking, soft rustle, birdsong, water - no speech, no voice, no music.
[AVOID] talking, text, subtitles, morphing, extra hands, the diorama changing layout.
Ảnh từng cảnh và khung hình clip của video sa bàn làm bằng Veo 3.1 Lite
Ảnh thật: ảnh từng cảnh và khung hình ở giây thứ 3 của clip, làm bằng Veo 3.1 Lite.

Câu “figurines do not come alive” để các hình nhân tí hon đứng yên như mô hình thật. Chỉ nước, lá và khói được chuyển động nhẹ, nên clip vẫn giữ cảm giác đang quay một sa bàn.

Khung prompt để bạn dùng ngay

Thay phần trong ngoặc đơn bằng nội dung của bạn:

[SYSTEM] The attached image is the LITERAL FIRST FRAME; continue it as one continuous vertical 9:16 shot, same people, faces, outfits and place for the whole clip.
[ACTION] (1 hành động chính, nhìn thấy được)
[DIALOGUE] The FIRST words are spoken by (người A, vị trí trái/phải). Spoken word for word, in this exact order, all finished within 8 seconds:
  1) (người A) speaks: '(câu tiếng Việt)' - only (người A)'s lips move
  Then 2) (người B) speaks: '(câu tiếng Việt)' - only (người B)'s lips move
[VOICE] (người A): (giọng, tuổi, vùng miền) | (người B): (giọng, tuổi, vùng miền)
[LIP_SYNC] Only the person saying a line moves their lips; the other listens and reacts.
[AUDIO] Only these voices plus soft room ambience, no music.
[AVOID] subtitles, on-screen text, other voices, morphing faces, extra people appearing.

Nếu không muốn tự viết từng cảnh, phần mềm làm video của mình tự dựng prompt theo khung này cho mọi cảnh. Còn nếu nhân vật của bạn hay bị đổi mặt giữa các cảnh, xem thêm bài cách giữ nhân vật AI không đổi mặt.

Câu hỏi thường gặp

Viết prompt bằng tiếng Việt hoàn toàn được không?

Được, nhưng mình viết phần mô tả bằng tiếng Anh và chỉ để lời thoại bằng tiếng Việt. Cách này giúp tách bạch phần “tả cảnh” với phần “nói nguyên văn”, và mình dễ kiểm tra hơn.

Làm sao để nhân vật nói giọng Bắc hoặc giọng Nam?

Ghi thẳng vào khối [VOICE], ví dụ “Northern Vietnamese accent” hoặc “Southern Vietnamese accent”, kèm tuổi và tính cách giọng nói.

Một clip 8 giây nên có bao nhiêu câu thoại?

Mình để 2–3 câu ngắn, tổng khoảng 22 từ trở xuống, để nhân vật nói ở tốc độ bình thường mà vẫn kịp trong 8 giây.

Bài cùng chủ đề

Làm video nhanh hơn với phần mềm của mình

Có bản miễn phí để dùng thử, tải về cài là chạy.