Bỏ qua đến nội dung
Kiến thức AI

AI local làm video: máy nào chạy được, dùng model gì, có đáng không?

29/09/2026 · 6 phút đọc
AI local làm video

Cập nhật lần cuối: 29/09/2026

Tóm tắt nhanh

  • AI local là cài model AI lên máy mình và chạy bằng card đồ hoạ: không tốn credit, không giới hạn lượt, dữ liệu không rời máy.
  • Muốn tạo video bằng AI local cho dễ thở thì cần card từ 12GB, còn làm việc thật thì 24GB. Card 8GB vẫn chạy được nhưng rất chậm.
  • Model đáng dùng nhất lúc này: Wan 2.2, LTX-2.5 (có cả tiếng), HunyuanVideo 1.5. Phần mềm: ComfyUI, hoặc Wan2GP cho máy yếu.
  • Chất lượng vẫn thua Veo, Kling. Mình dùng AI local cho việc phụ: kịch bản, phụ đề, lồng tiếng, phóng to, làm mượt. Cảnh chính vẫn làm trên Flow.

“AI local” nghe rất hấp dẫn: cài một lần, tạo video thả ga, khỏi lo hết credit. Mình cũng từng nghĩ vậy. Làm thật mới thấy có cái đúng, có cái không.

Bài này mình kể lại để bạn biết máy mình làm được tới đâu, trước khi mất nguyên buổi ngồi cài đặt.

AI local là gì?

Là bạn tải model AI về và chạy ngay trên máy tính của mình, thay vì gửi lên web như Google Flow hay Kling. Máy bạn làm hết mọi việc, nên:

  • Không tốn credit, không giới hạn số lượt tạo.
  • Tải model xong thì không cần mạng.
  • Ảnh, video, kịch bản của bạn không gửi đi đâu cả.

Đổi lại, mọi thứ phụ thuộc vào card đồ hoạ. Card yếu thì chậm, hoặc chạy không nổi.

Máy như nào mới chạy được?

Thứ quan trọng nhất là bộ nhớ của card đồ hoạ (VRAM), không phải CPU. Card NVIDIA dễ chạy nhất. Card AMD vẫn dùng được với vài công cụ nhưng hay trục trặc hơn.

Card đồ hoạ nào chạy được AI video theo VRAM 8GB, 12GB, 16GB, 24GB
Bảng mình tổng hợp. Máy có thêm RAM 32GB sẽ đỡ hơn nhiều, vì phần mềm đẩy bớt model sang RAM khi card không đủ.

Để dễ hình dung: theo số liệu chính hãng của Wan 2.2, bản 5B tạo 1 clip 5 giây 720p mất khoảng 9 phút trên RTX 4090, dùng gần 23GB bộ nhớ. Đó là card mạnh nhất dành cho người dùng thường. Máy yếu hơn thì lâu hơn nhiều.

Bảng thời gian tạo video và bộ nhớ của Wan 2.2 trên các card đồ hoạ
Thời gian (giây, màu xanh) và bộ nhớ (GB, màu đỏ) của Wan 2.2. Dòng 4090 là card cho người dùng thường, còn lại là card máy chủ. Nguồn: GitHub Wan2.2, giấy phép Apache 2.0.

Còn ổ cứng: mỗi model nặng cỡ vài chục GB. Bộ đầy đủ của LTX-2 tải về khoảng 66GB. Bạn nên chuẩn bị ổ SSD trống ít nhất 100GB.

Các model video chạy được trên máy (09/2026)

Wan 2.2 (Alibaba)

Model mã nguồn mở phổ biến nhất, giấy phép Apache 2.0 nên dùng cho việc thương mại cũng thoải mái. Có bản nhỏ 5B chạy được trên card 8GB khi dùng bản nén, và bản 14B cho card mạnh. Tạo video từ chữ hoặc từ ảnh, 720p, khoảng 5 giây mỗi clip.

Lưu ý: Wan 3.0 mới ra hiện chủ yếu dùng qua web và API. Bản tải về chạy máy phổ biến nhất vẫn là 2.2.

LTX-2.5 (Lightricks)

Điểm hay nhất: tạo cả hình lẫn tiếng cùng lúc (tiếng động, lời nói), có cả bản 4K. Nhưng khá nặng, muốn chạy mượt 1080p thì cần card 24GB. Card 12GB dùng bản nén của LTX-2.3 được, chất lượng giảm đi.

HunyuanVideo 1.5 (Tencent)

Chuyển động đẹp, có chất điện ảnh. Cần khoảng 14GB bộ nhớ khi dùng bản FP8 và đẩy bớt sang RAM, nên hợp card 16GB trở lên.

Phần mềm để chạy: ComfyUI hay Wan2GP?

Model chỉ là “bộ não”, bạn cần thêm phần mềm để điều khiển nó. Hai cái phổ biến nhất:

  • ComfyUI: mạnh nhất, làm được gần như mọi thứ bằng cách nối các khối với nhau. Nhưng người mới nhìn vào sẽ thấy hơi rối.
  • Wan2GP (WanGP): làm riêng cho máy yếu, có model chạy từ 6GB. Gom sẵn Wan, LTX, Hunyuan, cả tạo ảnh và lồng tiếng vào một giao diện. Cài một chạm qua Pinokio. Bản mới nhất 13.14 ra ngày 27/09/2026.
Giao diện ComfyUI với các khối nối nhau để tạo ảnh bằng AI
Giao diện ComfyUI: mỗi khối là một bước (tải model, viết prompt, tạo, lưu). Ảnh từ GitHub ComfyUI, giấy phép GPL-3.0.

Lời khuyên của mình: mới bắt đầu thì dùng Wan2GP qua Pinokio cho đỡ mệt. Khi đã quen và muốn tự dựng quy trình riêng thì chuyển sang ComfyUI.

Máy yếu vẫn làm được nhiều việc

Phần này mình thấy đáng nhất. Tạo video thì nặng, nhưng mấy việc “phụ” dưới đây chạy nhẹ, máy tầm trung vẫn làm ngon, mà lại giúp video chỉn chu hơn hẳn:

  • Viết kịch bản, dịch: chạy model chữ bằng Ollama. Một model cỡ 9B chỉ nặng khoảng 6–7GB.
  • Làm phụ đề tự động: Whisper nghe lời thoại rồi ra file phụ đề. Máy không có card rời vẫn chạy được, chỉ chậm hơn.
  • Lồng tiếng: các model đọc chữ như OmniVoice, Index TTS có sẵn trong Wan2GP.
  • Phóng to ảnh, video bị mờ: Real-ESRGAN.
  • Làm chuyển động mượt hơn, làm slow motion: RIFE chèn thêm khung hình vào giữa.
So sánh ảnh trước và sau khi phóng to bằng Real-ESRGAN
Trái: ảnh gốc bị mờ. Phải: sau khi phóng to bằng Real-ESRGAN. Ảnh từ GitHub Real-ESRGAN, giấy phép BSD-3.
RIFE chèn khung hình làm chuyển động mượt và slow motion
RIFE chèn thêm khung hình để chuyển động mượt hơn. Ảnh động từ GitHub RIFE, giấy phép MIT.

Có đáng không? So với Flow thì sao?

Nói thật: chất lượng video AI local vẫn thua Veo, Kling một bậc, nhất là mặt người, tay chân và lời thoại tiếng Việt. Lại còn chậm: trong lúc máy tạo video thì gần như không làm được việc gì khác.

Tiền điện thì rẻ. Card chạy khoảng 300–450W, 10 phút ra một clip tốn chừng 0,05–0,08 kWh, tức vài trăm đồng. Cái đắt là tiền mua card: card 24GB giá vài chục triệu.

Cách mình đang làm: cảnh chính vẫn tạo trên Google Flow cho nhanh và đẹp. AI local lo phần phụ: kịch bản, phụ đề, lồng tiếng, phóng to, làm mượt. Kết hợp như vậy vừa đỡ tốn credit, vừa không phải sắm máy khủng. Nếu bạn đang phân vân chọn dịch vụ nào, mình có bài so sánh các model video AI và giá.

Muốn thử tạo video local mà máy yếu thì có thể thuê card theo giờ trên các dịch vụ cho thuê GPU, tầm 0,3–0,7 USD mỗi giờ cho card cỡ RTX 4090, tuỳ nơi. Thử xong hãy quyết có nên mua card hay không.

Câu hỏi thường gặp

Laptop chơi game chạy được không?

Được nếu card rời có từ 8GB. Nhưng laptop nóng nhanh và tự giảm hiệu năng khi chạy lâu, nên cắm sạc và kê cho thoáng.

Máy Mac thì sao?

Mac chip M dùng chung bộ nhớ nên chạy được một số model qua ComfyUI, nhưng chậm hơn card NVIDIA cùng tầm giá, và nhiều công cụ video chưa hỗ trợ tốt.

Video làm bằng AI local có dùng để bán hàng được không?

Tuỳ giấy phép từng model. Wan 2.2 dùng Apache 2.0 nên thoải mái. LTX và HunyuanVideo có giấy phép riêng kèm điều kiện, bạn nên đọc kỹ trước khi dùng cho việc kinh doanh.

Nếu bạn làm nhiều video trên Flow, phần mềm của mình tự động từ kịch bản, ảnh, clip đến ghép thành video. Xem các phần mềm ở đây.

Nguồn: Wan 2.2, LTX-2, HunyuanVideo 1.5, Wan2GP, ComfyUI, Real-ESRGAN, RIFE.

Bài cùng chủ đề

Làm video nhanh hơn với phần mềm của mình

Có bản miễn phí để dùng thử, tải về cài là chạy.