Kỹ thuật giữ nhất quán nhân vật (Consistent Character) khi tạo Video AI toàn tập

Trong quy trình sản xuất video ngắn (TikTok, Reels, Shorts) hoặc phim ngắn AI, thách thức lớn nhất mà mọi Creator gặp phải chính là sự thiếu nhất quán của nhân vật (Character Inconsistency). Ở cảnh quay đầu tiên, nhân vật có thể sở hữu gương mặt châu Á thanh tú, nhưng sang cảnh thứ hai lại biến thành một gương mặt hoàn toàn khác, hoặc trang phục và kiểu tóc bị thay đổi hỗn loạn.
Sự đứt gãy về mặt thị giác này khiến video mất đi tính chuyên nghiệp và khó giữ chân người xem. Bài viết này sẽ hướng dẫn bạn toàn bộ tư duy kỹ thuật, bộ prompt chuẩn hóa và quy trình 3 bước nâng cao để kiểm soát 100% hình mẫu nhân vật xuyên suốt các phân cảnh.
1. Bản chất cốt lõi của bài toán “Consistent Character”
Các mô hình AI sinh video hiện nay như Kling AI, Luma Dream Machine hay Runway Gen-3 hoạt động dựa trên cơ chế xác suất ngẫu nhiên. Khi bạn chỉ nhập prompt bằng văn bản (Text-to-Video) cho từng cảnh, AI sẽ tự động “sáng tạo” ra một gương mặt mới phù hợp với mô tả đó chứ không hề có trí nhớ về nhân vật ở cảnh trước.
Để giải quyết vấn đề này, quy trình của các chuyên gia sản xuất nội dung AI dựa trên nguyên lý 3 mỏ neo (3 Anchors):
- Mỏ neo nhận diện (Face Anchor): Tạo ra bộ ảnh gốc (Master Sheet) chứa gương mặt chuẩn của nhân vật từ nhiều góc độ.
- Mỏ neo đặc trưng (Feature Anchor): Cố định các chi tiết dễ nhận biết như kiểu tóc, vết sẹo, mắt kính, nốt ruồi hoặc màu sắc trang phục đặc trưng.
- Mỏ neo khung hình (Frame Anchor): Sử dụng ảnh gốc làm khung hình bắt đầu (Start Frame) hoặc kết thúc (End Frame) khi đưa vào các công cụ sinh video Image-to-Video.
2. Quy trình 3 bước thực hiện chi tiết
Bước 1: Tạo bộ ảnh gốc (Master Character Sheet) chuẩn hóa
Tránh việc vừa tạo video vừa nghĩ ra nhân vật. Hãy dành thời gian tạo ra một “hồ sơ nhân vật” bằng Midjourney hoặc Flux trước khi bắt tay vào làm video.
1.1. Cấu trúc Prompt tạo nhân vật bằng Midjourney
Sử dụng tham số --cref (Character Reference) kết hợp với --cw (Character Weight) để cố định đường nét:
Prompt mẫu:
A cinematic portrait of a 25-year-old Vietnamese woman, natural subtle makeup, long straight black hair, wearing a white minimalist linen shirt, natural lighting, shot on 85mm lens, photorealistic, 8k resolution, character sheet, front view, side view, back view –ar 16:9 –v 6.0 –cw 100
1.2. Giải mã các tham số quan trọng:
--cref [URL_Ảnh_Mẫu]: Giúp Midjourney sao chép cấu trúc gương mặt từ bức ảnh gốc bạn tải lên.--cw 100: Mức độ giữ nguyên 100% từ khuôn mặt, kiểu tóc cho đến trang phục. Nếu bạn muốn giữ lại gương mặt nhưng thay đổi trang phục cho cảnh sau, hãy hạ xuống--cw 0.- Character Sheet: Từ khóa này bắt AI tạo ra cùng một nhân vật ở 3-4 góc nhìn khác nhau (chính diện, góc nghiêng 45 độ, góc nghiêng 90 độ) trong cùng một bức ảnh.
Bước 2: Tạo chuyển động mượt mà bằng Kling AI & Luma Dream Machine
Sau khi chọn được bức ảnh nhân vật ưng ý nhất từ Bước 1, bạn sẽ chuyển sang khâu biến ảnh tĩnh thành video sinh động mà không làm biến dạng khuôn mặt.
2.1. Kỹ thuật điều khiển Prompt trong Image-to-Video
Khi sử dụng chế độ Image-to-Video, bạn KHÔNG mô tả lại khuôn mặt hay ngoại hình nhân vật trong prompt nữa. Hãy để AI đọc thông tin đó từ bức ảnh bạn đã tải lên. Prompt lúc này chỉ tập trung mô tả Hành động (Action) và Góc máy (Camera Movement).
- Prompt sai (Dễ làm AI bị nhiễu): A beautiful Vietnamese woman with long black hair turning her head and smiling.
- Prompt đúng (Chuẩn kỹ thuật): Slow motion, medium close-up shot, the character turns her head slowly to the camera with a subtle smile, cinematic soft lighting, wind blowing through hair, 4k.
2.2. Kỹ thuật First & Last Frame (Khung hình đầu – Khung hình cuối)
Đây là kỹ thuật nâng cao trên Luma Dream Machine và Kling AI giúp bạn kiểm soát hoàn toàn quỹ đạo chuyển động của nhân vật giữa 2 trạng thái:
- Chuẩn bị: Chọn Ảnh A (Nhân vật đang ngồi đọc sách) và Ảnh B (Nhân vật đứng dậy ngước nhìn ra cửa sổ). Cả 2 ảnh đều phải được tạo từ cùng bộ nhân vật gốc ở Bước 1.
- Thiết lập:
- Tải Ảnh A vào ô Start Frame.
- Tải Ảnh B vào ô End Frame.
- Nhập Prompt: Smooth camera panning, the character transitions from reading to standing up and looking towards the window.
- Kết quả: AI sẽ tự động tính toán các khung hình ở giữa (Interpolation) để tạo ra chuyển động tự nhiên nhất mà nhân vật vẫn giữ nguyên 100% nét mặt từ đầu đến cuối.
Bước 3: Đồng bộ âm thanh & Xử lý hậu kỳ tinh chỉnh
Dù hình ảnh đã nhất quán, video vẫn có thể bị “sượng” nếu khẩu hình miệng không khớp với lời thoại hoặc khuôn mặt bị biến dạng nhẹ ở một vài giây cuối của clip.
- Sử dụng Live Portrait hoặc Hedra/HeyGen: Nếu video có lời thoại dài, hãy đưa bức ảnh nhân vật gốc vào các công cụ tạo Avatar AI nói chuyện chuyên dụng để ép khẩu hình khớp chính xác 100% với file âm thanh Voiceover.
- Cắt gọt bằng CapCut (Pacing):
- Chỉ lấy đoạn chuyển động đẹp nhất từ Kling AI (thường là từ giây 0 đến giây thứ 3 hoặc 4).
- Cắt bỏ phần biến dạng (nếu có) ở cuối clip.
- Áp dụng bộ lọc màu (Color Grading) thống nhất cho tất cả các clip để tạo cảm giác toàn bộ video được quay trong cùng một môi trường ánh sáng.
3. Bộ Checklist & Mẹo thực chiến cho Creator
- Sử dụng trang phục có điểm nhấn rõ ràng: Thiết kế cho nhân vật một món phụ kiện cố định (ví dụ: một chiếc tai nghe đỏ, một chiếc kính râm, hoặc một chiếc áo hoodie màu vàng). AI nhận diện vật thể rất tốt, việc cố định phụ kiện sẽ “đánh lừa” thị giác người xem, khiến họ cảm nhận nhân vật luôn nhất quán ngay cả khi đường nét khuôn mặt có sai lệch nhẹ.
- Tránh thay đổi góc máy quá đột ngột: Chuyển từ góc cận mặt (Close-up) sang góc cực xa (Extreme Long Shot) trong hai cảnh liên tiếp dễ khiến AI bỏ qua các chi tiết khuôn mặt. Hãy chuyển cảnh theo thứ tự hợp lý: Toàn cảnh $\rightarrow$ Trung cảnh $\rightarrow$ Cận cảnh.
- Lưu giữ Seed Number: Luôn ghi lại số
Seedcủa các bức ảnh đẹp trong Midjourney hoặc Stable Diffusion để tái sử dụng khi cần mở rộng cốt truyện cho các video tiếp theo.
4. Tổng kết quy trình phối hợp công cụ
| Bước | Công cụ đề xuất | Mục tiêu cốt lõi |
| 1. Tạo nhân vật | Midjourney / Flux.1 | Tạo bộ ảnh gốc 360 độ cố định khuôn mặt (--cref). |
| 2. Tạo video | Kling AI / Luma Dream Machine | Chuyển ảnh tĩnh thành clip ngắn qua chế độ Image-to-Video. |
| 3. Xử lý voice/môi | ElevenLabs + Hedra / HeyGen | Lồng tiếng người thật và đồng bộ khẩu hình nhân vật. |
| 4. Biên tập | CapCut PC | Cắt ghép, chỉnh màu, thêm phụ đề tự động và nhạc nền. |
Áp dụng đúng tư duy và quy trình 3 bước này, bạn hoàn toàn có thể tự tay sản xuất những bộ phim ngắn AI hay video storytelling nhiều tập với chất lượng hình ảnh đồng nhất và chuyên nghiệp!

