Tôi dùng cùng một công cụ nhân bản giọng nói cho cả video ngắn lẫn podcast — và đây là những gì tôi học được

1 giờ sáng thứ Tư tuần trước, tôi ngồi nhìn chằm chằm vào cái video giới thiệu sản phẩm dài 3 phút. Lời thoại đã sửa đến bản thứ 7, còn giọng tôi thì khàn đặc như vừa cảm xong. Thằng bạn nhắn tin: "Mày suốt ngày nghiên cứu TTS mà sao còn ngồi đó cắn răng chịu đựng?"

Ừ nhỉ. Sao mình còn ngồi đó chịu đựng?

Đêm đó tôi làm lại cả hai thứ: phần lồng tiếng cho video ngắn, và cái đoạn mở đầu podcast mà tôi trì hoãn suốt ba tháng. Cùng là thu âm, nhưng khó khăn ở hai chỗ hoàn toàn khác nhau.

Lồng tiếng video ngắn: nhanh, ổn định, và phải sửa được liên tục

Nỗi đau của lồng tiếng video ngắn gói gọn trong một chữ: sửa. Hôm nay khách bảo giọng nghiêm quá, mai bảo nhịp chậm quá, ngày kia thì đổi luôn cả kịch bản. Nếu lần nào cũng thu lại, cổ họng bạn đầu hàng trước.

Lúc đó tôi mới thấy giá trị của mấy công cụ chuyển văn bản thành giọng nói trực tuyến — kịch bản sửa chỗ nào, tôi sửa đúng đoạn chữ đó, tạo lại một lần, 30 giây sau có file mới. Tốc độ đọc, khoảng nghỉ tôi đều chỉnh được, đỡ hơn hẳn việc tự đứng trước micro rồi NG hết lần này đến lần khác. Tôi bắt đầu thử lồng tiếng video bằng AI miễn phí từ đúng cái đêm đó, và đến giờ vẫn dùng.

Cách tôi làm là vào trang nhân bản giọng nói của VoxClone, tải lên một đoạn ghi âm cũ mà tôi ưng nhất (phòng yên tĩnh, cách mic một nắm tay, đọc khoảng hai phút). Giọng nhân bản ra dùng làm lồng tiếng, âm sắc đồng nhất, người xem không tài nào nhận ra là giọng tổng hợp.

Một cái bẫy nhỏ: đừng viết mấy từ kiểu "hahaha" vào lời thoại, máy đọc ra nghe rất kỳ. Biểu cảm và điểm gây cười cứ để hình ảnh với nhạc nền lo, chữ chỉ cần truyền đạt thông tin rõ ràng. Nếu bạn đang tìm giọng đọc hay miễn phí để thay cho việc tự thu, đây là hướng đáng thử.

Mở đầu podcast: phải có "hồn người" — đây là câu chuyện khác

Podcast không giống vậy. Người nghe đeo tai nghe, 15 giây đầu tiên là quyết định họ ở lại hay không. Chỉ cần hơi máy móc một chút là họ vuốt đi ngay — "Cái này chắc AI đọc chứ gì".

Nên cách tôi làm là phần mở đầu chỉ dùng giọng nhân bản đọc những đoạn cố định: tên chương trình, tôi là ai, chủ đề hôm nay. Còn phần trò chuyện thật thì tôi tự thu. Vậy là đầu chương trình có chất lượng âm thanh đẹp, nhịp ổn định, còn phần giữa giữ được hơi thở và cả những lần nói vấp — đúng rồi, đôi khi nói vấp lại tạo cảm giác gần gũi.

Chất lượng tư liệu huấn luyện trong trường hợp podcast càng quan trọng hơn. Bản đầu tôi dùng một đoạn ghi âm bị rè, giọng nhân bản ra bị lệch âm xát, nghe mà nổi da gà. Đổi tư liệu, tải lại một lần, thế là ổn. Điểm này khá tiện — voice clone không cần đăng ký, chi phí thử sai bằng không, không hài lòng thì đổi đoạn âm thanh khác làm lại. Tôi nghĩ cả những ai đang muốn thu âm audiobook bằng AI miễn phí cũng theo đúng logic này: tư liệu sạch thì kết quả mới nghe được.

Nếu bạn từng so sánh hai thứ này sẽ hiểu: video ngắn theo đuổi hiệu suất và khả năng thay thế, còn podcast theo đuổi sự tin cậy. Cùng một công cụ voice cloning tiếng Việt, hai cách dùng, hai tiêu chuẩn nghiệm thu hoàn toàn khác nhau.

Quy trình tôi đang dùng hằng tuần

Giờ tôi cố định làm như thế này, bạn tham khảo:

  • Viết xong kịch bản thì tự đọc lại một lượt, xóa sạch mọi từ ngữ kiểu văn viết ("theo nguồn tin", "tóm lại" — cắt hết)
  • Lồng tiếng thì tạo toàn bộ bằng giọng nhân bản, xuất file rồi cắt theo timeline
  • Phần mở đầu podcast tạo riêng một bản, chỉnh thông số giọng chậm hơn và nhẹ hơn lồng tiếng một chút
  • Trước khi xuất bản cuối, nghe lại toàn bộ bằng tai nghe — nghe loa điện thoại thấy ổn, nhưng vào tai nghe là mọi tạp âm lộ hết

Thêm một điều nữa: nếu bạn làm nội dung số lượng lớn, VoxClone có API tổng hợp giọng nói miễn phí, gắn vào pipeline script của mình, một ngày ra vài chục bản lồng tiếng cũng không xót. Tôi chưa cần tới mức đó, nhưng biết là có sẵn thì yên tâm hơn.

FAQ

Nhân bản giọng nói của mình, người khác có nhận ra là giọng tổng hợp không?

Với tư liệu sạch thì trong các tình huống thường ngày gần như không nhận ra. Nhưng với podcast — nơi người ta nghe ở khoảng cách gần — tôi khuyên nên dùng kết hợp: đoạn cố định thì tổng hợp, đoạn ngẫu hứng thì thu giọng thật.

Dùng giọng tổng hợp cho lồng tiếng video ngắn, nền tảng có gây khó dễ không?

Hiện tại các nền tảng lớn chưa có quy định cấm tuyệt đối với nội dung lồng tiếng AI, quan trọng là bản thân nội dung có giá trị. Tôi khuyên nên ghi chú rõ hoặc dùng một cách tự nhiên, đừng chỉ sao chép hàng loạt.

Bản miễn phí dùng được bao lâu? Có tự nhiên thu phí không?

Tôi dùng mấy tháng rồi, nhân bản giọng nói miễn phí vẫn không đổi, dùng trực tiếp không cần đăng ký. Tất nhiên không ai dám chắc sản phẩm miễn phí sẽ ra sao sau mười năm nữa, nên cứ giữ backup cho những file âm thanh quan trọng, và đừng xóa đoạn ghi âm gốc dùng để huấn luyện. Bạn muốn tạo giọng nói miễn phí cho nhiều dự án khác nhau thì cứ thử, chẳng mất gì.

Viết ở cuối

2 giờ sáng hôm đó, tôi tạo lại bản lồng tiếng cho video, hôm sau khách không nói gì — trong thế giới của khách hàng thì thế gần như là điểm tuyệt đối. Còn đoạn mở đầu podcast cuối cùng cũng thu xong, chuyện trì hoãn ba tháng, giải quyết trong một đêm.

Nếu bạn cũng đang bị khâu lồng tiếng hành, tối nay thử bỏ ra mười phút: thu một đoạn giọng sạch dài hai phút, vào VoxClone nhân bản thử một bản. Không dùng được thì xóa đi, có mất gì đâu.