Vishing do AI hỗ trợ nguy hiểm đến đâu? Vì sao đào tạo chống lừa đảo kiểu cũ không còn đủ
Vishing tăng gấp đôi nhờ AI nhân bản giọng nói chỉ từ 3-30 giây âm thanh. Vì sao chương trình đào tạo an ninh mạng cũ không còn đủ để chống lại nó.

Vishing là gì và vì sao hình thức lừa đảo này đang tăng nhanh?
Vishing — viết tắt của voice phishing — là lừa đảo qua cuộc gọi điện thoại, thường mạo danh ngân hàng, cơ quan nhà nước, hoặc chính đồng nghiệp cấp trên. Khác với email phishing, vishing tận dụng áp lực thời gian thực: nạn nhân phải quyết định trong vài phút, không có thời gian kiểm tra chéo.
Kịch bản phổ biến gần như không đổi qua nhiều năm: kẻ gian tạo tình huống khẩn cấp (tài khoản bị khóa, giao dịch bất thường, người thân gặp nạn), sau đó dẫn dụ nạn nhân đọc mã OTP, cung cấp thông tin xác thực, hoặc trực tiếp chuyển tiền. Điều thay đổi là tốc độ và quy mô kẻ gian có thể triển khai kịch bản này.
Theo báo cáo Threat Hunting 2026 của CrowdStrike, số vụ vishing trong nửa đầu năm 2026 đã tăng gấp đôi so với nửa cuối năm 2025 — mức tăng 100%. Đây không phải cú nhảy đột ngột: giai đoạn 2024–2025 trước đó đã ghi nhận mức tăng 134%. Nói cách khác, vishing đang tăng liên tục theo cấp số nhân, không phải một đợt bùng phát nhất thời.
AI đã làm cuộc gọi lừa đảo khác trước như thế nào?
Rào cản kỹ thuật lớn nhất của vishing truyền thống là chất lượng diễn xuất: kẻ gian phải giả giọng, giả cảm xúc, và dễ bị phát hiện qua ngữ điệu lạ. Công nghệ nhân bản giọng nói bằng AI xóa bỏ rào cản đó.
Chỉ cần khoảng 30 giây âm thanh — một đoạn voice message, video mạng xã hội, hay đoạn ghi âm cuộc gọi cũ — là đủ để tạo ra bản sao giọng nói gần như không thể phân biệt bằng tai người. Một số công cụ còn đi xa hơn: nghiên cứu của McAfee cho thấy chỉ 3 giây âm thanh đã có thể tạo ra bản clone đạt độ khớp giọng tới 85%.
Hệ quả là toàn bộ nền tảng niềm tin dựa trên "nhận ra giọng nói người quen" sụp đổ. Một nhân viên tài chính nghe đúng giọng CEO, một người con nghe đúng giọng mẹ đang "gặp nạn" — phản xạ tự nhiên là tin tưởng, không phải nghi ngờ. Kẻ gian không cần đánh lừa logic, chỉ cần đánh lừa cảm giác quen thuộc.

Thiệt hại thực tế của vishing lớn đến mức nào?
Số liệu từ TransUnion tại Colombia cho một góc nhìn cụ thể: trong nhóm người đã thực sự mất tiền vì lừa đảo kỹ thuật số, 25% cho biết nguyên nhân là vishing — tức cứ 4 nạn nhân mất tiền thì có 1 người bị lừa qua cuộc gọi hoặc voice message.
Ở phạm vi rộng hơn, trong nhóm người từng bị nhắm mục tiêu bởi lừa đảo kỹ thuật số (không nhất thiết mất tiền), tỷ lệ báo cáo bị vishing lên tới 27% — cao nhất trong các hình thức lừa đảo được khảo sát. Mức thiệt hại trung bình mỗi nạn nhân bị mất tiền vào khoảng 10,388,061 peso Colombia.
Điểm đáng chú ý là vishing hiếm khi diễn ra trong một cuộc gọi duy nhất. Nạn nhân thường bị dẫn qua nhiều bước: một cuộc gọi tạo lo lắng, một tin nhắn "xác nhận danh tính", rồi cuộc gọi thứ hai chốt giao dịch. Chuỗi bước này khiến nạn nhân mất cảnh giác dần, thay vì bị tấn công dồn một lần — đây chính là lý do vishing hiệu quả hơn nhiều hình thức lừa đảo đơn lẻ khác.
Vì sao các khóa đào tạo an ninh mạng hiện nay có thể không còn hiệu quả?
Phần lớn chương trình đào tạo chống vishing tại doanh nghiệp vẫn dựa trên logic cũ: dạy nhân viên nhận ra số điện thoại lạ, giọng nói gượng gạo, hoặc kịch bản nghe "có gì sai sai". Đó là những dấu hiệu con người dễ tạo ra khi giả mạo — nhưng AI không tạo ra những dấu hiệu đó nữa.
Khi giọng nói giả gần như hoàn hảo và caller ID có thể bị giả mạo song song, toàn bộ tập tín hiệu mà nhân viên được huấn luyện để nhận diện trở nên vô nghĩa. Vấn đề không còn nằm ở việc "nghe có đáng tin không", mà ở việc "kênh liên lạc này có đáng tin không" — một câu hỏi hoàn toàn khác.
Thực tế là nhiều tổ chức chưa cập nhật nội dung đào tạo để phản ánh sự dịch chuyển này. Các bài huấn luyện vẫn tập trung mô phỏng giọng điệu đáng ngờ, thay vì huấn luyện phản xạ xác minh độc lập bất kể cuộc gọi nghe thuyết phục đến đâu. Đây là khoảng trống mà tội phạm mạng đang khai thác triệt để.
Cá nhân và tổ chức nên thay đổi cách xác minh cuộc gọi ra sao?
Nguyên tắc cốt lõi cần thay đổi: không đánh giá độ tin cậy dựa trên cái nghe được, mà dựa trên kênh xác minh độc lập. Một cuộc gọi đến, dù giọng nói quen thuộc đến đâu, không bao giờ là bằng chứng đủ để hành động ngay.
- Không bao giờ đọc mã OTP hoặc mã xác thực qua điện thoại, bất kể người gọi tự xưng là ai
- Chủ động ngắt máy và gọi lại theo số điện thoại chính thức đã lưu trước, không dùng số do người gọi cung cấp
- Áp dụng quy trình phê duyệt hai bước (dual authorization) cho mọi yêu cầu chuyển tiền bất thường
- Xác minh qua kênh thứ hai độc lập — ví dụ tin nhắn nội bộ hoặc gọi video — trước khi thực hiện giao dịch
- Cảnh giác đặc biệt với yêu cầu có tính gấp gáp, ngoài giờ làm việc, hoặc lệch khỏi quy trình thông thường
Ở cấp độ tổ chức, mô phỏng tấn công cần chạy thường xuyên hơn — lý tưởng là hàng tháng — và kết hợp nhiều kênh trong cùng một tình huống (gọi điện, email, tin nhắn) vì kẻ gian thực tế cũng phối hợp như vậy. Đào tạo lại ngay sau khi nhân viên "mắc bẫy" mô phỏng hiệu quả hơn nhiều so với xử phạt, vì mục tiêu là xây phản xạ, không phải gây sợ hãi.
Quan trọng hơn cả kỹ thuật xác minh: MFA không nên được xử lý qua điện thoại. Nhân viên cần được huấn luyện rằng bất kỳ yêu cầu "xác nhận đăng nhập" qua cuộc gọi đến đều là dấu hiệu cảnh báo, không phải quy trình hợp lệ.
Câu hỏi chưa có lời giải: liệu xác minh danh tính bằng giọng nói có còn ý nghĩa?
Nhiều ngân hàng và tổng đài dịch vụ khách hàng vẫn dùng giọng nói làm một lớp xác thực. Khi AI có thể nhân bản giọng nói từ vài giây âm thanh công khai, câu hỏi thực sự không phải là "nên đào tạo nhân viên kỹ hơn", mà là liệu giọng nói — với tư cách một yếu tố xác thực — còn xứng đáng được tin cậy trong bất kỳ hệ thống bảo mật nào nữa, hay đã đến lúc loại bỏ nó hoàn toàn khỏi chuỗi xác minh.
Related in AI

Bill Gates cảnh báo AI có thể gây thảm họa chết người thế giới vẫn thiếu kế hoạch an toàn

Hacker dùng AI tấn công gần 100 công ty, đánh cắp 600.000 thẻ tín dụng chỉ với 8.000 USD

Meta đặt cược vào giá 1.299 USD để kéo kính VR ra khỏi phân khúc siêu cao cấp
