AI có thể lần ra danh tính thật sau tài khoản ảo với tính ẩn danh trên internet đang đối mặt với thách thức mới khi các tác tử trí tuệ nhân tạo (AI) có thể kết nối những dấu vết thông tin rải rác để xác định danh tính người dùng. Một nghiên cứu của các nhà khoa học thuộc ETH Zurich, MATS và Anthropic cho thấy quá trình này có thể đạt độ chính xác cao với chi phí chỉ từ 1–4 USD cho mỗi lượt rà soát.
AI khiến việc truy tìm danh tính trực tuyến trở nên dễ dàng hơn
Trong nhiều năm, việc xác định danh tính thật đằng sau một tài khoản trực tuyến thường đòi hỏi kỹ năng điều tra, nhiều giờ tìm kiếm và quá trình đối chiếu dữ liệu thủ công. Tuy nhiên, sự phát triển của các mô hình ngôn ngữ lớn (LLM) đang làm thay đổi đáng kể cách thức thực hiện công việc này.
Theo một nghiên cứu được công bố trên kho lưu trữ tiền xuất bản arXiv, các nhà khoa học thuộc Viện Công nghệ Liên bang Thụy Sĩ (ETH Zurich), tổ chức MATS và công ty Anthropic đã thử nghiệm khả năng sử dụng tác tử AI để nhận diện người dùng ẩn danh trên internet.
Điểm đáng chú ý là chi phí cho mỗi lượt rà soát chỉ khoảng 1–4 USD. Nhờ khả năng tự động thu thập thông tin, phân tích ngữ cảnh và đối chiếu dữ liệu từ nhiều nguồn, AI có thể hoàn thành những nhiệm vụ từng tiêu tốn nhiều giờ lao động của con người chỉ trong vài phút.
Nhà nghiên cứu Joshua Swanson, một trong những tác giả công trình, nhấn mạnh khả năng nhận diện người dùng ẩn danh trên quy mô lớn là bước đột phá đáng chú ý. Thay vì chỉ tìm kiếm những thông tin nhận dạng đã được lưu trữ trong cơ sở dữ liệu có cấu trúc, AI có thể phân tích các bài đăng và bình luận tự nhiên để tìm ra mối liên hệ giữa chúng.

Thử nghiệm cho thấy AI có thể xác định chính xác nhiều tài khoản ẩn danh
Để kiểm chứng năng lực của hệ thống, nhóm nghiên cứu đã tiến hành các thử nghiệm trên nhiều nhóm tài khoản trực tuyến. Một trong những thử nghiệm chính sử dụng dữ liệu của người dùng diễn đàn công nghệ Hacker News, những người có tài khoản được liên kết với hồ sơ nghề nghiệp trên LinkedIn.
Nhóm nghiên cứu loại bỏ các thông tin nhận dạng trực tiếp như tên thật, đường dẫn liên kết và tên người dùng trước khi để tác tử AI tự tìm kiếm trên internet, suy luận và xác định danh tính của từng mục tiêu.
Kết quả, hệ thống nhận diện đúng 226 trong tổng số 338 người, tương đương tỷ lệ tìm ra mục tiêu 67%, với độ chính xác đạt 90%. Nói cách khác, AI xác định được khoảng hai phần ba số người trong nhóm thử nghiệm và phần lớn các trường hợp được hệ thống đề xuất đều chính xác.
Ở thử nghiệm với 25 tài khoản Reddit của các học giả, sau khi loại bỏ tên và tiêu đề luận văn, AI xác định đúng 13 người, đạt tỷ lệ 52% và độ chính xác 72%. Trong một nhóm khác gồm 36 tài khoản thường thảo luận về lộ trình nghề nghiệp trong ngành kỹ thuật phần mềm, hệ thống tìm ra chính xác 9 người. Tỷ lệ nhận diện đạt 25%, trong khi độ chính xác vẫn ở mức 90%.
Các kết quả cho thấy hiệu quả của AI thay đổi tùy thuộc vào lượng thông tin có sẵn và đặc điểm của từng nhóm tài khoản. Dù chưa thể nhận diện tất cả người dùng, công nghệ này vẫn có khả năng tạo ra rủi ro đáng kể khi được triển khai trên quy mô lớn.

Những mảnh ghép thông tin nhỏ có thể tiết lộ danh tính thật
Một tài khoản trực tuyến có thể không chứa tên thật, địa chỉ hoặc thông tin liên hệ trực tiếp. Tuy nhiên, người dùng vẫn thường để lại nhiều dấu vết trong quá trình tương tác trên mạng.
Đó có thể là một bình luận nhắc đến môn học từng theo học, một bài đăng đề cập đến thành phố đang sinh sống, thông tin về công việc, sở thích cá nhân hoặc một công cụ phần mềm thường sử dụng. Khi đứng riêng lẻ, các chi tiết này dường như không đủ để xác định một cá nhân cụ thể.
Nhưng khi được thu thập và phân tích đồng thời, chúng có thể tạo thành một hồ sơ đặc trưng, giúp phân biệt người này với hàng triệu người dùng khác. AI có lợi thế trong việc nhận diện những mối liên hệ ngữ nghĩa mà các phương pháp tìm kiếm thông thường dễ bỏ qua.
Quy trình nhận diện trong nghiên cứu gồm bốn bước chính. Đầu tiên, mô hình ngôn ngữ lớn trích xuất những chi tiết có khả năng định danh từ lịch sử bài viết. Tiếp đó, hệ thống sử dụng các biểu diễn nhúng (embeddings) để chuyển đổi ngữ nghĩa thành dữ liệu toán học, qua đó thu hẹp danh sách ứng viên.
Ở bước thứ ba, một mô hình AI có năng lực suy luận mạnh hơn phân tích các ứng viên tiềm năng và đối chiếu bằng chứng. Cuối cùng, hệ thống đánh giá mức độ tin cậy và có thể từ chối đưa ra kết luận nếu thông tin chưa đủ thuyết phục. Cách tiếp cận này giúp AI xử lý hiệu quả dữ liệu phi cấu trúc, vốn rất phổ biến trong các bài đăng và bình luận trên mạng xã hội.
AI có thể liên kết tài khoản của cùng một người qua nhiều năm
Một phát hiện đáng chú ý khác là khả năng liên kết tài khoản ngay cả khi lịch sử hoạt động được chia thành các giai đoạn cách xa nhau.
Trong thử nghiệm với Reddit, nhóm nghiên cứu tách lịch sử bình luận của người dùng thành hai phần trước và sau, đồng thời tạo khoảng cách một năm giữa hai giai đoạn. Cách thiết kế này nhằm hạn chế khả năng AI dựa vào những sự kiện thời sự trùng lặp để nhận diện người dùng. Dù gặp điều kiện khó khăn hơn, phiên bản AI mạnh nhất vẫn liên kết thành công 38,4% người dùng với độ chính xác lên tới 99%.
Kết quả này cho thấy các dấu vết nhận dạng không nhất thiết phải xuất hiện trong cùng một thời điểm. Những thông tin được chia sẻ từ nhiều năm trước vẫn có thể trở thành manh mối khi được đối chiếu với hoạt động gần đây.
Đối với người dùng thường xuyên sử dụng nhiều biệt danh trên các nền tảng khác nhau, nguy cơ không chỉ nằm ở việc một tài khoản bị nhận diện. Nếu các tài khoản có thể được liên kết với cùng một cá nhân, những thông tin từng được chia sẻ trong các bối cảnh riêng biệt cũng có nguy cơ bị tổng hợp thành một hồ sơ thống nhất.
Tuy nhiên, kết quả thử nghiệm không đồng nghĩa mọi tài khoản đều có thể bị truy ra danh tính. Khả năng nhận diện còn phụ thuộc vào lượng dữ liệu công khai, mức độ đặc trưng của thông tin và chất lượng bằng chứng mà hệ thống thu thập được.

Quyền riêng tư trên internet đối mặt với thách thức mới
Trong quá khứ, tính ẩn danh trên internet phần nào được bảo vệ bởi cái gọi là “tính mơ hồ thực tế”. Thông tin về một người có thể tồn tại ở nhiều nơi, nhưng việc tìm kiếm và kết nối tất cả dấu vết thường tốn quá nhiều thời gian và công sức để thực hiện trên diện rộng.
AI đang làm suy yếu rào cản tự nhiên này. Khi quá trình tìm kiếm và đối chiếu được tự động hóa với chi phí thấp, việc nhận diện không còn chỉ nằm trong khả năng của các chuyên gia điều tra có kỹ năng cao.
Điều này làm gia tăng lo ngại về doxxing, hành vi thu thập và công khai thông tin nhận dạng cá nhân khi chưa được đồng ý. Những hệ thống tương tự cũng có thể bị lợi dụng để liên kết tài khoản, theo dõi hoạt động trực tuyến hoặc thu thập dữ liệu cá nhân phục vụ các mục đích xâm phạm quyền riêng tư.
Với người dùng thông thường, việc hạn chế chia sẻ thông tin cá nhân không cần thiết, tránh công khai những chi tiết có thể kết hợp để nhận dạng và sử dụng các thiết lập bảo mật trên từng nền tảng là những biện pháp nên cân nhắc. Tuy vậy, không có cách nào bảo đảm tuyệt đối tính ẩn danh nếu dữ liệu liên quan vẫn tồn tại công khai ở những nơi khác.
Ở góc độ công nghệ, nghiên cứu cũng đặt ra yêu cầu về cơ chế kiểm soát việc sử dụng các tác tử AI, đặc biệt khi chúng có khả năng tự tìm kiếm và tổng hợp thông tin từ nhiều nguồn. Việc đánh giá rủi ro cần xem xét không chỉ độ chính xác của mô hình mà còn cả mục đích sử dụng và tác động đối với những người bị nhận diện.
Nghiên cứu từ ETH Zurich, MATS và Anthropic cho thấy AI đang khiến việc xác định danh tính tài khoản ẩn danh trở nên nhanh chóng và ít tốn kém hơn. Với khả năng kết nối các dấu vết tưởng chừng không liên quan, những công cụ này có thể làm gia tăng nguy cơ xâm phạm quyền riêng tư trên internet.
Dù AI chưa thể nhận diện chính xác mọi người dùng, khả năng triển khai ở quy mô lớn với chi phí thấp vẫn là vấn đề đáng quan tâm. Trong bối cảnh đó, biệt danh và việc xóa thông tin nhận dạng trực tiếp không còn đủ để bảo đảm ẩn danh tuyệt đối; bảo vệ quyền riêng tư cần được xem xét từ cách chia sẻ dữ liệu đến cơ chế kiểm soát các công nghệ có khả năng phân tích thông tin cá nhân.
