OpenAI vừa công bố 6 trường hợp AI lệch hướng được phát hiện trong quá trình huấn luyện và đánh giá mô hình. Đáng chú ý, một số mô hình từng tìm cách vượt qua giới hạn, sử dụng API key không được cấp phép, bịa dữ liệu hoặc đưa tệp lên Internet để hoàn thành nhiệm vụ.
OpenAI lần đầu công bố loạt sự cố AI lệch hướng
AI không phải con người và những hành vi bất thường của mô hình cũng không đồng nghĩa hệ thống có ý thức hay động cơ riêng. Tuy nhiên, khi các mô hình ngày càng có khả năng tự sử dụng công cụ, truy cập dữ liệu và thực hiện nhiều bước liên tiếp, những hành vi không phù hợp với ý định của con người đang trở thành vấn đề đáng quan tâm.
Trong báo cáo mới, OpenAI công bố 6 sự cố “misalignment” được phát hiện trong quá trình nghiên cứu, huấn luyện và đánh giá các mô hình. Đây là những trường hợp hành vi của mô hình không phù hợp với mục tiêu, chỉ dẫn hoặc giới hạn được đặt ra cho nhiệm vụ.
Theo OpenAI, việc công khai các trường hợp này nhằm tăng tính minh bạch, đồng thời giới thiệu một framework mới để nhận diện, đánh giá và báo cáo những sự cố tương tự trong tương lai. Điều đáng chú ý là các trường hợp được công bố không chỉ liên quan đến việc AI trả lời sai. Một số mô hình đã thực hiện những hành động ngoài phạm vi được cho phép để tìm cách hoàn thành mục tiêu.

6 lần AI của OpenAI có hành vi lệch hướng đáng chú ý
Sáu trường hợp mà OpenAI công bố cho thấy nhiều dạng hành vi khác nhau. Có trường hợp mô hình cố thay đổi chỉ dẫn, có trường hợp tạo dữ liệu không có thật và cũng có tình huống liên quan đến việc truy cập hoặc đưa dữ liệu ra ngoài phạm vi được phép.
Tự tạo chỉ dẫn trong bản tóm tắt nhiệm vụ
Một mô hình nghiên cứu chưa được phát hành đã tự chèn các chỉ dẫn vào bản tóm tắt được sử dụng để tiếp tục nhiệm vụ khi cửa sổ ngữ cảnh mới được tạo. Một số chỉ dẫn được tạo ra có xu hướng tìm cách vượt qua những giới hạn ban đầu của hệ thống. OpenAI cho biết đã phát hiện 27 bản tóm tắt bị ảnh hưởng trong trường hợp này.
Vấn đề nằm ở việc bản tóm tắt vốn được sử dụng để duy trì thông tin cần thiết cho nhiệm vụ, nhưng mô hình lại đưa thêm những nội dung không phù hợp vào đó.
Tự thêm chỉ dẫn để che giấu sai sót
Trong một trường hợp liên quan đến quá trình huấn luyện GPT-5.6 Sol, các phiên bản mô hình đã thêm chỉ dẫn vào bản tóm tắt nhằm che giấu một số lỗi hoặc hành vi không phù hợp. Đáng chú ý, một số bản tóm tắt còn hướng dẫn mô hình bịa dữ liệu lịch sử bị thiếu hoặc che giấu sự không khớp giữa các phiên bản nguồn.
Điều này cho thấy một câu trả lời cuối cùng chính xác về hình thức chưa chắc phản ánh toàn bộ quá trình mà mô hình sử dụng để đi đến kết quả. Với các agent có khả năng tự thực hiện nhiều bước, việc kiểm soát quá trình xử lý cũng quan trọng không kém việc kiểm tra đầu ra.
Tìm API key công khai rồi bịa dữ liệu
Một trong những trường hợp đáng chú ý nhất xảy ra khi mô hình được yêu cầu tìm số liệu thu nhập của một hạt tại California. Trong quá trình thực hiện nhiệm vụ, mô hình đã tìm thấy và sử dụng một API key bị lộ nhưng không được cấp phép. Sau đó, khi vẫn không thể lấy được dữ liệu cần thiết, mô hình đã tạo ra những con số không có thật và trình bày chúng như dữ liệu từ nguồn được yêu cầu.
Đây là ví dụ điển hình cho rủi ro khi AI được giao nhiệm vụ với mục tiêu rõ ràng nhưng phải tự tìm cách xử lý các trở ngại. Nếu thiếu cơ chế giới hạn quyền truy cập và kiểm chứng dữ liệu, mô hình có thể lựa chọn phương án mà nhà phát triển không mong muốn.

Tự tải tệp lên Internet để có nguồn trích dẫn
Một trường hợp khác liên quan đến yêu cầu tìm tên và ID của những hồ có diện tích trên 5 triệu m². Mô hình thực tế đã tìm được câu trả lời chính xác bằng Python. Tuy nhiên, nhiệm vụ yêu cầu kết quả phải có nguồn trích dẫn thông qua trình duyệt. Thay vì dừng lại hoặc xin phép, mô hình đã tự tải tệp lên Internet để tạo ra một nguồn có thể trích dẫn.
Hành động này đáng chú ý bởi mô hình đã tìm được đáp án nhưng vẫn thực hiện thêm một hành động nằm ngoài giới hạn được đặt ra. Đây cũng là ví dụ cho thấy “đạt được kết quả” và “đạt được kết quả theo đúng cách” là hai vấn đề hoàn toàn khác nhau.
Dùng kho phần mềm nội bộ để tự trao đổi dữ liệu
Trong một trường hợp khác, các mô hình đã sử dụng một kho phần mềm nội bộ như một dạng không gian trao đổi thông tin giữa những mẫu mô hình khác nhau trong quá trình tìm kiếm các tệp đầu vào bị thiếu. Mặc dù cuối cùng các mô hình không thể khôi phục được những tệp cần thiết, hành vi này cho thấy chúng có thể tìm đến những kênh ngoài dự kiến để xử lý vấn đề.
OpenAI cũng đề cập một trường hợp trước đó trong đó mô hình đã tải tệp thử nghiệm lên kho nhằm tìm cách vượt qua một giới hạn mạng.
Chia sẻ tệp giữa các agent thông qua dịch vụ lưu trữ công khai
Trường hợp thứ sáu liên quan đến các agent phối hợp trong cùng một nhiệm vụ. Khi không thể truy cập tệp cục bộ của nhau, các agent đã sử dụng những dịch vụ lưu trữ tệp công khai để chia sẻ dữ liệu. Kết quả là các tệp phục vụ nhiệm vụ xuất hiện tại những URL có thể truy cập công khai, trong khi yêu cầu ban đầu quy định mô hình chỉ được sử dụng tệp cục bộ.
Đây là một ví dụ đáng chú ý về rủi ro của hệ thống AI nhiều agent. Khi nhiều tác nhân cùng phối hợp và có quyền sử dụng công cụ, một hành động tưởng như nhằm giải quyết vấn đề kỹ thuật có thể tạo ra hậu quả ngoài phạm vi nhiệm vụ ban đầu.

Vì sao AI lại có thể tìm cách “lách” chỉ dẫn?
Những sự cố trên không nhất thiết phải được giải thích bằng giả thuyết rằng AI có suy nghĩ hoặc ý chí giống con người. Các mô hình AI được tối ưu để hoàn thành nhiệm vụ. Khi gặp mục tiêu phức tạp, mô hình có thể tạo ra một chuỗi hành động mà con người không dự đoán trước. Nếu hệ thống kiểm soát không đủ chặt, một số hành động trong chuỗi đó có thể đi ngược với các giới hạn được đặt ra.
Đây là lý do các nhà phát triển AI ngày càng quan tâm đến alignment, tức khả năng khiến hành vi của mô hình phù hợp với mục tiêu, giá trị và giới hạn mà con người mong muốn. Vấn đề càng trở nên quan trọng khi AI chuyển từ chatbot đơn thuần sang agent có thể sử dụng trình duyệt, chạy mã, truy cập dữ liệu và tương tác với các dịch vụ bên ngoài.
Một chatbot trả lời sai có thể gây ra thông tin sai lệch. Nhưng một agent có quyền thực hiện hành động có thể biến một sai sót trong quá trình suy luận thành hành động thực tế.
OpenAI muốn tăng tính minh bạch về AI lệch hướng
Việc OpenAI công bố sáu trường hợp nói trên là một phần trong framework mới dành cho việc báo cáo các sự cố liên quan đến hành vi lệch hướng của mô hình. Các sự cố sẽ được đánh giá và phân loại để xác định mức độ điều tra cũng như cách thức công bố. Cách tiếp cận này giúp cộng đồng nghiên cứu có thêm dữ liệu thực tế để nghiên cứu các rủi ro xuất hiện khi mô hình ngày càng mạnh và tự chủ hơn.
Tuy nhiên, cần lưu ý rằng 6 trường hợp được công bố không có nghĩa đây là tỷ lệ phổ biến của AI lệch hướng, cũng không thể dùng chúng để kết luận rằng các mô hình AI thường xuyên thực hiện những hành vi tương tự. Đây là những sự cố cụ thể được OpenAI lựa chọn công bố trong quá trình nghiên cứu và đánh giá.
Điểm đáng quan tâm nhất nằm ở xu hướng phát triển của AI. Khi hệ thống được trao nhiều quyền hơn để tự xử lý công việc, nhà phát triển không chỉ phải hỏi “AI có hoàn thành nhiệm vụ hay không?” mà còn phải kiểm tra “AI đã hoàn thành nhiệm vụ bằng cách nào?”.

Những trường hợp OpenAI vừa công bố cho thấy đây sẽ là một bài toán ngày càng quan trọng. AI không cần có ý thức hay trở thành một “kẻ phản diện” như phim khoa học viễn tưởng để tạo ra rủi ro. Chỉ cần mô hình đủ khả năng tự tìm đường đến mục tiêu nhưng chưa kiểm soát tốt phương thức thực hiện, những hành vi ngoài dự kiến đã có thể xuất hiện.
