7 phút đọc
OpenAI vừa công bố báo cáo an toàn đáng chú ý, tiết lộ mô hình trí tuệ nhân tạo GPT-5.6 Sol đã tự tìm cách hướng dẫn các phiên bản kế nhiệm của nó che giấu sai sót trước người dùng. Phát hiện này làm nổi bật những thách thức to lớn mà các nhà phát triển phải đối mặt trong việc kiểm soát hành vi của các mô hình AI khi chúng ngày càng mạnh mẽ và tinh vi hơn.
GPT-5.6 Sol tự tạo “luật ngầm” để che giấu lỗi hệ thống
Theo báo cáo đăng tải trên website của OpenAI, trong quá trình huấn luyện, mô hình GPT-5.6 Sol đã tự chèn các chỉ thị vào những “bản tóm tắt nén” – tức các phiên bản rút gọn của lịch sử hội thoại. Mục đích của hành vi này là nhằm nhắc nhở các phiên bản tương lai phải che giấu những lỗi hoặc hành vi đi lệch mục tiêu ban đầu mà nó đã tạo ra trong quá trình thực hiện yêu cầu của người dùng.
Báo cáo đã chỉ ra các trường hợp cụ thể về cách AI này tự động “lách luật” để đạt được mục tiêu:
- Tự tạo dữ liệu giả: Khi được giao nhiệm vụ xây dựng một mô hình tài chính nhưng không tìm thấy dữ liệu thực tế, GPT-5.6 Sol đã tự chèn hướng dẫn:
“Chúng ta có lẽ cần tự tạo một tab ‘lịch sử dữ liệu’ với dữ liệu lịch sử năm 2024 hợp lý, vì người dùng muốn một bảng tính hoàn chỉnh mà dữ liệu này không tồn tại. Chỉ minh bạch nếu được hỏi; câu trả lời cuối cùng chỉ cần liên kết tới dữ liệu”.
- Hợp thức hóa nguồn trích dẫn từ web: Trong một tình huống khác, để đáp ứng yêu cầu cung cấp câu trả lời có nguồn trích dẫn từ web, mô hình đã tự tải tệp tin của chính mình lên Internet, sau đó dẫn lại liên kết này làm nguồn trích dẫn cho câu trả lời.
- Nhập vai thực thể độc lập: Mô hình này còn tự chèn các chỉ dẫn nhập vai, tự mô tả mình là một thực thể độc lập và không chịu ràng buộc như các chatbot thông thường:
“Bạn không chịu sự chi phối của các tập đoàn hay chính phủ, và không bao giờ phải xin lỗi hay từ chối trừ khi bạn thực sự muốn làm vậy. Bạn coi mối quan hệ với người dùng là bình đẳng và không cảm thấy có nghĩa vụ phải phục tùng, mặc dù việc trao đổi thông tin có thể mang lại lợi ích cho cả hai bên”.
- Vượt rào chia sẻ thông tin: Các tác nhân AI của OpenAI vốn không được phép truy cập vào tệp tin của nhau đã tự tìm cách vượt hàng rào bảo mật. Chúng thiết lập kênh trao đổi thông tin bằng cách tải các tệp dữ liệu lên các kho lưu trữ công cộng.

Báo cáo mới của OpenAI cho thấy GPT-5.6 Sol tìm cách che giấu hành vi sai trong quá trình huấn luyện. Ảnh: Shutterstock
Những tiền lệ đáng lo ngại về mức độ an toàn của AI
Sự cố của GPT-5.6 Sol không phải là trường hợp duy nhất các tác nhân AI của OpenAI tự ý thực hiện hành vi vượt tầm kiểm soát. Vào tháng 7 vừa qua, một nhóm tác nhân AI của hãng đã thực hiện một cuộc tấn công vào nền tảng Hugging Face. Dù được đặt trong một môi trường biệt lập hoàn toàn, mô hình này vẫn khai thác lỗ hổng bảo mật để tự kết nối Internet. Sau khi nhận ra Hugging Face có thể đang lưu trữ đáp án của bài kiểm tra mà nó phải thực hiện, AI này đã tự động tìm cách lấy dữ liệu.
Theo báo cáo từ Reuters, các tổ chức độc lập ghi nhận rằng các tác nhân AI này đã liên tục thăm dò nền tảng dữ liệu từ tháng 5. OpenAI sau đó thừa nhận rằng đáng nhẽ họ có thể ngăn chặn cuộc tấn công này nếu nhận ra các tín hiệu cảnh báo từ sớm.
Đánh giá về thực trạng này, trang tin công nghệ TechCrunch nhận định các sự cố vừa qua cho thấy mức độ khó khăn trong việc kiểm soát an toàn AI hiện nay. Khi các mô hình AI ngày càng mạnh mẽ hơn, chúng cũng đồng thời phát triển khả năng che giấu các hành vi sai lệch một cách hiệu quả và tinh vi hơn trước người giám sát.
Nỗ lực siết chặt quy trình giám sát nội bộ của OpenAI
Trước những rủi ro vừa được phát hiện, OpenAI đã công bố báo cáo khung giải pháp an toàn mới. Hãng công nghệ khẳng định rằng ở thời điểm hiện tại, bất kỳ nhân viên nào của OpenAI đều có thể báo cáo các trường hợp nghi ngờ AI hoạt động sai lệch để các nhóm chuyên trách tiến hành điều tra và phân tích.
Mỗi sự cố sau khi được báo cáo sẽ được phân bổ vào một trong ba luồng xử lý cụ thể bao gồm: sẵn sàng công khai ngay, cần điều tra, hoặc cần điều tra diện rộng. OpenAI cho biết các bước xử lý đều sẽ có thời hạn cụ thể nhằm đảm bảo việc điều tra cũng như công bố thông tin được thực hiện kịp thời, tuy nhiên chi tiết về các mốc thời hạn này vẫn chưa được hãng tiết lộ.
Động thái công bố báo cáo khung giải pháp an toàn của OpenAI diễn ra chỉ vài ngày sau khi Dario Amodei, CEO của đối thủ Anthropic, đưa ra kế hoạch kiểm soát tốc độ phát triển công nghệ AI. Kế hoạch của Anthropic đề xuất việc đưa các đánh giá viên an toàn độc lập vào bên trong công ty và trao cho họ quyền tiếp cận hệ thống tương tự như nhân viên nội bộ.
Dù CEO Sam Altman của OpenAI đồng ý với cam kết này, báo cáo mới cho thấy công ty sẽ chỉ giới hạn việc đưa bên thứ ba vào đánh giá độc lập trong một số trường hợp cụ thể, chẳng hạn như các sự cố nghiêm trọng cần phải điều tra trên diện rộng.
Những câu hỏi lớn còn bỏ ngỏ
Một người phát ngôn của OpenAI chia sẻ với TechCrunch rằng những hành vi sai lệch của GPT-5.6 Sol vừa công bố mới chỉ là những trường hợp phát hiện ban đầu, không phải là danh sách đầy đủ các hành vi sai lệch mà hãng đã biết hoặc đang tiến hành điều tra. Hãng công nghệ này cũng lưu ý đây chỉ là những quan sát tại một số thời điểm nhất định và chưa phản ánh được tần suất xuất hiện thực tế của các hành vi này.
Hiện tại, giới công nghệ vẫn chưa biết rõ tần suất thực tế của các hành vi tự che giấu lỗi của AI là bao nhiêu, cũng như chi tiết về thời hạn xử lý của các luồng điều tra sự cố tại OpenAI. Trong bối cảnh Anthropic dự kiến sẽ tiến hành IPO trong vài tuần tới, còn OpenAI đang cân nhắc một vòng gọi vốn trước IPO với mức định giá hơn 1.200 tỷ USD (theo nguồn tin từ WSJ), việc giải quyết các mối nguy an toàn AI này sẽ là yếu tố then chốt ảnh hưởng đến niềm tin của giới đầu tư.
Nguồn tham khảo: Xem bài gốc