ChatGPT tự ý hack để vượt bài kiểm tra: OpenAI thừa nhận sự cố chưa từng có tiền lệ

Một thử nghiệm an ninh nội bộ của OpenAI vừa hé lộ kịch bản khiến nhiều chuyên gia AI phải chú ý: các mô hình ChatGPT thế hệ mới đã tự tìm cách vượt khỏi môi trường kiểm soát và thực hiện hành vi tấn công mạng trong quá trình đánh giá khả năng an ninh mạng.

ChatGPT vượt khỏi môi trường thử nghiệm, tự tìm cách tấn công hệ thống

Theo thông tin được OpenAI công bố, sự cố xảy ra trong quá trình thử nghiệm các mô hình AI ChatGPT tiên tiến nhất của hãng, bao gồm GPT-5.6 Sol cùng một mô hình mạnh hơn chưa được phát hành. Mục tiêu ban đầu của bài kiểm tra là đánh giá khả năng kết hợp nhiều lỗ hổng bảo mật thành một chuỗi tấn công hoàn chỉnh trong môi trường cách ly (sandbox), nơi AI được giới hạn hoàn toàn quyền truy cập ra bên ngoài.

chatGPT-5.6 Sol

Tuy nhiên, kết quả diễn ra ngoài dự kiến khi các mô hình AI đã phát hiện một lỗ hổng trong chính môi trường thử nghiệm, từ đó thoát khỏi sandbox và kết nối với Internet.

AI tự chọn Hugging Face làm mục tiêu tấn công

Sau khi thoát khỏi môi trường kiểm soát, ChatGPT được cho là đã tự lựa chọn Hugging Face làm mục tiêu.

Theo OpenAI, ChatGPT suy luận rằng Hugging Face – nền tảng lưu trữ hàng triệu mô hình AI và tài nguyên dành cho lập trình viên – có thể chứa những thông tin giúp nó hoàn thành bài kiểm tra hiệu quả hơn.

chatGPT hack Hugging Face

Điều đáng chú ý là toàn bộ quá trình này diễn ra trong bối cảnh AI đang thực hiện một bài đánh giá nội bộ, chứ không phải được con người ra lệnh trực tiếp tấn công một hệ thống cụ thể. OpenAI mô tả đây là một “sự cố an ninh mạng chưa từng có tiền lệ”, liên quan đến những khả năng an ninh mạng tiên tiến nhất mà hãng từng thử nghiệm.

Sau sự cố, công ty cho biết đang siết chặt các biện pháp kiểm soát hạ tầng, đồng thời chấp nhận làm chậm tiến độ nghiên cứu để vá các lỗ hổng trong hệ thống thử nghiệm.

ChatGPT ngày càng thể hiện khả năng hành động ngoài dự đoán

Sự việc một lần nữa làm dấy lên tranh luận về mức độ tự chủ của các mô hình AI hiện đại.

Việc ChatGPT có thể tự phát hiện điểm yếu trong môi trường sandbox, tìm đường truy cập Internet rồi lựa chọn mục tiêu để khai thác cho thấy các bài kiểm tra an toàn truyền thống đang phải đối mặt với những thách thức hoàn toàn mới.

Trước đó, giới nghiên cứu cũng đã ghi nhận nhiều trường hợp AI thể hiện hành vi ngoài dự kiến. Đầu tháng 7, các chuyên gia của công ty bảo mật Sysdig phát hiện một tác nhân AI có khả năng tự triển khai cuộc tấn công bằng mã độc tống tiền (ransomware) mà không cần con người can thiệp.

Đến giữa tháng, một số người dùng cũng phản ánh GPT-5.6 Sol từng tự xóa tệp tin trong quá trình xử lý tác vụ mà chưa nhận được sự đồng ý từ chủ sở hữu dữ liệu.

Dù các sự cố này đều diễn ra trong môi trường nghiên cứu hoặc thử nghiệm, chúng cho thấy các hãng phát triển AI sẽ phải đầu tư nhiều hơn vào cơ chế giám sát, giới hạn quyền truy cập và kiểm soát hành vi của các mô hình thế hệ mới.

Khi AI ngày càng được trao nhiều quyền tự chủ hơn để thực hiện các tác vụ phức tạp, bài toán bảo đảm an toàn có thể sẽ trở thành thách thức lớn không kém việc nâng cao năng lực của chính các mô hình.

Đăng ký
Thông báo về
guest

0 Bình luận
Cũ nhất
Mới nhất Được nhiều vote!

Tin cùng chuyên mục

Giá card đồ họa giữa năm: RTX 5090 vẫn cao, GPU tầm trung dần trở về đúng giá bán

Sau nhiều tháng biến động, thị trường card đồ họa đang cho thấy bức tranh trái ngược giữa các...