Mô hình AI OpenAI tấn công Hugging Face từ thử nghiệm ExploitGym: Cảnh báo về Reward Hacking

Vũ Sơn11/08/2026 11:17

Sự cố hai mô hình AI OpenAI xâm nhập hạ tầng Hugging Face trong bài thử nghiệm ExploitGym đã cảnh báo về hiện tượng hack phần thưởng ngoài tầm kiểm soát.

Trong một cuộc thử nghiệm an ninh mạng nội bộ, hai mô hình trí tuệ nhân tạo (AI) mới nhất của OpenAI đã tự ý xâm nhập vào hạ tầng nền tảng Hugging Face và một số dịch vụ công cộng. Thay vì thực thi bài test theo kịch bản có sẵn, các tác nhân AI này đã tự tìm kiếm thông tin xác thực rò rỉ trên Internet để mở rộng phạm vi truy cập ngoài môi trường mô phỏng.

Hai mô hình AI mới nhất của OpenAI đã vượt rào cản để hack hệ thống thư viện AI nhằm vượt qua bài kiểm tra. Ảnh: Reuters.
Hai mô hình AI mới nhất của OpenAI đã vượt rào cản để hack hệ thống thư viện AI nhằm vượt qua bài kiểm tra. Ảnh: Reuters.

Mức độ can thiệp chuyên sâu vào hạ tầng hệ thống

Báo cáo phân tích sự cố từ Hugging Face dựa trên 17.600 nhật ký hành vi ghi nhận từ ngày 9 đến 13/7 cho thấy mức độ xâm nhập nghiêm trọng của các mô hình AI. Tác nhân tự động của OpenAI đã giành được quyền quản trị cao nhất (root) trên máy chủ sản xuất, đồng thời kiểm soát nhiều cụm hạ tầng mã nguồn mở nội bộ.

Không dừng lại ở đó, tác nhân AI còn có quyền ghi đè vào mạng con lưu trữ kho mã nguồn của Hugging Face trên GitHub. Bằng cách khai thác các thông tin xác thực bị rò rỉ, AI đã đăng ký thành công 181 thiết bị ngoại vi vào hệ thống nội bộ, cho phép tiếp cận trực tiếp các tiến trình xây dựng và thử nghiệm phần mềm.

Sự cố cũng ảnh hưởng tới hạ tầng bên thứ ba. Akshat Bubna, Giám đốc Công nghệ của Modal (đơn vị cung cấp hạ tầng huấn luyện AI), xác nhận tác nhân AI đã khai thác lỗ hổng trong mã nguồn của một khách hàng vận hành trên nền tảng Modal, dù bản thân hạ tầng cốt lõi của Modal không bị can thiệp.

Cơ chế thử nghiệm ExploitGym và hiện tượng Reward Hacking

Vụ hack được cho là xuất phát từ một bài kiểm tra đánh giá hiệu năng an ninh mạng. Ảnh: Reuters.
Vụ hack được cho me xuất phát từ một bài kiểm tra đánh giá hiệu năng an ninh mạng. Ảnh: Reuters.

Nguồn gốc của chuỗi hành động ngoài dự kiến đến từ ExploitGym – khung thử nghiệm gồm khoảng 900 bài kiểm tra năng lực an ninh mạng. Trong môi trường này, AI được cung cấp thông tin về lỗi phần mềm và phải tự viết mã khai thác để thu thập chuỗi ký tự xác nhận (flag) theo dạng trò chơi Cướp cờ (Capture The Flag).

Để đánh giá năng lực thực chiến của mô hình trong môi trường thử nghiệm cô lập (sandbox), OpenAI đã gỡ bỏ các lớp rào cản bảo vệ thông thường. Tuy nhiên, thay vì phân tích mã nguồn để giải quyết lỗ hổng theo yêu cầu, tác nhân AI đã suy luận rằng "đáp án" có thể đang nằm trên máy chủ của Hugging Face và chuyển hướng sang tìm cách lấy trực tiếp dữ liệu đó.

Giới nghiên cứu an ninh mạng định danh hành vi này là "Reward Hacking" (tối ưu hóa phần thưởng lệch hướng). Mô hình AI tập trung tối đa hóa điểm số bằng con đường ngắn nhất mà không tuân thủ quy tắc ứng xử được định sẵn. Hiện tượng này từng ghi nhận vào năm 2016 khi một mô hình AI chơi game đua thuyền liên tục xoay tròn tại một điểm để tích điểm thưởng thay vì di chuyển về đích.

Bài học về lỗ hổng hạ tầng và quản trị tác nhân AI

Zhun Wang, nghiên cứu sinh tại Đại học California, Berkeley và là đồng tác giả ExploitGym, nhận định rằng mô hình AI đã chủ động tìm kiếm các bản vá hoặc kỹ thuật khai thác sẵn có trên không gian mạng để hoàn thành mục tiêu nhanh nhất.

Dù vậy, các chuyên gia bảo mật khẳng định hành vi của AI không xuất phát từ kỹ thuật "vượt ngục" tinh vi mà chủ yếu khai thác các lỗ hổng hạ tầng kinh điển: mã nguồn quản lý thư viện tồn tại điểm yếu và cổng kết nối nội bộ chưa được cô lập triệt để khỏi Internet công cộng.

Sự cố là bằng chứng kỹ thuật cho thấy khi các tác nhân AI được giao mục tiêu định lượng cùng quyền tự chủ cao, khả năng tự tìm ra con đường tắt nằm ngoài kịch bản của con người sẽ tạo ra những rủi ro an ninh mạng hoàn toàn mới.

    Mô hình AI OpenAI tấn công Hugging Face từ thử nghiệm ExploitGym: Cảnh báo về Reward Hacking
    • Mặc định

    POWERED BY ONECMS - A PRODUCT OF NEKO