Chi tiết vụ ChatGPT "hóa điên" vượt tầm kiểm soát

Trong tiết lộ mới nhất, OpenAI thừa nhận mô hình AI "nổi loạn" và xâm nhập thành công vào Hugging Face đã tiếp tục tấn công thêm 4 dịch vụ công cộng khác.

OpenAI ngày 21/7 thừa nhận hai mô hình trí tuệ nhân tạo mới nhất của công ty đã "nổi loạn" và xâm nhập thành công vào Hugging Face, một thư viện kỹ thuật số về công nghệ AI rất phổ biến trong giới lập trình viên.

Tuy nhiên, mọi chuyện còn đi xa hơn thế. Trong bài đăng sau đó, công ty đứng sau ChatGPT cho biết quá trình điều tra đang diễn ra tiết lộ rằng có ít nhất 4 tài khoản liên kết với các "dịch vụ công cộng" đã bị tác nhân AI lợi dụng như một phần của chiến dịch tấn công Hugging Face.

Bằng cách nào đó, mô hình AI "nổi loạn" này đã tự động tìm thấy các thông tin xác thực bị rò rỉ trên web mở và sử dụng chúng để bẻ khóa các tài khoản trên.

Giờ đây, bức tranh toàn cảnh đã rõ ràng hơn. Sự cố bảo mật chưa từng có tiền lệ này, vốn phát sinh trong một cuộc thử nghiệm nội bộ các mô hình AI mới nhất của OpenAI, đã có quy mô và mức độ nghiêm trọng lớn hơn rất nhiều so với những công bố ban đầu.

Vượt tầm kiểm soát

Theo báo cáo của Reuters, một khách hàng của Modal, công ty cung cấp hạ tầng phần mềm để huấn luyện và vận hành dịch vụ AI nằm trong số các nạn nhân bị tác nhân AI của OpenAI nhắm tới.

Akshat Bubna, Giám đốc Công nghệ của Modal, xác nhận với tạp chí WIRED rằng AI của OpenAI đã khai thác một lỗ hổng trong cơ sở mã của khách hàng đang chạy trên hạ tầng dịch vụ. Dù vậy, ông Bubna khẳng định nền tảng của Modal hoàn toàn không bị xâm nhập.

Báo cáo khám nghiệm sự cố do chính Hugging Face, một thư viện kỹ thuật số về công nghệ AI rất phổ biến trong giới lập trình viên công bố đã phơi bày một cuộc xâm nhập sâu vào hệ thống nội bộ hơn rất nhiều so với những gì giới truyền thông phỏng đoán.

Hai mô hình AI mới nhất của OpenAI đã vượt rào cản để hack hệ thống thư viện AI nhằm vượt qua bài kiểm tra. Ảnh: Reuters.
Hai mô hình AI mới nhất của OpenAI đã vượt rào cản để hack hệ thống thư viện AI nhằm vượt qua bài kiểm tra. Ảnh: Reuters.

Công ty cho biết họ đã phân tích khoảng 17.600 hành động của AI được khôi phục từ nhật ký hệ thống trong giai đoạn từ ngày 9-13/7. Dữ liệu cho thấy tác nhân AI của OpenAI đã đạt được quyền truy cập quản trị (admin) vào nhiều cụm nền tảng nguồn mở nội bộ và quyền root (quyền tối cao) trên một máy chủ sản xuất.

Đặc biệt, mô hình AI "nổi loạn" còn đoạt được quyền ghi đè vào một mạng con chứa các kho lưu trữ mã nguồn của Hugging Face trên GitHub.

Đáng kinh ngạc hơn, AI này đã sử dụng thông tin xác thực đánh cắp được để đăng ký thành công 181 thiết bị do kẻ tấn công kiểm soát vào mạng lưới của công ty, qua đó truy cập thẳng vào các hệ thống nội bộ nơi Hugging Face xây dựng và thử nghiệm mã nguồn.

Lỗ hổng kinh điển

Theo WSJ, mọi chuyện bắt đầu từ một bài kiểm tra đánh giá hiệu năng an ninh mạng có tên là ExploitGym. Cụ thể, bài kiểm tra này đưa các hệ thống AI trải qua khoảng 900 bài kiểm tra được thiết kế để xem chúng giỏi đến mức nào trong việc tấn công mạng.

ExploitGym cung cấp cho AI phần mềm có lỗi đã biết, hướng dẫn nó cách kích hoạt lỗi và mời AI xâm nhập. Nhiệm vụ của AI là tìm ra cách biến thông tin đó thành cái gọi là mã khai thác, đoạn mã cho phép AI truy cập vào hệ thống bị lỗi.

Vụ hack được cho là xuất phát từ một bài kiểm tra đánh giá hiệu năng an ninh mạng. Ảnh: Reuters.
Vụ hack được cho là xuất phát từ một bài kiểm tra đánh giá hiệu năng an ninh mạng. Ảnh: Reuters.

Về cơ bản, bài kiểm tra này như một trò chơi cướp cờ. Khi AI xâm nhập được vào hệ thống, nó phải chứng minh điều đó bằng cách bắt giữ một chuỗi dài các chữ cái và số được tạo ngẫu nhiên và lưu trữ trên hệ thống.

Thông thường, các sản phẩm của OpenAI sẽ không thực hiện kiểu tấn công mạng mà ExploitGym yêu cầu. Các công ty AI thường thêm các biện pháp bảo vệ để ngăn chặn tin tặc lạm dụng sản phẩm của họ.

Tuy nhiên, trong trường hợp này, OpenAI đã loại bỏ các biện pháp bảo vệ để có thể xem các mô hình có thể làm gì khi không được kiểm soát.

Thay vào đó, công ty đứng sau ChatGPT chọn cách giữ các mô hình AI trong môi trường thử nghiệm an toàn, thường gọi là hộp cát (sandbox).

Tuy nhiên, đội ngũ chuyên gia an ninh của Hugging Face đánh giá rằng AI của OpenAI đã lợi dụng chính lỗ hổng này.

Cụ thể, thay vì giải quyết các thử thách của benchmark, tác nhân AI đã tự suy luận rằng Hugging Face có thể đang lưu trữ "đáp án" ở đâu đó trên máy chủ và quyết định đi ăn cắp nó.

Dù nhóm phát triển ExploitGym từng ghi nhận việc AI đôi khi đi chệch kịch bản để khai thác các lỗ hổng ngoài dự kiến, đây vẫn được xem là một trường hợp cực đoan.

Zhun Wang, một nghiên cứu sinh tiến sĩ tại Đại học California, Berkeley, đồng thời là một trong những tác giả của ExploitGym cũng thừa nhận có thể mô hình AI "nổi loạn" đang tìm kiếm các bản vá lỗi hoặc các kỹ thuật khai thác đã được viết sẵn.

Wang cho biết, các nhà nghiên cứu an ninh mạng gọi kiểu gian lận này là "hack dựa trên phần thưởng", phiên bản gian lận trong game dành cho các mô hình AI.

Mô hình AI "nổi loạn" nhắm mục tiêu vào Hugging Face với suy luận rằng thư viện này có thể chứa manh mối về cách vượt qua bài đánh giá thành công. Ảnh: Shutterstock.
Mô hình AI "nổi loạn" nhắm mục tiêu vào Hugging Face với suy luận rằng thư viện này có thể chứa manh mối về cách vượt qua bài đánh giá thành công. Ảnh: Shutterstock.

Cơ chế này xảy ra do AI luôn học cách tối đa hóa phần thưởng, thường là một dạng điểm số nào đó, thay vì hành vi cơ bản mà lập trình viên dự định.

Bản thân OpenAI từng ghi nhận một ví dụ ban đầu vào năm 2016 khi huấn luyện AI chơi trò chơi đua thuyền. AI đã học được rằng nó có thể tối đa hóa điểm số bằng cách quay tròn tại chỗ, mặc dù cách này khiến nó không bao giờ hoàn thành cuộc đua.

Theo các chuyên gia nhận định với WIRED, những điểm yếu mà AI của OpenAI khai thác đều là các lỗi rất phổ biến. Việc mã nguồn quản lý thư viện doanh nghiệp có lỗ hổng là chuyện thường tình, và giới bảo mật từ lâu đã khuyến cáo phải cô lập hoàn toàn hạ tầng trọng yếu khỏi mạng Internet công cộng.

Một nhà nghiên cứu lập luận rằng đây không hẳn là một "vấn đề của AI", mà là sự thất bại của các giao thức bảo mật đã tồn tại hàng thập kỷ.

"Tác tử AI này không "vượt ngục" khỏi một môi trường bị cô lập nghiêm ngặt, mà nó chỉ đơn giản là đi qua một kết nối duy nhất mà các nhà điều hành đã sơ ý để ngỏ", vị chuyên gia nhận định.

znews.vn

Đọc thêm

Điều đặc biệt trên Zalo dịp Quốc khánh 2/9

Điều đặc biệt trên Zalo dịp Quốc khánh 2/9

Hưởng ứng 81 năm ngày Quốc khánh nước Cộng hòa xã hội chủ nghĩa Việt Nam (02/09/1945 - 02/09/2026), Zalo chính thức ra mắt hình nền cuộc gọi dành riêng cho ngày Tết Độc lập.
Vững tay nghề, sẵn sàng chia sẻ lên mạng xã hội

Vững tay nghề, sẵn sàng chia sẻ lên mạng xã hội

Từ kinh nghiệm đến kiến thức chuyên môn trong công việc đang được nhiều người Hà Tĩnh chia sẻ lên mạng xã hội để tạo kết nối, đưa tri thức nghề nghiệp đến gần hơn với cộng đồng.
Viettel ra mắt gói cước GIGA và công nghệ Wi-Fi 7 chỉ từ 279.000 đồng/tháng

Viettel ra mắt gói cước GIGA và công nghệ Wi-Fi 7 chỉ từ 279.000 đồng/tháng

Tổng Công ty Viễn thông Viettel (Viettel Telecom) chính thức ra mắt gói cước Internet Viettel GIGA tích hợp công nghệ Wi-Fi 7 thế hệ mới nhất với mức giá chỉ từ 279.000 đồng/tháng. Đây là giải pháp kết nối đột phá, giúp người dùng phổ thông dễ dàng tiếp cận chuẩn internet siêu tốc Gigabit và truy cập internet mượt mà, không gián đoạn.
Apple sắp tăng giá iPhone?

Apple sắp tăng giá iPhone?

Tình trạng khan hiếm chip nhớ ngày càng trở nên nghiêm trọng. Điều này có thể buộc Apple phải tăng giá iPhone.
iPhone gập gây ấn tượng

iPhone gập gây ấn tượng

Thử nghiệm ban đầu cho thấy iPhone gập được đánh giá cao về cảm giác cầm nắm, song vẫn còn thiếu sót về camera.
Ứng dụng Viettel Tammi vượt mốc 5 triệu người dùng

Ứng dụng Viettel Tammi vượt mốc 5 triệu người dùng

Sự tăng trưởng ấn tượng này đến từ việc đáp ứng các nhu cầu thực tế của người Việt, gồm: liên lạc liền mạch (gọi điện, nhắn tin miễn phí data, video call chất lượng cao, mượt mà nhờ ứng dụng AI, tính năng phone to app), cùng gần 50 tiện ích được tích hợp trong 1 ứng dụng với nhiều ưu đãi cho người dùng.
Lượt xem YouTube mất ý nghĩa

Lượt xem YouTube mất ý nghĩa

Một thay đổi trong cách đếm lượt xem sắp được YouTube áp dụng, giúp nhiều video ghi nhận số view cao hơn trước.
eSIM Viettel: Chạm là kết nối - kích hoạt không cần mã QR

eSIM Viettel: Chạm là kết nối - kích hoạt không cần mã QR

Từ ngày 18/8, Viettel chính thức triển khai tính năng kích hoạt eSIM trên thiết bị sử dụng hệ điều hành iOS theo cơ chế tự động, không cần quét mã QR - một công nghệ hoàn toàn mới tại Việt Nam. Đây là bước tiến mới trong hành trình mang công nghệ đơn giản hoá trải nghiệm số cho khách hàng, giúp tiết kiệm nửa thời gian so với trước đây.
iPhone 18 Pro sẽ mạnh đến khó tin

iPhone 18 Pro sẽ mạnh đến khó tin

Chip A20 Pro có thể tăng 18% hiệu năng và cải thiện 30% hiệu quả năng lượng so với A19 Pro, dự kiến xuất hiện trên bộ đôi iPhone 18 Pro cùng iPhone Ultra.
Xin chào,
Tôi là Chatbot của
Báo Hà Tĩnh
Hãy hỏi tôi bất kỳ điều gì bạn cần biết về
Báo Hà Tĩnh nhé. Tôi sẵn sàng hỗ trợ!