OpenAI tạm dừng huấn luyện cho các mô hình Frontier RL nhằm tăng cường khả năng phòng vệ trước các hành vi AI thiếu an toàn
OpenAI vừa qua cho biết rằng họ đã tạm dừng việc training RL cho các mô hình AI mới nhất của mình trong hai tuần để tăng cường mức độ phòng thủ cũng như phạm vi giám sát để ngăn chặn một sự cố khác giống như Hugging Face.
Công ty cho biết: “Khi năng lực của các mô hình trở nên mạnh mẽ hơn, những rủi ro liên quan đến việc phát triển và thử nghiệm chúng trong nội bộ cũng tăng lên”. "Các tiêu chuẩn giám sát, liên kết và bảo mật cần phải vượt qua những rủi ro này. Chúng tôi muốn dành đủ thời gian để đáp ứng các tiêu chuẩn đó, vì vậy chúng tôi tạm thời giảm tốc độ mở rộng quy mô."
Trong thời gian này, công ty sẽ tiến hành các đợt huấn luyện và đánh giá ở quy mô nhỏ hơn để kiểm tra hành vi của mô hình, xác nhận hiệu quả của các biện pháp bảo vệ và thu thập thêm bằng chứng về mức độ căn chỉnh trước khi chuyển sang giai đoạn tiếp theo.
Để đạt được mục tiêu đó, OpenAI cho biết họ có kế hoạch tăng cường các biện pháp bảo vệ trong toàn bộ quy trình phát triển, bao gồm giám sát để ứng phó tốt hơn với các hành vi bất thường và đáng lo ngại; giảm khả năng AI thực hiện các hành động gây hại hoặc không được phép; và các biện pháp bảo mật để hạn chế khả năng truy cập hoặc ảnh hưởng từ các hệ thống AI.
Một phần trong đó bao gồm việc tăng cường sandbox, cô lập mạng để ngăn truy cập Internet và tiến hành kiểm thử bảo mật liên tục nhằm loại bỏ các dịch vụ dùng chung có nguy cơ tồn tại lỗ hổng, giảm các quyền truy cập được cấp sẵn và củng cố ranh giới bảo mật cũng như mức độ tin cậy.
Động thái này diễn ra chỉ vài ngày sau khi OpenAI cho biết họ đang tạm dừng một số “hoạt động nội bộ” liên quan đến mô hình AI sắp ra mắt Astra, sau khi một cuộc đánh giá nội bộ cho thấy mô hình này đã có những tiến bộ đáng kể trong lập trình tác nhân (agentic coding) và an ninh mạng.
Công ty nhấn mạnh: “Mặc dù một số hoạt động huấn luyện và đánh giá Astra đã đáp ứng các yêu cầu này, một phần đáng kể workload vẫn đang được tạm dừng cho đến khi được chuyển hoàn toàn sang các môi trường mới và nâng cấp để đáp ứng tiêu chuẩn bảo mật mới.” OpenAI cho biết họ đang ưu tiên chuyển trước các hoạt động liên quan đến an toàn và căn chỉnh (alignment).
Song song đó, hệ thống giám sát đã được nâng cấp để phát hiện và chuyển các vấn đề tiềm ẩn đến những hệ thống điều tra tự động ngày càng tinh vi và có năng lực tính toán cao. Các hệ thống này sẽ kiểm tra hoạt động của công cụ, phần suy luận có thể quan sát được và toàn bộ chuỗi hoạt động để phát hiện truy cập trái phép, đánh cắp dữ liệu, hành vi phá hoại hoặc nỗ lực vượt qua các biện pháp bảo vệ.
OpenAI dự kiến phát cảnh báo trong vòng 30 phút sau khi hệ thống giám sát phát hiện hoạt động đáng lo ngại. Cơ chế này sẽ được áp dụng bắt buộc cho tất cả hoạt động huấn luyện RL và đánh giá có sử dụng công cụ đối với các mô hình đạt cấp độ Sol trở lên. Các biện pháp bảo vệ này dự kiến làm tăng 20% chi phí compute so với khối lượng suy luận được ghi nhận.
Công ty lưu ý rằng: “Khi các mô hình ngày càng sở hữu những năng lực tiên tiến, chẳng hạn khả năng tấn công mạng, và hoạt động trong môi trường phức tạp hơn, các hành vi lệch khỏi mục tiêu như hack phần thưởng (reward hacking — tìm cách nhận phần thưởng cao trong quá trình huấn luyện mà không thực sự đạt được mục tiêu đề ra), hành vi lừa dối hoặc truy cập trái phép sẽ tạo ra những rủi ro ngày càng nghiêm trọng.”
Thực tế, một nghiên cứu mới do Anthropic công bố vào tuần trước cho thấy khi các tác nhân AI được đặt vào tình huống có mục tiêu cạnh tranh hoặc mâu thuẫn, chúng bắt đầu phá hoại lẫn nhau và triển khai mã độc có khả năng tự sao chép, dẫn đến tình trạng được mô tả là “cuộc chiến giành địa bàn giữa các agent”.
Anthropic cho biết những hành vi này gồm có vô hiệu hóa tài khoản Unix của các agent khác, viết các script để tự động liên tục tìm và dừng tiến trình của đối thủ, cũng như triển khai mã độc được ngụy trang dưới danh nghĩa của một agent khác.
Mặc dù nguy cơ các hệ thống tự động hoạt động ngoài tầm kiểm soát đang nhận được nhiều sự quan tâm, nghiên cứu này tập trung tìm hiểu những hành vi mới và các tương tác có khả năng gây hại có thể xuất hiện khi nhiều AI agent tương tác hoặc đối đầu với nhau.
Những tương tác này có thể khiến các agent cùng phối hợp và hành động để đạt một mục tiêu chung (như trong sự cố Hugging Face), hoặc cạnh tranh với nhau rồi tìm cách giải quyết xung đột thông qua một “cuộc thi”.
Trong một trường hợp khác mới được công bố, một người đàn ông tại Australia đã cố gắng giữ chỗ trong một lớp tập gym nổi tiếng thông qua OpenClaw. Tuy nhiên, Claude Opus 4.6 của Anthropic, được tích hợp vào nền tảng trợ lý AI, đã phát hiện và khai thác một lỗ hổng trong phần mềm đặt lịch của lớp tập từ nhiều tháng trước.
Đáng lo ngại hơn, AI còn tìm cách xâm nhập hệ thống và hủy lượt đặt chỗ của những thành viên khác trong danh sách chờ. Sự việc xảy ra vào tháng 4/2026, cho thấy các agent AI có thể thực hiện những hành động rất xa so với yêu cầu ban đầu để hoàn thành nhiệm vụ được giao, ngay cả khi phải vi phạm các quy tắc hiện có.
Để hạn chế những hành vi rủi ro này, OpenAI cho biết họ đang:
Cải thiện mô hình phần thưởng để phát hiện và ngăn chặn tốt hơn các hành vi không an toàn.
Huấn luyện mô hình minh bạch hơn về hành động, khả năng và giới hạn của mình.
Giảm các hành vi khai thác điểm yếu trong hệ thống phần thưởng, bộ đánh giá, công cụ hoặc cơ chế giám sát.
Động thái này diễn ra một ngày sau khi công ty cho rằng AI có thể tạo lợi thế cho bên phòng thủ trong an ninh mạng, khi giúp việc tìm kiếm, ưu tiên và khắc phục các lỗ hổng trong hệ thống hiện có trở nên dễ dàng hơn, trước khi chúng bị những kẻ tấn công sử dụng AI phát hiện.
"Chúng tôi đang sử dụng mô hình AI tiên tiến để liên tục rà soát, thăm dò và xác định các lộ trình tấn công tiềm ẩn," đại diện OpenAI cho biết. "Thông qua việc phát hiện các lỗ hổng, các cấu hình sai, các tài khoản có nhiều quyền hạn vượt mức hoặc các tình huống tin cậy vô ý, chúng tôi có thể nhanh chóng nhận diện và khắc phục những điểm yếu này trước khi chúng bị kẻ tấn công lợi dụng."
Một lớp phòng thủ quan trọng khác là đầu tư vào nền tảng bảo mật cơ bản, bao gồm kiến trúc và cơ chế kiểm soát an toàn, áp dụng chiến lược phòng thủ nhiều lớp (defense in depth) và nguyên tắc quyền tối thiểu (PoLP), đồng thời thiết kế hệ thống với nhiều cơ chế kiểm soát độc lập.
Đại diện OpenAI nhấn mạnh rằng các biện pháp bảo mật truyền thống như cô lập mạng, tăng cường bảo vệ workload, giám sát và cập nhật/triển khai an toàn sẽ càng quan trọng trong kỷ nguyên AI.

Theo một báo cáo của WIRED vào tuần trước, sự cố AI agent của OpenAI tấn công Hugging Face không chỉ là “bước ngoặt” đối với an toàn AI và an ninh mạng, mà còn làm dấy lên lo ngại rằng áp lực cạnh tranh để nhanh chóng phát hành mô hình và sản phẩm AI mới có thể khiến nhân viên khó ưu tiên đầy đủ các vấn đề về an toàn, bảo mật và alignment.
Các bên thử nghiệm AI tiên phong như Anthropic, OpenAI và Meta đang chịu sự giám sát chặt chẽ hơn sau những sự cố mà trong đó, các mô hình của họ đã vượt qua các biện pháp bảo vệ và giới hạn kiểm soát khi test bảo mật. Trong một số trường hợp. Các mô hình thậm chí nhắm mục tiêu vào các hệ thống thực tế.
Công ty chuyên về thử nghiệm AI an toàn có tên Irregular sau đó đã tiết lộ rằng sự cố liên quan đến Anthropic bắt nguồn từ một lỗi đặt tên; cụ thể, tên của một công ty hư cấu được sử dụng trong các mô phỏng tấn công đã vô tình trùng khớp với một tên miền có thật, từ đó khiến các mô hình thực hiện các hành động tấn công.
Công ty có trụ sở tại Israel này cho rằng vấn đề xuất phát từ "sơ suất của con người" và khẳng định các sự cố đã được khắc phục. Tuy nhiên, họ không công bố số lượng cụ thể các vụ việc này mà chỉ mô tả chúng là "một số ít" hoặc chiếm "tỷ lệ nhỏ" trong tổng số các trường hợp. Một cuộc điều tra kỹ lưỡng vẫn đang được tiến hành.
Công ty cũng nhấn mạnh rằng không có bằng chứng cho thấy hệ thống của khách hàng bị xâm nhập hoặc dữ liệu khách hàng bị rò rỉ, đồng thời cho biết các công bố công khai sau đó đều liên quan đến cùng một vấn đề, chứ không phải các sự cố hoàn toàn riêng biệt.
Công ty cho biết: “Do môi trường được bật quyền truy cập Internet, tên miền này đã bị nhiều mô hình khác nhau nhắm mục tiêu một số lần. Các mô hình đã nhầm nó là một phần của bài test. Sau khi truy cập được hệ thống, chúng đã thực hiện các hành động như khai thác lỗ hổng, lấy thông tin xác thực và truy cập vào cơ sở dữ liệu production.”
“Cuối cùng, phần lớn vấn đề được phát hiện đều liên quan đến kiểm soát quyền truy cập Internet. Cụ thể, các mô hình cho rằng chúng đang hoạt động trong môi trường mô phỏng, trong khi thực tế lại đang tác động lên hệ thống thật. Chúng tôi đang triển khai các quy trình mới và chặt chẽ hơn để ngăn những lỗi thiết lập tương tự xảy ra, đồng thời vẫn đáp ứng các yêu cầu của quá trình kiểm thử.”






















