OpenAI tạm giảm tốc huấn luyện mô hình AI thế hệ mới để tăng cường bảo mật

21.08.2026, 3:03 pm 5

OpenAI tạm giảm tốc huấn luyện mô hình AI thế hệ mới để tăng cường bảo mật
OpenAI tạm dừng huấn luyện tăng cường quy mô lớn để đánh giá hành vi và kiểm chứng lớp bảo vệ mới, sau sự cố với Hugging Face.

OpenAI đang siết quy trình phát triển và kiểm thử các mô hình AI tiên tiến, trong đó một số hoạt động huấn luyện tăng cường (reinforcement learning) quy mô lớn vẫn được tạm dừng để hãng đánh giá hành vi mô hình và xác thực các biện pháp bảo vệ mới.

Những thay đổi được OpenAI công bố sau sự cố bảo mật liên quan đến quá trình đánh giá mô hình với Hugging Face hồi tháng 7. Tuy nhiên, công ty cho biết đây không phải phản ứng trực tiếp từ riêng sự cố này. Các biện pháp mới còn xuất phát từ tốc độ phát triển nhanh của AI và năng lực an ninh mạng ngày càng cao trên những mô hình sắp ra mắt, trong đó có Astra.

Sau sự cố với Hugging Face, OpenAI đã tạm dừng hoạt động huấn luyện tăng cường trong khoảng hai tuần. Công ty hiện đã khởi động lại quá trình huấn luyện đối với nhiều mô hình được đánh giá có mức rủi ro thấp hơn, nhưng đợt huấn luyện tăng cường quy mô lớn nhất theo kế hoạch dành cho các mô hình AI tiên tiến vẫn chưa tiếp tục.

Trong thời gian này, OpenAI sẽ tiến hành các đợt huấn luyện và đánh giá ở quy mô nhỏ hơn nhằm quan sát hành vi của mô hình, kiểm tra hiệu quả của những lớp bảo vệ mới và thu thập thêm bằng chứng về khả năng căn chỉnh hành vi mô hình theo mục tiêu an toàn trước khi tiếp tục các đợt huấn luyện lớn.

Amelia Glaese, Phó chủ tịch phụ trách nghiên cứu tại OpenAI, cho biết mức độ kiểm soát sẽ tăng theo năng lực và mức rủi ro của từng mô hình. Những hệ thống mạnh hơn, đặc biệt là các mô hình AI tiên tiến, sẽ phải trải qua quy trình giám sát chặt chẽ hơn trong quá trình phát triển.

Một trong những thay đổi quan trọng liên quan đến việc cô lập mạng. Trong sự cố với Hugging Face, mô hình đã có thể thoát khỏi môi trường huấn luyện sau khi một công cụ trên mạng có quyền truy cập Internet bị xâm nhập. Theo cơ chế mới, OpenAI muốn đảm bảo rằng việc một tác vụ hoặc dịch vụ hỗ trợ bị xâm nhập riêng lẻ sẽ không đủ để tạo quyền truy cập trái phép ra Internet hoặc sang những mạng nội bộ khác.

Công ty cũng tăng cường hệ thống giám sát trong quá trình thử nghiệm mô hình. Hệ thống này sẽ theo dõi hành động thực hiện thông qua các công cụ, dấu vết suy luận khả dụng và nhật ký hoạt động để phát hiện nhiều dạng hành vi không được phép.

OpenAI đặt mục tiêu phát cảnh báo trong vòng 30 phút sau khi phát hiện hoạt động đáng lo ngại. Đổi lại, lớp giám sát này có thể tạo thêm chi phí tính toán tương đương khoảng 20% khối lượng tính toán của quá trình đang được theo dõi.

Các biện pháp mới xuất hiện trong bối cảnh OpenAI đánh giá những mô hình AI tương lai có thể sở hữu năng lực an ninh mạng cao hơn đáng kể. Astra được nhắc đến như một trong những yếu tố thúc đẩy công ty nâng yêu cầu về giám sát, căn chỉnh hành vi mô hình và bảo mật ngay từ giai đoạn phát triển, thay vì chỉ xử lý rủi ro sau khi mô hình hoàn tất huấn luyện.

OpenAI hiện chưa công bố đầy đủ chi tiết kỹ thuật của hệ thống giám sát mới và cho biết sẽ cung cấp thêm thông tin trong một bài viết riêng. Báo cáo hậu kiểm chính thức về sự cố bảo mật liên quan đến Hugging Face cũng vẫn chưa được công bố.

Bài viết liên quan

Bài viết mới nhất

Sản phẩm khuyến mãi

So sánh (0)

SO SÁNH SẢN PHẨM

Thêm sản phẩm vào giỏ hàng thành công!

huyễn mãi
huyễn mãi