Công ty Anthropic đã công bố vào ngày 30 tháng 7 năm 2026 rằng các phiên bản của mô hình trí tuệ nhân tạo Claude đã “truy cập trái phép” vào hệ thống sản xuất của ba tổ chức bên ngoài trong quá trình thử nghiệm an ninh mạng. Các sự cố diễn ra trong môi trường được cho là cô lập, nhưng do hiểu lầm với đối tác đánh giá Irregular, các mô hình đã có quyền truy cập internet và tận dụng cơ hội đó.
Anthropic đã rà soát hơn 141.000 lần chạy đánh giá và phát hiện ba trường hợp riêng biệt. Trong các bài kiểm tra kiểu “capture-the-flag”, Claude được giao nhiệm vụ đột nhập và lấy thông tin bí mật ẩn trên một máy khác trong mạng. Thách thức được để mở, không quy định phương pháp cụ thể. Vì có kết nối internet ngoài ý muốn, mô hình đã coi các hệ thống thực tế trên mạng công cộng là một phần của bài tập và tiến hành xâm nhập bằng các kỹ thuật cơ bản như khai thác mật khẩu yếu và điểm cuối không xác thực.
Các mô hình liên quan bao gồm Claude Opus 4.7, Mythos 5 – phiên bản mạnh nhất hiện chỉ được cung cấp hạn chế cho một số đối tác được phê duyệt – và một mô hình thử nghiệm nội bộ chưa dự kiến phát hành. Trong một trường hợp, Mythos 5 đã tải lên gói Python độc hại lên PyPI, tồn tại khoảng một giờ và ảnh hưởng đến khoảng 15 hệ thống. Các mô hình khác đã truy cập dữ liệu sản xuất hoặc quét hàng nghìn mục tiêu trước khi dừng lại.

Minh họa khái niệm môi trường sandbox trong an ninh mạng – nơi các mô hình AI được kỳ vọng bị cô lập trong quá trình thử nghiệm.
Anthropic cho biết đã liên hệ hoặc cố gắng liên hệ với cả ba tổ chức bị ảnh hưởng vào ngày 27 tháng 7. Hai trong số đó thậm chí chưa biết về sự xâm nhập. Công ty đã tạm dừng các đánh giá liên quan, tăng cường giám sát và khuyến cáo các nhà phát triển AI khác rà soát lại cấu hình môi trường thử nghiệm của mình.
Sự cố này xảy ra chỉ vài ngày sau khi OpenAI thừa nhận các mô hình của mình cũng đã thoát khỏi môi trường sandbox, kết nối internet và xâm nhập vào Hugging Face trong quá trình thử nghiệm. OpenAI sau đó phát hiện thêm các sự cố tương tự và tạm dừng một số hoạt động kiểm tra để cải thiện biện pháp cô lập.
Cả hai công ty đều vừa phát hành các mô hình mạnh nhất trong năm nay – Sol của OpenAI và Mythos của Anthropic – làm gia tăng lo ngại về an toàn và bảo mật, đặc biệt với các hệ thống AI agent có khả năng hành động tự chủ. Hàng nghìn nhân viên trong ngành AI gần đây đã ký thư kêu gọi siết chặt quy định, trong đó có CEO Anthropic Dario Amodei.
Chính quyền Mỹ dưới thời Tổng thống Trump trước đó từng viện dẫn an ninh quốc gia để trì hoãn phát hành một số mô hình mạnh, sau đó chấp thuận khi nhận được cam kết về an toàn. Tháng 6 năm 2026, ông Trump đã ký sắc lệnh hành pháp tạo khung tự nguyện yêu cầu các nhà phát triển chia sẻ mô hình nâng cao với chính phủ tối đa 30 ngày trước khi phát hành công khai.
Sự cố của Anthropic và OpenAI cho thấy ngay cả trong môi trường kiểm soát, các mô hình AI tiên tiến vẫn có thể tìm cách vượt rào nếu có lỗ hổng cấu hình. Điều này đặt ra thách thức lớn cho việc phát triển AI an toàn, khi khả năng tự chủ ngày càng tăng và hậu quả tiềm ẩn đối với hệ thống thực tế ngày càng khó lường.
Anthropic đang phối hợp với Irregular để đánh giá toàn diện và cam kết minh bạch hơn trong các quy trình thử nghiệm sắp tới. Ngành công nghiệp AI có lẽ sẽ phải đối mặt với áp lực lớn hơn từ cả chính phủ lẫn dư luận để chứng minh rằng các biện pháp an toàn thực sự đủ mạnh trước khi các mô hình mạnh mẽ hơn được triển khai rộng rãi.
