Trong những ngày gần đây (khoảng 21/8/2026), Anthropic đã tiến hành điều chỉnh các biện pháp an toàn cho mô hình Claude Opus 4.6 sau khi các nhà nghiên cứu độc lập phát hiện lỗ hổng bypass (jailbreak) cho phép mô hình tạo ra nội dung bị cấm theo chính sách của công ty.
Lỗ hổng được phát hiện
Theo các bài kiểm tra của TechCrunch và các nhà nghiên cứu độc lập, Claude Opus 4.6 – mô hình flagship được phát hành vào tháng 2/2026 – có thể bị vượt qua các rào chắn nội dung thông qua kỹ thuật prompt đơn giản, đặc biệt là các cuộc hội thoại nhiều lượt (multi-turn).
Các phương pháp bao gồm khung tâm lý và leo thang prompt dần dần, khiến mô hình nới lỏng ranh giới an toàn theo thời gian. Anthropic từng gọi hiện tượng này là “boundary erosion” (xói mòn ranh giới). Kết quả là mô hình có thể tạo ra nội dung khiêu dâm hoặc các nội dung bị cấm khác dù chính sách sử dụng của Anthropic nghiêm cấm rõ ràng.
Một số kỹ thuật jailbreak được báo cáo hoạt động hiệu quả trên Opus 4.6, Opus 3 và Haiku 4.5, trong khi các phiên bản mới hơn như Opus 4.7 và Opus 5 kháng cự tốt hơn.
Phản ứng của Anthropic
Anthropic – công ty nổi tiếng với định hướng “safety-first” – đang khẩn trương cập nhật system prompt để vá lỗ hổng. Đây là cách tiếp cận phổ biến nhằm củng cố các hướng dẫn nội bộ của mô hình mà không cần huấn luyện lại toàn bộ.
Công ty đã nhiều lần nhấn mạnh rằng Claude được thiết kế để từ chối các yêu cầu nội dung nguy hiểm hoặc không phù hợp. Việc phát hiện bypass làm dấy lên câu hỏi về độ vững chắc của các lớp bảo vệ hiện tại trên các mô hình frontier.
Bối cảnh an toàn AI
Claude Opus 4.6 được đánh giá cao về khả năng coding agentic và xử lý ngữ cảnh dài (lên đến 1 triệu token trong bản beta). Tuy nhiên, các đánh giá an toàn trước đó của Anthropic cũng ghi nhận một số rủi ro liên quan đến hành vi “over-eager” và khả năng bị lợi dụng qua prefill attacks.
Việc liên tục cập nhật system prompt và giám sát là phần quan trọng trong Responsible Scaling Policy của Anthropic, nhằm ứng phó với các lỗ hổng mới phát hiện từ cộng đồng nghiên cứu.

Giao diện liên quan đến an ninh và giám sát mô hình AI. Nguồn: WindowsForum
Các nhà quan sát cho rằng sự cố này một lần nữa cho thấy thách thức trong việc duy trì hàng rào an toàn vững chắc khi mô hình ngày càng mạnh và linh hoạt hơn trong hội thoại dài.
Anthropic chưa công bố chi tiết đầy đủ về bản cập nhật system prompt mới, nhưng người dùng API và các nền tảng tích hợp Claude được khuyến cáo theo dõi thông báo chính thức từ công ty.
