AI agent an toàn: thiết kế quyền hạn để giảm blast radius

Bộ lọc prompt là hữu ích, nhưng không phải ranh giới tin cậy. Hãy thiết kế agent để một sai sót không trở thành sự cố production.
Ngày đăng:
AI agent có thể đọc dữ liệu, gọi công cụ và đề xuất hoặc thực hiện hành động. Chính khả năng hành động mới là điểm làm thay đổi bài toán bảo mật. Bộ lọc đầu vào vẫn cần thiết để giảm nhiễu, nhưng không nên được xem như bức tường duy nhất giữa mô hình và hệ thống quan trọng.
Bắt đầu bằng bản đồ quyền hạn
Với từng agent, hãy liệt kê bốn nhóm: dữ liệu có thể đọc, công cụ có thể gọi, hành động có thể tạo ra và đích có thể gửi dữ liệu đến. Nếu một agent vừa đọc dữ liệu nhạy cảm, vừa xử lý nội dung không tin cậy và vừa có khả năng gửi kết quả ra bên ngoài, nó cần được coi là ưu tiên rủi ro cao.
Bốn chốt chặn ở đúng vị trí
- Danh tính riêng: agent không mượn token dài hạn của người dùng hoặc tài khoản quản trị. Cấp quyền ngắn hạn, theo tác vụ và có thể thu hồi.
- Broker cho hành động: mô hình chỉ đề xuất intent có cấu trúc; một thành phần độc lập kiểm tra schema, allowlist và quota trước khi thực thi.
- Phê duyệt theo rủi ro: thao tác xóa, thay đổi production, xuất dữ liệu hoặc tạo nghĩa vụ bên ngoài cần xác nhận của con người.
- Quan sát và đảo ngược: log đầy đủ input, tool call, quyền hiệu lực, kết quả và phải có kill switch cùng phương án rollback.
Đi theo các nấc trưởng thành
Hãy bắt đầu ở chế độ đọc và tổng hợp. Khi chất lượng đã được chứng minh, chuyển sang tạo đề xuất có người duyệt; sau đó mới xem xét tự động hóa các hành động có ảnh hưởng thấp, giới hạn rõ và đảo ngược được. Tránh nhảy thẳng từ chatbot sang quyền thay đổi hạ tầng.
Sáu bài kiểm tra trước khi lên production
- Agent có thể truy cập secret qua prompt hoặc log không?
- Dữ liệu từ web, email hay file có được gắn nhãn là không tin cậy không?
- Tool có giới hạn tham số và đích mạng không?
- Token hết hạn, bị thu hồi hoặc lỗi quyền thì hệ thống phản ứng thế nào?
- Người vận hành có tái hiện được lý do cho một hành động không?
- Một thao tác lỗi có thể dừng và hoàn nguyên trong thời gian cam kết không?
Mục tiêu không phải làm agent “không thể sai”. Mục tiêu là bảo đảm sai sót được khoanh vùng, nhìn thấy và khôi phục được trước khi nó trở thành thiệt hại lớn.