Đang vận hành

AI agent an toàn cần ranh giới quyền và điều kiện dừng

Agent không đáng tin chỉ vì nó hoàn thành được nhiều bước. Nó đáng tin khi quyền hạn, dữ liệu và điều kiện dừng đều có thể kiểm tra.

AI agent an toàn cần ranh giới quyền và điều kiện dừng
AI agent an toàn cần ranh giới quyền và điều kiện dừng

Agent không phải nhân viên có toàn quyền

Một agent có thể đọc dữ liệu, gọi công cụ và nối nhiều bước thành một nhiệm vụ. Chính khả năng đó dễ khiến đội ngũ gán cho nó quyền hạn giống một người dùng giàu kinh nghiệm. Nhưng agent không có ngữ cảnh xã hội, trực giác về hậu quả hay trách nhiệm pháp lý. Quyền của nó phải nhỏ hơn mục tiêu mà nó đang cố hoàn thành.

Tách mục tiêu khỏi quyền thực thi

Hãy mô tả nhiệm vụ bằng ngôn ngữ rõ ràng, sau đó cấp một danh sách công cụ hẹp cho đúng nhiệm vụ đó. Một agent có thể đọc lịch nhưng không cần sửa lịch; có thể soạn một email nhưng không cần gửi; có thể đề xuất thay đổi nhưng không cần áp dụng. Mỗi bước vượt qua ranh giới cần tạo ra một yêu cầu xác nhận.

  • Cấp quyền theo tác vụ và thời gian, không theo vai trò chung.
  • Chỉ đưa vào ngữ cảnh những dữ liệu cần thiết.
  • Tách hành động đọc, đề xuất và thay đổi trạng thái.
  • Thu hồi quyền ngay khi tác vụ kết thúc hoặc bị hủy.

Dữ liệu cũng cần một cổng kiểm tra

Prompt injection có thể xuất hiện trong tài liệu, email hoặc nội dung người dùng mà agent đọc. Đừng coi mọi đoạn văn là chỉ dẫn. Dữ liệu bên ngoài nên được đánh dấu, lọc và giữ trong ngữ cảnh riêng; công cụ phải tự kiểm tra quyền trước khi thực hiện, kể cả khi yêu cầu đến từ agent nội bộ.

Điều kiện dừng không phải một câu nhắc

Một câu như ‘hãy cẩn thận’ không đủ để bảo vệ tác vụ dài. Điều kiện dừng cần nằm ở logic có thể kiểm tra: số bước, thời gian, loại hành động, phạm vi bản ghi hoặc thay đổi dự kiến. Khi vượt ngưỡng, hệ thống dừng và đưa nhiệm vụ về cho người có quyền, thay vì thử thêm một lần trong im lặng.

  • Dừng khi công cụ trả lỗi hoặc dữ liệu mâu thuẫn.
  • Dừng trước hành động có hậu quả ngoài dự kiến.
  • Dừng khi yêu cầu thay đổi phạm vi dữ liệu ban đầu.
  • Dừng và báo người dùng khi agent không giải thích được nguồn quyết định.

Audit phải kể được một câu chuyện

Log hữu ích không chỉ ghi agent đã gọi công cụ nào. Nó cần nối yêu cầu ban đầu, dữ liệu được dùng, quyết định trung gian, người xác nhận và kết quả cuối. Giữ lượng dữ liệu vừa đủ cho điều tra, che thông tin nhạy cảm và đặt thời hạn lưu trữ. Một dấu vết rõ ràng giúp đội ngũ sửa hệ thống thay vì đổ lỗi cho mô hình.

Agent an toàn không phải agent ít năng lực; đó là agent biết mình không được vượt qua cánh cửa nào.

Kết luận

Thiết kế agentic AI bắt đầu từ quyền hạn nhỏ, dữ liệu có phạm vi và điều kiện dừng ở ngoài mô hình. Khi xác nhận, audit và phục hồi được xem là một phần của sản phẩm, agent có thể hỗ trợ nhiều công việc mà không trở thành một đường tắt khó kiểm soát vào hệ thống.

Trao đổi về AI có trách nhiệm