運用中

安全なAIエージェントには権限の境界と停止条件が必要

多くの手順を実行できるから信頼できるのではない。権限、データ、停止条件を確認できるから信頼できる。

安全なAIエージェントには権限の境界と停止条件が必要
安全なAIエージェントには権限の境界と停止条件が必要

エージェントは全権限を持つ社員ではない

エージェントはデータを読み、ツールを呼び、複数の手順を一つの仕事にまとめられます。その力を見ると経験豊かな利用者と同じ権限を与えたくなります。しかしエージェントには社会的な文脈、結果への直感、法的な責任がありません。目標より小さな権限にすべきです。

目的と実行権限を分ける

仕事を明確な言葉で説明し、その仕事に必要な狭いツールだけを渡します。カレンダーを読めても編集は不要、メールを下書きできても送信は不要、変更を提案できても適用は不要です。境界を越えるときは確認を求めます。

  • 権限は大きな役割ではなく仕事と時間で与える。
  • 必要なデータだけをコンテキストに入れる。
  • 読む、提案する、状態を変える操作を分ける。
  • 終了または取消時に権限を回収する。

データにもゲートが必要

エージェントが読む文書、メール、ユーザー入力にはプロンプトインジェクションが入り得ます。すべての段落を指示として扱わないでください。外部データを印付けして絞り、別のコンテキストに保ち、ツール自身が権限を確認するようにします。

停止条件は注意書きではない

「注意する」という一文では長い仕事を守れません。手順数、経過時間、操作の種類、レコード範囲、予想される変更をロジックとして検査します。上限を越えたら黙って再試行せず、権限を持つ人へ戻します。

  • ツールが失敗したりデータが矛盾したら止める。
  • 予想外の影響がある操作の前で止める。
  • 要求が最初のデータ範囲を広げたら止める。
  • 判断の根拠を説明できなければ利用者へ知らせて止める。

監査は一つの物語を残す

役に立つログは呼び出したツールの一覧だけではありません。最初の要求、使ったデータ、中間の判断、人の確認、最終結果をつなぎます。調査に必要な量を保ちつつ、機密項目を隠し、保存期間を決めます。筋の通った記録があれば、モデルを責めるのではなくシステムを直せます。

安全なエージェントは弱いのではなく、越えてはいけない扉を知っている。

まとめ

エージェントAIは小さな権限、範囲のあるデータ、モデルの外側にある停止条件から始めます。確認、監査、復旧を製品の機能として扱えば、制御できない近道ではなく実務を支える道具になります。

責任あるAIを相談する