10秒でいうと
指示を受けて、計画を立て、道具を使って作業を進め、結果を自分で確かめる仕組みです。
1回のやりとりで答えをもらう使い方とは、任せる範囲が違います。
第2章まで、Claudeは「聞くと答える」道具でした。ここから性質が変わります。
見積書の仕事でいうと、こうです。第2章ではPDFを1枚ずつ渡し、返ってきた表を自分で貼り付けていました。エージェントとして使うと、フォルダを渡して「表にしておいて」で終わります。間の手順は、Claudeが自分で決めて動きます。
便利ですが、任せた範囲では何が起きたか見ていません。そこが第3章の主題です。
何が違うのか

普通のやりとりは、指示 → 答えの1往復です。エージェントは、そのあいだに計画 → 実行 → 検証のループが入ります。
計画。やることを手順に分けます。「5社のPDFを開く」「項目を抜き出す」「表にまとめる」「合計が合うか確かめる」。
実行。道具を使って、実際に手を動かします。この「道具」がNo.20の話です。
検証。やった結果を自分で確かめます。ここがあるかどうかが、いちばん大きな違いです。表を作って終わりではなく、行数が合っているか、数字が合っているかを見て、合っていなければ戻ります。
何が可能になるか
手順が事前に決まっていない仕事ができるようになります。
5社のPDFのうち1社だけ形式が違っていたとします。決まった手順を実行するだけのプログラムなら、そこで止まります。エージェントはその場で気づいて、別のやり方を試します。
もうひとつは量です。1枚ずつ渡していた作業が、フォルダごと渡せるようになります。20社でも同じ手間です。
使うべきでない場面
ここが本題です。便利さと危うさは同じ性質から来ています。
間違えたときの取り返しがつかない仕事。ファイルの一括削除、メールの送信、支払いの実行、本番環境への反映。元に戻せない操作は、人が最後のボタンを押してください。
正確さが100%求められる仕事。検証の仕組みがあっても、100%にはなりません。金額の確定、法的な文書の提出、医療の判断。エージェントは下ごしらえまでです。
判断そのものが仕事の中心にある場面。どの取引先を選ぶかは、価格だけでは決まりません。エージェントに「安いほうを選んで」と任せると、価格しか見ていない結論が出ます。判断の材料を揃えるところまでが向いています。
何が起きたか追えない状態で回すこと。これが一番こわい。エージェントが20回動いて、19回は正しく、1回だけ静かに間違えた。気づける仕組みがないなら、そもそも任せるべきではありません。
任せる前に決める3つ
- どこまでやったら止まるか(「表を作ったら見せて。保存はしないで」)
- どうなったら成功か(「行数がPDFの枚数と一致していること」)
- 失敗したらどうするか(「読めないPDFがあったら、そこで止めて報告する」)
この3つを渡さずに任せると、Claudeが勝手に決めます。悪意なく、それらしい判断で埋めます。No.11で「例外の扱いを書かないと推測で埋める」と書いたのと同じことが、規模を大きくして起きます。
やってみよう:任せてよい仕事か判定させる(3分)
プロンプト
“`
次の作業を、AIエージェントに任せてよいか判定してください。
「任せてよい」「下ごしらえまで」「任せるべきでない」の3つに分けて、
理由も書いてください。判断の分かれ目になった点も教えてください。・(自分の仕事を3つから5つ書く)
“`期待される結果:3段階に分かれて返る。「元に戻せるか」「間違いに気づけるか」が判断の分かれ目として挙がる。
うまくいかないとき:全部「任せてよい」になったら、作業の書き方が抽象的すぎます。「誰に何が届くか」まで書くと、取り返しのつく/つかないの差が出ます。
つまずきポイント
自律的であることを、賢いことだと誤解する。自分で手順を決められることと、判断が正しいことは別です。手順を決める自由度が上がるほど、間違えられる範囲も広がります。
見ていないのに、見た気になる。途中の作業を全部読む人はいません。だからこそ、最後の検証を人がやる設計にしてください。
最初から大きく任せる。1枚のPDFで確かめてから5社に広げる。この順番を飛ばすと、間違いが5倍になって出てきます。
まとめ
- エージェントは計画・実行・検証のループを自分で回す
- 決定的な違いは検証があること。手順が決まっていない仕事に強い
- 元に戻せない操作と、100%の正確さが要る仕事は任せない
- 任せる前に「止まる条件・成功の条件・失敗したときの扱い」を渡す
次に読む
※本記事の情報は 2026年8月時点のものです。