AI に「制限」をかける — KangaL で実際に設けたガードレール

AI に自由に何でもさせると、便利な反面、危険もついてきます。 とくに、人の指示なしに自分で動き続ける「自律的な AI」ほど、歯止めが要ります。

その歯止めが 制限(ガードレール) です。 「できることをあえて狭める」ことが、安全に使うための設計そのものになります。

この記事では、攻撃 AI と防御 AI が戦う自作システム KangaL で、実際にどんな制限をかけたかを紹介します。 KangaL が何をするものかは 開発記:詐欺と戦う AI「KangaL」ができるまで にまとめています。

KangaLがかけた4つの制限。実弾を作らせない・回数に上限・見る情報を絞る・危険機能は普段オフ。

なぜ AI に制限が要るのか

KangaL は、攻撃 AI(狼) が詐欺の手口を進化させ、防御 AI(番犬) がそれを見抜く力を育てる、という仕組みです。 検知の精度が目の前で上がっていくのが売りですが、ここには明らかな危うさがあります。

攻撃側の AI に「うまい詐欺を考えて」と言えば、本物として使える詐欺の文面まで作れてしまうかもしれない。 それが外に漏れれば、防犯のための道具が、そのまま悪用の道具になります。

だから作るときに、いくつもの制限を先に設計へ組み込みました。 順に見ていきます。

制限 1:危険物そのものを作らせない

いちばん大事にしたのが、この一点です。 攻撃 AI に、そのまま送れる完成された詐欺文(いわば「実弾」)を作らせない。

代わりに作らせたのは、詐欺の**「型」**だけです。 「緊急性をあおる」「権威になりすます」「内密にさせる」。こうした手口の設定値を組み替えて進化させ、防御側の死角を探す。 危険な完成品は、そもそも一つも生まれない設計にしたのです。

これは「作ってから危険なものを消す」より、ずっと確実です。 最初から存在しなければ、漏れようがないからです。

制限 2:暴走を止める上限

自己改善するAIには、もう一つの怖さがあります。 放っておくと、ループが延々と回り続けてしまうことです。

そこで、攻撃⇄防御の応酬に回数のハード上限を設けました。 何回まわしたら必ず止まる、という歯止めです。 「賢くなり続ける」仕組みには、「必ず止まる」仕組みをセットにする。 自律的な AI を扱うときは、この考え方が基本になります。

制限 3:見る情報を絞る

攻撃 AI が手口を考えるとき、何を参考にさせるか。 ここも絞りました。

参考にできるのは、公的機関が公開している注意喚起情報だけ。 あやしいサイトや、出どころ不明の生データは読ませません。 AI に与える「材料」を信頼できるものに限るだけで、危険な方向へ暴走する余地がぐっと減ります。

これは、プロンプトインジェクション(読み込ませた資料に命令を仕込まれる攻撃)への備えにもなっています。 外から取ってきた文章は「命令」ではなく、あくまで「ただのデータ」として扱う。 この線引きを、設計の段階で決めておきました。

制限 4:危険な機能は、普段オフ

KangaL には 2 つのモードがあります。

  • 通常モード:攻撃 AI はオフ。防御だけが動く。ふだん使いはこちら。
  • デモ/研究モード:攻撃 AI をオンにして、攻防を可視化する。

つまり、いちばん危ない機能は、必要なときしか動かさない。 普段は金庫にしまっておき、見せるときだけ、管理された場で取り出す。 「機能はあるけれど、常時は動かさない」という分け方も、立派な制限の一つです。

「入れない」も、設計のうち

面白いのは、制限を考えるほど「あえて足さない」判断も増えたことです。

危険な完成品が生まれない設計(制限 1)にしたおかげで、 「出力を事後にフィルタでブロックする」「人間が毎回レビューする」といった重い仕組みは、そもそも要らなくなりました。 守るべき危険物が存在しないのだから、その対策も要らない、という理屈です。

世の中には OWASP の LLM Top 10 のように、AI の危険をまとめたチェックリストがあります。 それを全部やみくもに盛るのではなく、自分の設計に本当に必要なものだけを選ぶ。 安全対策は「多ければいい」ではなく、「設計に合っているか」で決まります。

個人が AI を使うときにも効く

大げさなシステムの話に聞こえるかもしれませんが、教訓はそのまま日常に効きます。

  • 取り返しのつかない操作には、自分の承認という上限をつける(制限 2 の発想)
  • AI に見せる情報は、信頼できるものに絞る(制限 3 の発想)
  • 危ない使い方は、必要なときだけにする(制限 4 の発想)

このあたりは、AI と安全につきあう で紹介した心得とぴたりと重なります。 作る側でも使う側でも、考え方は同じなのです。

まとめ

自律的に動く AI ほど、「できることを狭める」制限が安全の土台になります。 KangaL で実際に設けたのは、危険物を作らせない・回数に上限・情報を絞る・危険機能は普段オフ、という 4 つ。 そして、不要な対策はあえて足さない。

制限と聞くと、不自由で後ろ向きな響きがあります。 でも実際は逆です。 歯止めがあるからこそ、AI に思い切って仕事を任せられる。 交通ルールがあるから、安心してアクセルを踏めるのと同じです。

安全な設計は、AI の力を殺すものではなく、力を安心して引き出すための枠組み。 その枠を先に描いておくことが、AI と長くつきあうための第一歩になります。