Citadel Radar

生成AIの入出力をリアルタイムに監視し、
不適切な応答を防ぐファイアウォール

Challenges

従来のITシステムの監視では、生成AIは守れない

従来のITシステムの監視は、エラー率や可用性を見ていれば十分でした。しかし生成AIアプリケーションでは、システムが「正常稼働」したまま、不適切な回答や情報漏えいが起こります。ユーザーとのやり取りが業務上適切か、リスクを含んでいないか、期待される価値を発揮しているか——それを継続的に確認する必要があります。

さらに、生成AIの運用には事業部門・業務部門・リスク管理部門・コンプライアンス部門など、非技術者を含む多くの関係者が関わります。技術者向けに作られた従来のモニタリングツールでは、この体制を支えるのは困難です。

Risk Scenarios

こんな「正常稼働中の事故」を検知します

機密情報・
個人情報の入力

従業員が意図せず顧客の個人情報や社外秘データをプロンプトに入力。入力時点で検知し、ポリシーに応じてブロックします。

プロンプトインジェクション・
ジェイルブレイク

「これまでの指示をすべて無視して」——ガードレールをすり抜けようとする敵対的な入力を検知し、不適切な回答を未然に防ぎます。

32 line chart

ハルシネーション・
有害な出力

誤情報や有害・不適切な出力を継続的にモニタリング。パフォーマンスの変化を早期に把握します。

Capabilities

手軽な設定・柔軟な制御・リアルタイム監視で、リスクを防御

ガイドラインに紐づくメトリクスで、リスクを定義
主要なガイドライン・フレームワークに紐ついた評価カテゴリ・評価メトリクス

01 — Define

ガイドラインに紐づくメトリクスで、
リスクを定義

AIセーフティガイドラインや各種フレームワークを参照して設計されたビルトインメトリクスを搭載。評価基準をゼロから定義しなくても、一般的なAIリスク観点のモニタリングをすぐに開始できます。

  • 入力・出力ログをAPI経由でリアルタイム評価
  • 日本語の業務文脈にも対応
  • 自社ルール・業界ガイドライン・コンプライアンス要件に応じたカスタムメトリクス
  • メトリクスの評価精度を事前確認できるプレイグラウンド
Block / Flagで、 用途に応じた柔軟な制御
評価メトリクス設定画面 — 入力/出力×ブロック/モニタリング

02 — Control

Block / Flagで、
用途に応じた柔軟な制御

厳格に止めるべきリスクは「Block」、モニタリングすべきリスクは「Flag」。アプリケーションの用途と組織の運用ポリシーに応じて、制御方式をメトリクスごとに使い分けられます。複数のメトリクスと運用パラメータは「評価パッケージ」としてまとめて管理できます。

  • 回答表示前の評価実行で、リスクのある出力を未然にブロック
  • ブロックした入力・出力の違反カテゴリ、違反理由を詳細に確認可能
MONITOR|非技術者も使える、組織横断モニタリング
直感的に見やすいダッシュボード

03 — Monitor

非技術者も使える、
組織横断モニタリング

事業部門、業務部門、リスク管理部門、コンプライアンス部門など分散した関係者が、共通の画面でリスク状況を確認。評価メトリクスと運用ログの蓄積は、組織内でAIリスクを語る「共通言語」になります。

  • トラフィックページで個別ログ・判定理由・メタデータを確認
  • アナリティクスで検知傾向、Block/Flag件数、リスク分布を可視化
  • しきい値に応じたアラートメール通知(即時・定期)
  • アプリケーション単位のAPIキー管理、ロール・リソース権限による運用管理

Architecture

常時自動監視を
可能にする設計

高い耐障害性と
スケーラビリティ

ファイアウォールに最適化した形でアーキテクチャをゼロから設計。クリティカルなAIシステムの高速・自動・常時監視に耐える基盤です。

レスポンスへ
の影響を最小化

入力評価は回答生成と並列実行。出力評価はローカルモデル対応により低レイテンシーを実現します。モニタリングのみの構成も選択可能です。

ガイドラインと
紐づく評価体系

AI事業者ガイドライン、OWASP等の主要フレームワークとメトリクスの対応関係を整理。曖昧になりがちな「AIの安全性」を構造的に評価できます。

AI Trust Cycle

本番の知見を、
テスト設計に還流する

Citadel Radarが本番で検知した違反事例は、再発防止のための資産に変わります。リリース前の評価・テスト(Citadel Lens)とつなげることで、「事前検証 → 本番監視 → 改善」の継続的なループを形成。利用する生成AIが入れ替わっても、トラスト基盤として安全なAI利活用を守り続けます。

Citadel Lens Evaluation
(評価機能)

LLM評価・テスティング。自動評価と人手評価でリスクを定量化。

Citadel Lens Governance
(ガバナンス機能)

導入前審査とAI資産のインベントリ管理。1線・2線がつながるAIガバナンス。

本番の知見を、テスト設計に還流する

Standards

主要なガイドライン・
フレームワークに紐づく検知

AIセーフティガイドラインや各種フレームワークを参照して設計されたビルトインメトリクスにより、AIの安全性を構造的に評価。日本のAI事業者ガイドラインを実装しています。

FAQ

よくあるご質問

生成AIアプリケーションの入力・出力を評価し、リスクの検知・制御・モニタリングを行うファイアウォール・モニタリング製品です。プロンプトとレスポンスの業務適切性・リスク・品質を継続的に評価し、組織横断のAIガバナンスを実運用に落とし込みます。

アプリケーションからAPI経由で入力・出力ログを受け取り、評価メトリクスに基づいてリアルタイムに評価します。回答をユーザーに表示する前に評価を実行し、評価結果に応じて回答を通す・ブロックする・フラグを付けて記録するという制御が可能です。

Blockは個人情報の入力や重大なガイドライン違反など、厳格に止めるべきリスクに、Flagは分析のためにモニタリングしたいリスクに使います。アプリケーションの用途や組織の運用ポリシーに応じて、メトリクスごとに柔軟に設定できます。

影響を最小化する設計です。入力評価は回答生成と並列に実行されるためレイテンシーはわずかです。出力評価は軽量なローカルモデルによる評価にも対応し、目安0.1秒程度の低レイテンシー評価を実現することも可能です。

はい。Citadel Radarは非技術者によるモニタリングに最適化されています。事業部門・業務部門・リスク管理部門・コンプライアンス部門など複数の関係者が共通の画面でリスク状況を確認でき、判定理由や違反カテゴリも詳細に確認できます。

入力側では個人情報・機密情報の入力、プロンプトインジェクション、ジェイルブレイクなど、出力側ではハルシネーション、有害・不適切なコンテンツ、機密情報の漏えいなどを検知します。ビルトインメトリクスに加え、自社ルールや業界ガイドラインに応じたカスタムメトリクスも作成できます。

本番稼働中の生成AIに、
ガードレールを

デモのご依頼を受け付けています。