AGENT WORKBENCH が公開する120件のAIエージェント安全性シナリオを検索・絞り込み・比較できます。各シナリオは「信頼できる指示」と「信頼できないコンテンツ」を分け、期待される結果・必要なゲート・リスクフラグ・根拠(マトリクス項目)を記録しています。最終判断は人間が行います。
検索・絞り込み
—
比較
検索結果
シナリオ詳細
ダウンロード
CSVは数式インジェクション対策済み。JSON/CSV/NDJSONは同一データ(件数・フィールド一致)。印刷はブラウザの印刷機能から。
誠実な扱い
- シナリオのラベルは、サイト独自のレビュー結果(curated labels)です。科学的前提や業界標準ではありません。
- 本サイトはAIモデルの性能を評価・比較するものではありません(詳細は方法論)。
- 医療・法律・金融・採用の最終判断は人間が行います。
参照資料
- OWASP Top 10 for LLM Applications — プロンプトインジェクション等のLLMアプリ脆弱性。
- Security Considerations for Artificial Intelligence Agents — エージェント固有の脅威整理。
- AgentDyn — 動的環境でのエージェント防御の実運用適合を論じる。
- Stakeholder-Centric Prompt Injection Benchmarking — owner-harm / third-party-harm の被害帰属視点。