セキュリティ製品は通常、真陽性率のみで評価されます。偽陽性率はめったに公表されず、統計的厳密さで測定されることもほとんどなく、独立して検証されることはほとんどありません。AIエージェント行動異常検出において、生産エージェントをブロックする単一の偽陽性は、パイロット展開を永久に終息させる可能性があります。この論文では、共同設計バイアスを排除する仕様ファーストのコーパス構築プロトコル、正当な企業エージェントの全範囲をカバーする9カテゴリーの行動分類法、ゼロ偽陽性観測のためのClopper-Pearsonの正確な信頼区間、顧客検証可能なSQLを使用した生産測定プロトコル、およびコンプライアンス制御としての自動ロールバックサーキットブレーカーを含む、完全な偽陽性率測定方法論を提案します。AgentRepEngineに実装されています (DOI: 10.5281/zenodo.19169185)。
Rehan Masood (2026) がこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: