文献データベース

Overflip: Repetition-Induced Label Flips in Guardrail Models

Authors: Xu He, Chih-Hsuan Lin, Hung-Mao Chen, Junjie Xiong, Yan Zhai, Kun Sun | Published: 2026-09-14
サイバーセキュリティ
プロンプトインジェクション
評価手法

ActGuard: Pre-execution Action Auditing against Indirect Prompt Injection in LLM Agents

Authors: Bingzheng Wang, Xiaoyan Gu, Wentao Wang, Xingyou Yang, Hongcheng Li, Rong Yin | Published: 2026-09-14
インダイレクトプロンプトインジェクション
攻撃戦略分析
監査トレース

BlueSTAR: Tiered Agentic Architecture for Autonomous Cyber Defense

Authors: Simona Boboila, Xavier Cadet, Edward Koh, Daniel Balasubramanian, Dirk Van Bruggen, Peter Chin, Alina Oprea | Published: 2026-09-10
サイバーセキュリティ
攻撃戦略分析
評価手法

SpecGuard: Inference-Time Backdoor Detection For Free

Authors: Rui Wen, Ahmed Salem, Andrew Paverd, Mark Russinovich, Zheng Li | Published: 2026-09-10
バックドアモデルの検知
バックドア攻撃用の毒データの検知
評価手法

Predicting Privacy Leakage from Weight Spectral Density

Authors: Richard J. Preen, Jim Smith | Published: 2026-09-10
メンバーシップ推論
低コストのメンバシップ推論手法
評価手法

Differentially Private EEG Feature Anonymization: A Privacy-Utility Case Study in Clinical Neurophysiology

Authors: Noman Sadiq, Mohsen Toorani | Published: 2026-09-10
EEGバイオメトリクス
データプライバシー管理
差分プライバシー

Deep-Fake CAPTCHA: Mitigating Next-Generation Social Engineering Attacks

Authors: Guy Frankovits, Lior Yasur, Fred M. Grabovski, Yisroel Mirsky | Published: 2026-09-10
プロンプトリーキング
評価手法
音声信号処理

FST Pay: Deterministic Safety-Gated Architecture for Youth Digital Payments

Authors: Shaikh Mohammed Burhan, Syed Farhaan Quadri, Tabassum Nahid Sultana | Published: 2026-09-10
監査トレース
評価手法
金融安全性

ToxicRAG: Compromising Retrieval-Augmented Generation Systems via Single-Shot Knowledge Poisoning Attacks

Authors: Haozhe Lu, Jiaqi Li, Xinyuan Zhu, Xiang Li | Published: 2026-09-10
RAGへのポイズニング攻撃
データの起源と変遷
攻撃戦略分析

The Agent Incident Registry: Toward Preventing Repeated AI Agent Failures

Authors: Divyanshu Kumar, Rohith HN, Nitin Aravind Birur, Sahil Agarwal, Prashanth Harshangi | Published: 2026-09-10
インダイレクトプロンプトインジェクション
監査トレース
評価手法