Overflip: Repetition-Induced Label Flips in Guardrail Models Authors: Xu He, Chih-Hsuan Lin, Hung-Mao Chen, Junjie Xiong, Yan Zhai, Kun Sun | Published: 2026-09-14 CybersecurityPrompt InjectionEvaluation Method 2026.09.14 2026.09.16 Literature Database
ActGuard: Pre-execution Action Auditing against Indirect Prompt Injection in LLM Agents Authors: Bingzheng Wang, Xiaoyan Gu, Wentao Wang, Xingyou Yang, Hongcheng Li, Rong Yin | Published: 2026-09-14 Indirect Prompt Injection攻撃戦略分析監査トレース 2026.09.14 2026.09.16 Literature Database
BlueSTAR: Tiered Agentic Architecture for Autonomous Cyber Defense Authors: Simona Boboila, Xavier Cadet, Edward Koh, Daniel Balasubramanian, Dirk Van Bruggen, Peter Chin, Alina Oprea | Published: 2026-09-10 Cybersecurity攻撃戦略分析Evaluation Method 2026.09.10 2026.09.12 Literature Database
SpecGuard: Inference-Time Backdoor Detection For Free Authors: Rui Wen, Ahmed Salem, Andrew Paverd, Mark Russinovich, Zheng Li | Published: 2026-09-10 Backdoor DetectionDetection of Poison Data for Backdoor AttacksEvaluation Method 2026.09.10 2026.09.12 Literature Database
Predicting Privacy Leakage from Weight Spectral Density Authors: Richard J. Preen, Jim Smith | Published: 2026-09-10 Membership InferenceLow-Cost Membership Inference MethodEvaluation Method 2026.09.10 2026.09.12 Literature Database
Differentially Private EEG Feature Anonymization: A Privacy-Utility Case Study in Clinical Neurophysiology Authors: Noman Sadiq, Mohsen Toorani | Published: 2026-09-10 EEG BiometricsData Privacy ManagementDifferential Privacy 2026.09.10 2026.09.12 Literature Database
Deep-Fake CAPTCHA: Mitigating Next-Generation Social Engineering Attacks Authors: Guy Frankovits, Lior Yasur, Fred M. Grabovski, Yisroel Mirsky | Published: 2026-09-10 Prompt leakingEvaluation MethodSpeech Signal Processing 2026.09.10 2026.09.12 Literature Database
FST Pay: Deterministic Safety-Gated Architecture for Youth Digital Payments Authors: Shaikh Mohammed Burhan, Syed Farhaan Quadri, Tabassum Nahid Sultana | Published: 2026-09-10 監査トレースEvaluation Method金融安全性 2026.09.10 2026.09.12 Literature Database
ToxicRAG: Compromising Retrieval-Augmented Generation Systems via Single-Shot Knowledge Poisoning Attacks Authors: Haozhe Lu, Jiaqi Li, Xinyuan Zhu, Xiang Li | Published: 2026-09-10 Poisoning attack on RAGData Origins and Evolution攻撃戦略分析 2026.09.10 2026.09.12 Literature Database
The Agent Incident Registry: Toward Preventing Repeated AI Agent Failures Authors: Divyanshu Kumar, Rohith HN, Nitin Aravind Birur, Sahil Agarwal, Prashanth Harshangi | Published: 2026-09-10 Indirect Prompt Injection監査トレースEvaluation Method 2026.09.10 2026.09.12 Literature Database