Literature Database

Overflip: Repetition-Induced Label Flips in Guardrail Models

Authors: Xu He, Chih-Hsuan Lin, Hung-Mao Chen, Junjie Xiong, Yan Zhai, Kun Sun | Published: 2026-09-14
Cybersecurity
Prompt Injection
Evaluation Method

ActGuard: Pre-execution Action Auditing against Indirect Prompt Injection in LLM Agents

Authors: Bingzheng Wang, Xiaoyan Gu, Wentao Wang, Xingyou Yang, Hongcheng Li, Rong Yin | Published: 2026-09-14
Indirect Prompt Injection
攻撃戦略分析
監査トレース

BlueSTAR: Tiered Agentic Architecture for Autonomous Cyber Defense

Authors: Simona Boboila, Xavier Cadet, Edward Koh, Daniel Balasubramanian, Dirk Van Bruggen, Peter Chin, Alina Oprea | Published: 2026-09-10
Cybersecurity
攻撃戦略分析
Evaluation Method

SpecGuard: Inference-Time Backdoor Detection For Free

Authors: Rui Wen, Ahmed Salem, Andrew Paverd, Mark Russinovich, Zheng Li | Published: 2026-09-10
Backdoor Detection
Detection of Poison Data for Backdoor Attacks
Evaluation Method

Predicting Privacy Leakage from Weight Spectral Density

Authors: Richard J. Preen, Jim Smith | Published: 2026-09-10
Membership Inference
Low-Cost Membership Inference Method
Evaluation Method

Differentially Private EEG Feature Anonymization: A Privacy-Utility Case Study in Clinical Neurophysiology

Authors: Noman Sadiq, Mohsen Toorani | Published: 2026-09-10
EEG Biometrics
Data Privacy Management
Differential Privacy

Deep-Fake CAPTCHA: Mitigating Next-Generation Social Engineering Attacks

Authors: Guy Frankovits, Lior Yasur, Fred M. Grabovski, Yisroel Mirsky | Published: 2026-09-10
Prompt leaking
Evaluation Method
Speech Signal Processing

FST Pay: Deterministic Safety-Gated Architecture for Youth Digital Payments

Authors: Shaikh Mohammed Burhan, Syed Farhaan Quadri, Tabassum Nahid Sultana | Published: 2026-09-10
監査トレース
Evaluation Method
金融安全性

ToxicRAG: Compromising Retrieval-Augmented Generation Systems via Single-Shot Knowledge Poisoning Attacks

Authors: Haozhe Lu, Jiaqi Li, Xinyuan Zhu, Xiang Li | Published: 2026-09-10
Poisoning attack on RAG
Data Origins and Evolution
攻撃戦略分析

The Agent Incident Registry: Toward Preventing Repeated AI Agent Failures

Authors: Divyanshu Kumar, Rohith HN, Nitin Aravind Birur, Sahil Agarwal, Prashanth Harshangi | Published: 2026-09-10
Indirect Prompt Injection
監査トレース
Evaluation Method