AIセキュリティポータルbot

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

Authors: William Hackett, Peter Garraghan | Published: 2026-07-02
Statistical Testing
脆弱性評価
Vulnerability Assessment Method

ContextNest: Verifiable Context Governance for Autonomous AI Agent

Authors: Misha Sulpovar, Benn R. Konsynski, Qaish Kanchwala, Gabe Goodhart | Published: 2026-07-02
RAG
ドキュメント構造
監査トレース

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

Authors: Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan | Published: 2026-07-02
Alignment
Prompt Injection
脆弱性評価

ElephantAgent: Contextual State Continuity in Agentic Systems

Authors: Jiankai Jin, Xiangzheng Zhang, Zhao Liu, Wenzhuo Xu, Dongdong Yang, Deyue Zhang, Quanchen Zou | Published: 2026-07-02
Indirect Prompt Injection
エージェント操作手法
Vulnerability Management

Safety Targeted Embedding Exploit via Refinement

Authors: Joshua Adrian Cahyono | Published: 2026-07-02
Prompt Injection
Prompt leaking
Vulnerability Management

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

Authors: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Yunhao Chen, Xiaohu Du, Jianan Ma, Zixing Chen, Zhuoer Xu, Xingjun Ma, Xinhao Deng | Published: 2026-07-02
エージェント操作手法
Threat Model
Vulnerability Management

DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning

Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02
Backdoor Attack
Detection of Poison Data for Backdoor Attacks
Model Performance Evaluation

Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack

Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02
Backdoor Attack
Detection of Poison Data for Backdoor Attacks
メタ学習

Beyond Gradient-Based Attacks: Adversarial Robustness and Explainability Stability in Cybersecurity Classifiers

Authors: Mona Rajhans, Vishal Khawarey | Published: 2026-07-02
Certified Robustness
Adversarial Perturbation Techniques
脆弱性評価

Forensic-Oriented Intrusion Detection Using Synthetic Network Traffic Data and Explainable Artificial Intelligence

Authors: Jose Luis Vela Alonso, Carmen Pellicer | Published: 2026-07-01
Application of XAI
Dataset Analysis
Data Flow Analysis