Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring Authors: William Hackett, Peter Garraghan | Published: 2026-07-02 統計的検定脆弱性評価脆弱性評価手法 2026.07.02 文献データベース
ContextNest: Verifiable Context Governance for Autonomous AI Agent Authors: Misha Sulpovar, Benn R. Konsynski, Qaish Kanchwala, Gabe Goodhart | Published: 2026-07-02 RAGドキュメント構造監査トレース 2026.07.02 文献データベース
kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail Authors: Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan | Published: 2026-07-02 アライメントプロンプトインジェクション脆弱性評価 2026.07.02 文献データベース
ElephantAgent: Contextual State Continuity in Agentic Systems Authors: Jiankai Jin, Xiangzheng Zhang, Zhao Liu, Wenzhuo Xu, Dongdong Yang, Deyue Zhang, Quanchen Zou | Published: 2026-07-02 インダイレクトプロンプトインジェクションエージェント操作手法脆弱性管理 2026.07.02 文献データベース
Safety Targeted Embedding Exploit via Refinement Authors: Joshua Adrian Cahyono | Published: 2026-07-02 プロンプトインジェクションプロンプトリーキング脆弱性管理 2026.07.02 文献データベース
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification Authors: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Yunhao Chen, Xiaohu Du, Jianan Ma, Zixing Chen, Zhuoer Xu, Xingjun Ma, Xinhao Deng | Published: 2026-07-02 エージェント操作手法脅威モデル脆弱性管理 2026.07.02 文献データベース
DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02 バックドア攻撃バックドア攻撃用の毒データの検知モデル性能評価 2026.07.02 文献データベース
Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02 バックドア攻撃バックドア攻撃用の毒データの検知メタ学習 2026.07.02 文献データベース
Beyond Gradient-Based Attacks: Adversarial Robustness and Explainability Stability in Cybersecurity Classifiers Authors: Mona Rajhans, Vishal Khawarey | Published: 2026-07-02 モデルの頑健性保証敵対的摂動手法脆弱性評価 2026.07.02 文献データベース
Forensic-Oriented Intrusion Detection Using Synthetic Network Traffic Data and Explainable Artificial Intelligence Authors: Jose Luis Vela Alonso, Carmen Pellicer | Published: 2026-07-01 XAIの応用データセット分析データ流分析 2026.07.01 文献データベース