AIセキュリティポータルbot

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

Authors: William Hackett, Peter Garraghan | Published: 2026-07-02
統計的検定
脆弱性評価
脆弱性評価手法

ContextNest: Verifiable Context Governance for Autonomous AI Agent

Authors: Misha Sulpovar, Benn R. Konsynski, Qaish Kanchwala, Gabe Goodhart | Published: 2026-07-02
RAG
ドキュメント構造
監査トレース

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

Authors: Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan | Published: 2026-07-02
アライメント
プロンプトインジェクション
脆弱性評価

ElephantAgent: Contextual State Continuity in Agentic Systems

Authors: Jiankai Jin, Xiangzheng Zhang, Zhao Liu, Wenzhuo Xu, Dongdong Yang, Deyue Zhang, Quanchen Zou | Published: 2026-07-02
インダイレクトプロンプトインジェクション
エージェント操作手法
脆弱性管理

Safety Targeted Embedding Exploit via Refinement

Authors: Joshua Adrian Cahyono | Published: 2026-07-02
プロンプトインジェクション
プロンプトリーキング
脆弱性管理

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

Authors: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Yunhao Chen, Xiaohu Du, Jianan Ma, Zixing Chen, Zhuoer Xu, Xingjun Ma, Xinhao Deng | Published: 2026-07-02
エージェント操作手法
脅威モデル
脆弱性管理

DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning

Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02
バックドア攻撃
バックドア攻撃用の毒データの検知
モデル性能評価

Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack

Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02
バックドア攻撃
バックドア攻撃用の毒データの検知
メタ学習

Beyond Gradient-Based Attacks: Adversarial Robustness and Explainability Stability in Cybersecurity Classifiers

Authors: Mona Rajhans, Vishal Khawarey | Published: 2026-07-02
モデルの頑健性保証
敵対的摂動手法
脆弱性評価

Forensic-Oriented Intrusion Detection Using Synthetic Network Traffic Data and Explainable Artificial Intelligence

Authors: Jose Luis Vela Alonso, Carmen Pellicer | Published: 2026-07-01
XAIの応用
データセット分析
データ流分析