StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing Authors: Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu | Published: 2026-08-25 強化学習最適化自律エージェントセキュリティ防御手法 2026.08.25 文献データベース
FraudBench: Protocol-Sensitive Benchmarking of Adversarial Robustness for Financial Risk Assessment Authors: Xitong Zeng, Zhaoge Bi, Yitian Yang, Huaming Chen, Quan Z. Sheng | Published: 2026-08-25 攻撃手法敵対的学習金融詐欺検出 2026.08.25 文献データベース
SeriCrypt: An LLM-Driven Context-Aware Serialization Framework for Cryptographic Protocols Authors: Maosong Chen, Xi Chen, Mengcheng Ju, Dongliang Zhao, Chunxiang Gu | Published: 2026-08-25 セキュリティ考慮プロンプトインジェクション研究方法論 2026.08.25 文献データベース
Defending Network Intrusion Detection Systems Based on Graph Neural Networks Against Structural Adversarial Attacks Authors: Dimitri Galli, Andrea Venturi, Dario Stabili, Mauro Andreolini, Mirco Marchetti | Published: 2026-08-25 トリガーの検知敵対的サンプルの検知敵対的攻撃 2026.08.25 文献データベース
Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs Authors: Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu | Published: 2026-08-25 バックドアモデルの検知攻撃手法防御手法の効果分析 2026.08.25 文献データベース
Towards LLM-Enhanced Android Taint Analysis Authors: Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk | Published: 2026-08-25 LLMとの協力効果信頼性分析研究方法論 2026.08.25 文献データベース
TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models Authors: Zhenyu Wu, Siyuan Chen, Changchun Yang, Jiaqi Dong, Min Zhou, Ali Almadan, Talal Hammad, Faisal Wahbo, Aminullah Tora, Mona Alshahrani, Xin Gao | Published: 2026-08-25 ハルシネーションモデルの解釈性攻撃手法 2026.08.25 文献データベース
AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval Authors: Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra, Vignesh Divakaran | Published: 2026-08-25 人格多様性評価信頼性分析協力体制 2026.08.25 文献データベース
Poisoning Agentic Alpha: Adversarial Vulnerabilities Across Roles and Architectures in Multi-Agent Trading Systems Authors: CheolWon Na, Hao Ni, Lukasz Szpruch, Zhangyang Wang, Dhagash Mehta, Saurabh Nagrecha, Alejandro Lopez-Lira, Chanyeol Choi, Yongjae Lee, Jee-Hyong Lee | Published: 2026-08-25 インダイレクトプロンプトインジェクション攻撃手法の効果敵対的攻撃 2026.08.25 文献データベース
What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions Authors: Yichao Gao, Yumo Zhang, Yunhao Yao, Haohua Du, Puhan Luo, Ruiqi Li, Zhiqiang Wang | Published: 2026-08-25 モデルの解釈性攻撃手法の効果防御手法の統合 2026.08.25 文献データベース