StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing Authors: Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu | Published: 2026-08-25 Reinforcement Learning Optimization自律エージェントセキュリティDefense Method 2026.08.25 2026.08.27 Literature Database
FraudBench: Protocol-Sensitive Benchmarking of Adversarial Robustness for Financial Risk Assessment Authors: Xitong Zeng, Zhaoge Bi, Yitian Yang, Huaming Chen, Quan Z. Sheng | Published: 2026-08-25 Attack MethodAdversarial Learning金融詐欺検出 2026.08.25 2026.08.27 Literature Database
SeriCrypt: An LLM-Driven Context-Aware Serialization Framework for Cryptographic Protocols Authors: Maosong Chen, Xi Chen, Mengcheng Ju, Dongliang Zhao, Chunxiang Gu | Published: 2026-08-25 セキュリティ考慮Prompt InjectionResearch Methodology 2026.08.25 2026.08.27 Literature Database
Defending Network Intrusion Detection Systems Based on Graph Neural Networks Against Structural Adversarial Attacks Authors: Dimitri Galli, Andrea Venturi, Dario Stabili, Mauro Andreolini, Mirco Marchetti | Published: 2026-08-25 Trigger DetectionAdversarial Example DetectionAdversarial attack 2026.08.25 2026.08.27 Literature Database
Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs Authors: Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu | Published: 2026-08-25 Backdoor DetectionAttack MethodEffectiveness Analysis of Defense Methods 2026.08.25 2026.08.27 Literature Database
Towards LLM-Enhanced Android Taint Analysis Authors: Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk | Published: 2026-08-25 Cooperative Effects with LLMReliability AnalysisResearch Methodology 2026.08.25 2026.08.27 Literature Database
TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models Authors: Zhenyu Wu, Siyuan Chen, Changchun Yang, Jiaqi Dong, Min Zhou, Ali Almadan, Talal Hammad, Faisal Wahbo, Aminullah Tora, Mona Alshahrani, Xin Gao | Published: 2026-08-25 HallucinationModel InterpretabilityAttack Method 2026.08.25 2026.08.27 Literature Database
AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval Authors: Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra, Vignesh Divakaran | Published: 2026-08-25 人格多様性評価Reliability AnalysisCooperative System 2026.08.25 2026.08.27 Literature Database
Poisoning Agentic Alpha: Adversarial Vulnerabilities Across Roles and Architectures in Multi-Agent Trading Systems Authors: CheolWon Na, Hao Ni, Lukasz Szpruch, Zhangyang Wang, Dhagash Mehta, Saurabh Nagrecha, Alejandro Lopez-Lira, Chanyeol Choi, Yongjae Lee, Jee-Hyong Lee | Published: 2026-08-25 Indirect Prompt Injection攻撃手法の効果Adversarial attack 2026.08.25 2026.08.27 Literature Database
What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions Authors: Yichao Gao, Yumo Zhang, Yunhao Yao, Haohua Du, Puhan Luo, Ruiqi Li, Zhiqiang Wang | Published: 2026-08-25 Model Interpretability攻撃手法の効果防御手法の統合 2026.08.25 2026.08.27 Literature Database