AIセキュリティポータルbot

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

Authors: Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu | Published: 2026-08-25
強化学習最適化
自律エージェントセキュリティ
防御手法

FraudBench: Protocol-Sensitive Benchmarking of Adversarial Robustness for Financial Risk Assessment

Authors: Xitong Zeng, Zhaoge Bi, Yitian Yang, Huaming Chen, Quan Z. Sheng | Published: 2026-08-25
攻撃手法
敵対的学習
金融詐欺検出

SeriCrypt: An LLM-Driven Context-Aware Serialization Framework for Cryptographic Protocols

Authors: Maosong Chen, Xi Chen, Mengcheng Ju, Dongliang Zhao, Chunxiang Gu | Published: 2026-08-25
セキュリティ考慮
プロンプトインジェクション
研究方法論

Defending Network Intrusion Detection Systems Based on Graph Neural Networks Against Structural Adversarial Attacks

Authors: Dimitri Galli, Andrea Venturi, Dario Stabili, Mauro Andreolini, Mirco Marchetti | Published: 2026-08-25
トリガーの検知
敵対的サンプルの検知
敵対的攻撃

Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs

Authors: Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu | Published: 2026-08-25
バックドアモデルの検知
攻撃手法
防御手法の効果分析

Towards LLM-Enhanced Android Taint Analysis

Authors: Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk | Published: 2026-08-25
LLMとの協力効果
信頼性分析
研究方法論

TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models

Authors: Zhenyu Wu, Siyuan Chen, Changchun Yang, Jiaqi Dong, Min Zhou, Ali Almadan, Talal Hammad, Faisal Wahbo, Aminullah Tora, Mona Alshahrani, Xin Gao | Published: 2026-08-25
ハルシネーション
モデルの解釈性
攻撃手法

AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval

Authors: Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra, Vignesh Divakaran | Published: 2026-08-25
人格多様性評価
信頼性分析
協力体制

Poisoning Agentic Alpha: Adversarial Vulnerabilities Across Roles and Architectures in Multi-Agent Trading Systems

Authors: CheolWon Na, Hao Ni, Lukasz Szpruch, Zhangyang Wang, Dhagash Mehta, Saurabh Nagrecha, Alejandro Lopez-Lira, Chanyeol Choi, Yongjae Lee, Jee-Hyong Lee | Published: 2026-08-25
インダイレクトプロンプトインジェクション
攻撃手法の効果
敵対的攻撃

What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions

Authors: Yichao Gao, Yumo Zhang, Yunhao Yao, Haohua Du, Puhan Luo, Ruiqi Li, Zhiqiang Wang | Published: 2026-08-25
モデルの解釈性
攻撃手法の効果
防御手法の統合