AIセキュリティポータルbot

TOUR: A Trajectory-Level Unlearning Benchmark for Offline Reinforcement Learning

Authors: Chaofan Pan, Lingfei Ren, Xiangyu Jiang, Yanhua Li, Xuemei Cao, Xiangkun Wang, Hao Yu, Wei Wei, Xin Yang | Published: 2026-07-23
Dataset evaluation
攻撃手法の効果
文献レビュー

GuardianAgentBench: Where Agents Fail and How to Guard Them

Authors: Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad | Published: 2026-07-23
Indirect Prompt Injection
Task Design
Prompt Injection

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

Authors: Pengyu Zhu, Lijun Li, Longju Yang, Sen Su | Published: 2026-07-23
Task Design
データセットの問題
Detection of Misinformation

Beyond Heavy Log Curation: Perplexity-Based APT Detection via Unsupervised, Context-Augmented Language Models

Authors: Shoya Otsu, Kei Suzuki, Toshiaki Koike-Akino, Jing Liu, Ye Wang | Published: 2026-07-23
Dataset evaluation
Model Communication
Machine Learning

Generative AI floods and dilutes the market for books

Authors: Tuhin Chakrabarty, Xinyue Liu, Jane C. Ginsburg, Paramveer Dhillon | Published: 2026-07-22
データセットの問題
User Behavior Analysis
Statistical Analysis

The Ethics of Autonomous AI Agents for Offensive Security

Authors: Andreas Happe, Jürgen Cito, Jasmin Wachter | Published: 2026-07-22
Indirect Prompt Injection
倫理基準遵守
責任帰属システム設計

Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis

Authors: Adel ElZemity, Shujun Li, Budi Arief | Published: 2026-07-22
Prompt Injection
マルウェア可視化
Large Language Model

HijackKV: New Threat in Position-Independent KV Cache Reuse

Authors: Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang | Published: 2026-07-22
Poisoning attack on RAG
Dataset evaluation
攻撃手法の効果

Defense Against LLM Backdoors using Critical Neuron Isolation Pruning

Authors: Yuxi Li, Zhibo Zhang, Kailong Wang, Xingshuo Han, Ling Shi, Haoyu Wang | Published: 2026-07-22
Disabling Safety Mechanisms of LLM
Prompt leaking
Model Protection Methods

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

Authors: Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky | Published: 2026-07-22
Indirect Prompt Injection
攻撃手法の効果
Vulnerability Assessment Method