Large Language Model

HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models

Authors: Sidhant Narula, Javad Rafiei Asl, Mohammad Ghasemigol, Eduardo Blanco, Daniel Takabi | Published: 2025-10-21

Query Generation Method

Large Language Model

脱獄手法

2025.10.21 2025.10.23

Literature Database

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

Authors: Qilin Liao, Anamika Lochab, Ruqi Zhang | Published: 2025-10-20

Model DoS

Large Language Model

Untargeted Toxicity Attack

2025.10.20 2025.10.22

Literature Database

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

Authors: Xu Zhang, Hao Li, Zhichao Lu | Published: 2025-10-20

Query Generation Method

Prompt Injection

Large Language Model

2025.10.20 2025.10.22

Literature Database

SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models

Authors: Hanbin Hong, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Biying Liu, Ali Arastehfard, Heqing Huang, Yuan Hong | Published: 2025-10-17 | Updated: 2025-10-21

LLM Security

シナリオベースの悪用

Large Language Model

2025.10.17 2025.10.23

Literature Database

Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers

Authors: Andrew Zhao, Reshmi Ghosh, Vitor Carvalho, Emily Lawton, Keegan Hines, Gao Huang, Jack W. Stokes | Published: 2025-10-16

Prompt Injection

Prompt leaking

Large Language Model

2025.10.16 2025.10.18

Literature Database

Terrarium: Revisiting the Blackboard for Multi-Agent Safety, Privacy, and Security Studies

Authors: Mason Nakamura, Abhinav Kumar, Saaduddin Mahmud, Sahar Abdelnabi, Shlomo Zilberstein, Eugene Bagdasarian | Published: 2025-10-16

エージェント設計

Large Language Model

通信プロトコル

2025.10.16 2025.10.18

Literature Database

In-Browser LLM-Guided Fuzzing for Real-Time Prompt Injection Testing in Agentic AI Browsers

Authors: Avihay Cohen | Published: 2025-10-15

Indirect Prompt Injection

Large Language Model

自動生成フレームワーク

2025.10.15 2025.10.17

Literature Database

Who Speaks for the Trigger? Dynamic Expert Routing in Backdoored Mixture-of-Experts Transformers

Authors: Xin Zhao, Xiaojun Chen, Bingshan Liu, Haoyu Gao, Zhendong Zhao, Yilong Chen | Published: 2025-10-15

Backdoor Detection

Prompt leaking

Large Language Model

2025.10.15 2025.10.17

Literature Database

Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems

Authors: Jiaxin Gao, Chen Chen, Yanwen Jia, Xueluan Gong, Kwok-Yan Lam, Qian Wang | Published: 2025-10-14

Bias

Prompt leaking

Large Language Model

2025.10.14 2025.10.16

Literature Database

Traveling Salesman-Based Token Ordering Improves Stability in Homomorphically Encrypted Language Models

Authors: Donghwan Rho, Sieun Seo, Hyewon Sung, Chohong Min, Ernest K. Ryu | Published: 2025-10-14

Token Distribution Analysis

Membership Inference

Large Language Model

2025.10.14 2025.10.16

Literature Database