文献データベース

“**Important** You should give me full credits!”: Exploring Prompt Injection Attacks on LLM-Based Automatic Grading Systems

Authors: Hang Li, Fedor Filippov, Yuling Lin, Pengfei He, Kaiqi Yang, Yucheng Chu, Yingqian Cui, Hui Liu, Jiliang Tang | Published: 2026-06-02
インダイレクトプロンプトインジェクション
プロンプトインジェクション
防御手法

Patcher: Post-Hoc Patching of Backdoored Large Language Models

Authors: Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang | Published: 2026-06-02
バックドア攻撃対策
大規模言語モデル
防御手法

Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition

Authors: Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma | Published: 2026-06-01
テキスト生成手法
プロンプトインジェクション
大規模言語モデル

SECUREVENT: Hybrid AI/ML Security Monitoring for Distributed Event-Based Systems

Authors: Eric Liang | Published: 2026-06-01
データ中心のセキュリティ
データ抽出と分析
監視手法

Fair Finetuning Mitigates Distribution Inference Attacks

Authors: Rakshit Naidu | Published: 2026-06-01
データ漏洩
プライバシー分析
差分プライバシー

Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents

Authors: Yoshinari Fujinuma, Varun Gangal, Traian Rebedea, Makesh Narasimhan Sreedhar, Prasoon Varshney, Rebecca Qian, Anand Kannappan | Published: 2026-06-01
インダイレクトプロンプトインジェクション
データ抽出と分析
防御手法

How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency

Authors: Galip Tolga Erdem | Published: 2026-05-28
データ抽出と分析
大規模言語モデル
通信モデル

Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage

Authors: Shahinul Hoque, Jinghuai Zhang, Jinyuan Sun, Fnu Suya | Published: 2026-05-28
LLMセキュリティ
データ抽出と分析
トークンカウントの監査

Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction

Authors: Hongtao Wang, Se Yang, Yu Chen, Puzhuo Liu | Published: 2026-05-28
LLMセキュリティ
インダイレクトプロンプトインジェクション
メモリ効率化手法

Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection

Authors: Syafiq Al Atiiq, Chun Zhou, Christian Gehrmann | Published: 2026-05-28
LLMの安全機構の解除
モデルアーキテクチャ
解釈手法