SecAlign: Defending Against Prompt Injection with Preference Optimization Authors: Sizhe Chen, Arman Zharmagambetov, Saeed Mahloujifar, Kamalika Chaudhuri, David Wagner, Chuan Guo | Published: 2024-10-07 | Updated: 2025-01-13 LLMセキュリティプロンプトインジェクション防御手法 2024.10.07 2025.04.03 文献データベース
Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion Authors: Guanchu Wang, Yu-Neng Chuang, Ruixiang Tang, Shaochen Zhong, Jiayi Yuan, Hongye Jin, Zirui Liu, Vipin Chaudhary, Shuai Xu, James Caverlee, Xia Hu | Published: 2024-10-06 LLMセキュリティ暗号技術 2024.10.06 2025.04.03 文献データベース
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models Authors: Yiting Dong, Guobin Shen, Dongcheng Zhao, Xiang He, Yi Zeng | Published: 2024-10-05 LLMセキュリティプロンプトインジェクション攻撃手法 2024.10.05 2025.04.03 文献データベース
Towards Assuring EU AI Act Compliance and Adversarial Robustness of LLMs Authors: Tomas Bueno Momcilovic, Beat Buesser, Giulio Zizzo, Mark Purcell, Dian Balta | Published: 2024-10-04 AIコンプライアンスLLMセキュリティフレームワーク 2024.10.04 2025.04.03 文献データベース
Developing Assurance Cases for Adversarial Robustness and Regulatory Compliance in LLMs Authors: Tomas Bueno Momcilovic, Dian Balta, Beat Buesser, Giulio Zizzo, Mark Purcell | Published: 2024-10-04 LLMセキュリティプロンプトインジェクション動的脆弱性管理 2024.10.04 2025.04.03 文献データベース
Optimizing Adaptive Attacks against Content Watermarks for Language Models Authors: Abdulrahman Diaa, Toluwani Aremu, Nils Lukas | Published: 2024-10-03 LLMセキュリティウォーターマーキングプロンプトインジェクション 2024.10.03 2025.04.03 文献データベース
System-Level Defense against Indirect Prompt Injection Attacks: An Information Flow Control Perspective Authors: Fangzhou Wu, Ethan Cecchetti, Chaowei Xiao | Published: 2024-09-27 | Updated: 2024-10-10 LLMセキュリティプロンプトインジェクション実行トレースの妨害 2024.09.27 2025.04.03 文献データベース
Multi-Designated Detector Watermarking for Language Models Authors: Zhengan Huang, Gongxian Zeng, Xin Mu, Yu Wang, Yue Yu | Published: 2024-09-26 | Updated: 2024-10-01 LLMセキュリティウォーターマーキング透かし評価 2024.09.26 2025.04.03 文献データベース
Order of Magnitude Speedups for LLM Membership Inference Authors: Rongting Zhang, Martin Bertran, Aaron Roth | Published: 2024-09-22 | Updated: 2024-09-24 LLMセキュリティメンバーシップ推論低コストのメンバシップ推論手法 2024.09.22 2025.04.03 文献データベース
FP-VEC: Fingerprinting Large Language Models via Efficient Vector Addition Authors: Zhenhua Xu, Wenpeng Xing, Zhebo Wang, Chang Hu, Chen Jie, Meng Han | Published: 2024-09-13 LLMセキュリティフィンガープリンティング手法モデル性能評価 2024.09.13 2025.04.03 文献データベース