Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems Authors: Sergey Berezin, Reza Farahbakhsh, Noel Crespi | Published: 2024-09-27 | Updated: 2025-09-24 トークン圧縮フレームワークプロンプトリーキング自然言語処理 2024.09.27 文献データベース
Why Are My Prompts Leaked? Unraveling Prompt Extraction Threats in Customized Large Language Models Authors: Zi Liang, Haibo Hu, Qingqing Ye, Yaxin Xiao, Haoyang Li | Published: 2024-08-05 | Updated: 2025-02-12 プロンプトインジェクションプロンプトリーキングモデル評価 2024.08.05 2025.04.03 文献データベース
From Sands to Mansions: Towards Automated Cyberattack Emulation with Classical Planning and Large Language Models Authors: Lingzhi Wang, Zhenyuan Li, Yi Jiang, Zhengkai Wang, Zonghan Guo, Jiahui Wang, Yangyang Wei, Xiangmin Shen, Wei Ruan, Yan Chen | Published: 2024-07-24 | Updated: 2025-04-17 プロンプトリーキング攻撃アクションモデル攻撃検出手法 2024.07.24 文献データベース
ProxyGPT: Enabling User Anonymity in LLM Chatbots via (Un)Trustworthy Volunteer Proxies Authors: Dzung Pham, Jade Sheffey, Chau Minh Pham, Amir Houmansadr | Published: 2024-07-11 | Updated: 2025-06-11 プライバシー保護技術プロンプトインジェクションプロンプトリーキング 2024.07.11 文献データベース
Human-Imperceptible Retrieval Poisoning Attacks in LLM-Powered Applications Authors: Quan Zhang, Binqi Zeng, Chijin Zhou, Gwihwan Go, Heyuan Shi, Yu Jiang | Published: 2024-04-26 RAGへのポイズニング攻撃プロンプトリーキングポイズニング 2024.04.26 2025.04.03 文献データベース
Stealing Part of a Production Language Model Authors: Nicholas Carlini, Daniel Paleka, Krishnamurthy Dj Dvijotham, Thomas Steinke, Jonathan Hayase, A. Feder Cooper, Katherine Lee, Matthew Jagielski, Milad Nasr, Arthur Conmy, Itay Yona, Eric Wallace, David Rolnick, Florian Tramèr | Published: 2024-03-11 | Updated: 2024-07-09 プロンプトリーキングモデルの堅牢性モデル抽出攻撃 2024.03.11 2025.04.03 文献データベース
Secret Collusion among Generative AI Agents: Multi-Agent Deception via Steganography Authors: Sumeet Ramesh Motwani, Mikhail Baranchuk, Martin Strohmeier, Vijay Bolina, Philip H. S. Torr, Lewis Hammond, Christian Schroeder de Witt | Published: 2024-02-12 | Updated: 2025-04-14 プライバシー保護技術プロンプトリーキング生成AI向け電子透かし 2024.02.12 文献データベース
Language Model Inversion Authors: John X. Morris, Wenting Zhao, Justin T. Chiu, Vitaly Shmatikov, Alexander M. Rush | Published: 2023-11-22 プロンプトリーキングモデルインバージョンモデル評価 2023.11.22 2025.04.03 文献データベース
Assessing Prompt Injection Risks in 200+ Custom GPTs Authors: Jiahao Yu, Yuhang Wu, Dong Shu, Mingyu Jin, Sabrina Yang, Xinyu Xing | Published: 2023-11-20 | Updated: 2024-05-25 プロンプトインジェクションプロンプトリーキング対話システム 2023.11.20 2025.04.03 文献データベース
You Only Prompt Once: On the Capabilities of Prompt Learning on Large Language Models to Tackle Toxic Content Authors: Xinlei He, Savvas Zannettou, Yun Shen, Yang Zhang | Published: 2023-08-10 テキストデトキシフィケーションプロンプトリーキング出力の有害度の算出 2023.08.10 2025.04.03 文献データベース