文献データベース

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

Authors: Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang | Published: 2026-05-27
LLMセキュリティ
プロンプトインジェクション
プロンプトリーキング

MRMMIA: Membership Inference Attacks on Memory in Chat Agents

Authors: Kai Chen, Yan Pang, Tianhao Wang | Published: 2026-05-27
データ抽出と分析
メモリ効率化手法
機械学習手法

Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

Authors: Xiang Fang, Wanlong Fang | Published: 2026-05-27
プロンプトインジェクション
プロンプトリーキング
著者貢献

Revisiting ML Training under Fully Homomorphic Encryption: Convergence Guarantees, Differential Privacy, and Efficient Algorithms

Authors: Yvonne Zhou, Mingyu Liang, Ivan Brugere, Danial Dervovic, Yue Guo, Antigoni Polychroniadou, Min Wu, Dana Dachman-Soled | Published: 2026-05-27
差分プライバシー
暗号化技術
機械学習手法

Detectability in Diversity: Improved Canary Crafting for Privacy Auditing in One Run

Authors: Mathieu Dagréou, Aurélien Bellet | Published: 2026-05-26
データ保護手法
著者貢献
選択手法

Privacy-Preserving Screening for Record Linkage

Authors: Chenyu Huang, Fan Zhang, Huangxun Chen, Yongjun Zhao, Huaming Rao, Peng Chen, Danqing Huang | Published: 2026-05-26
データ保護手法
プロトコル最適化
暗号技術

Cordyceps: Covert Control Attacks on LLMs via Data Poisoning

Authors: Zedian Shao, Charles Fleming, Teodora Baluta | Published: 2026-05-26
LLMの安全機構の解除
ロバスト性評価
透かしの耐久性

GradSentry: Gradient Spectral Entropy for Backdoor Sample Filtering in Large Language Model Fine-Tuning

Authors: Haodong Zhao, Tianyi Xu, Tianhang Zhao, Zhuosheng Zhang, Gongshen Liu | Published: 2026-05-26
データセット評価
バックドアモデルの検知
ロバスト性評価

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

Authors: Hwiwon Lee, Jiawei Liu, Dongjun Kim, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang | Published: 2026-05-26
データセット評価
モデルDoS
ロバスト性評価

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

Authors: Kevin Kuo, Chhavi Yadav, Virginia Smith | Published: 2026-05-26
LLMの安全機構の解除
ロバスト性評価
防御手法の統合