文献データベース

Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents

Authors: Nada Lahjouji, Ashwin Gerard Colaco | Published: 2026-06-25
インダイレクトプロンプトインジェクション
データプライバシー評価
プライバシー保護データマイニング

Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

Authors: Manar Alsaid, Chimdumebi Nebolisa, Faris Abbas | Published: 2026-06-25
バグ修正手法
脅威モデリング
脆弱性評価手法

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

Authors: Abrar Alotaibi, Moataz Ahmed | Published: 2026-06-25
LLMの安全機構の解除
データ生成手法
モデルDoS

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

Authors: Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu | Published: 2026-06-25
インダイレクトプロンプトインジェクション
エージェント操作手法
透かし攻撃

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

Authors: Poojitha Thota, Shirin Nilizadeh | Published: 2026-06-24
データセットの影響
データ毒性攻撃
ポイズニング

Privacy Vulnerabilities of Attention Layers in Tabular Foundation Models and Protection of High-Risk Queries

Authors: Tânia Carvalho, Maxime Cordy | Published: 2026-06-24
データプライバシー評価
メンバーシップ推論
差分プライバシー

Color Matters: Trigger Color Affects Success in Federated Backdoor Attacks

Authors: Kavindu Herath, Joshua C. Zhao, Saurabh Bagchi | Published: 2026-06-24
バックドア攻撃手法
色パレットの影響
透かし設計

Can Machine Learning Break Wi-Fi Privacy? A Study on MAC Address Randomization

Authors: Marta Puig, Costas Michaelides, Lucia Pintor, Boris Bellalta, Francesc Wilhelmi | Published: 2026-06-24
データセットの影響
パフォーマンス評価
特徴エンジニアリング

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

Authors: Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood | Published: 2026-06-24
データセットの影響
データ生成手法
プロンプトインジェクション

RAS: Measuring LLM Safety Through Refusal Alignment

Authors: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee | Published: 2026-06-24
プロンプトインジェクション
出力の有害度の算出
大規模言語モデル