Chaining Skills to Hijack LLM Agents Authors: Tian Dong, Zixuan Ma, Haodong Zhao, Huaien Zhang, Shaofeng Li, Hao Chen | Published: 2026-10-01 インダイレクトプロンプトインジェクション攻撃の評価防御戦略 2026.10.01 文献データベース
False Floors: LLM Safety Routing Evaluations Break Under Distribution Shift Authors: Amit Singh Bhatti, Vishal Vaddina | Published: 2026-10-01 攻撃の評価評価結果防御戦略 2026.10.01 文献データベース
High-quality Data Do not Mean Safe! Poisoning LLMs after Data Selection Authors: Kaiyang Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Tong Zhang, Bin Cai, Chunqiang Hu, Haibo Hu | Published: 2026-10-01 データセットの問題出力の有害度の算出安全性の整合性 2026.10.01 文献データベース
Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models Authors: Jianhong Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Oubo Ma, Zhou Feng, Hangtao Zhang, Jichao Bi, Chunqiang Hu | Published: 2026-10-01 データプライバシー管理状態推定手法評価結果 2026.10.01 文献データベース
PACE: Provenance-Aware Capability Enforcement for Tool-Using LLM Agents Authors: Fengpeng Li, Qizhou Wang, Yuke Hu, Kemou Li, Jun Liu, Haiwei Wu, Jiantao Zhou, Di Wang | Published: 2026-10-01 安全性の整合性情報セキュリティ状態遷移モデル 2026.10.01 文献データベース
PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading Authors: Duong Hien Chi Kien, Thanh Trung Huynh | Published: 2026-10-01 深層強化学習行動分析手法金融サービスにおける生成AI 2026.10.01 文献データベース
TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety Authors: Fengpeng Li, Kemou Li, Qizhou Wang, Haiwei Wu, Jiantao Zhou, Di Wang | Published: 2026-10-01 不適切コンテンツ生成安全性の整合性攻撃の評価 2026.10.01 文献データベース
Autonomous OSS Threat Detection via Taxonomy-Aligned LLMs Authors: Md. Robiul Islam Niloy | Published: 2026-10-01 LLMの安全機構の解除プロンプトリーキング評価結果 2026.10.01 文献データベース
Jev-IDS: System One Models for Network Intrusion Detection Authors: Paulo Severo, Silvio E. Quincozes, Amanda Dias | Published: 2026-10-01 プロンプトインジェクション検出手法の分析流量分類手法 2026.10.01 文献データベース
MOMAT: Mixture of Multiple Atlases for Low-Power Jailbreak Defense of Quantized LLMs Authors: Boyang Li, Bingyu Shen, Weihao Hong, Zhiyuan Jiang, Xinlei Guan, Yan Ma, Miles Q. Li, Yi Sheng, Ruiyang Qin | Published: 2026-10-01 RAG安全性の整合性防御手法 2026.10.01 文献データベース