文献データベース

Chaining Skills to Hijack LLM Agents

Authors: Tian Dong, Zixuan Ma, Haodong Zhao, Huaien Zhang, Shaofeng Li, Hao Chen | Published: 2026-10-01
インダイレクトプロンプトインジェクション
攻撃の評価
防御戦略

False Floors: LLM Safety Routing Evaluations Break Under Distribution Shift

Authors: Amit Singh Bhatti, Vishal Vaddina | Published: 2026-10-01
攻撃の評価
評価結果
防御戦略

High-quality Data Do not Mean Safe! Poisoning LLMs after Data Selection

Authors: Kaiyang Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Tong Zhang, Bin Cai, Chunqiang Hu, Haibo Hu | Published: 2026-10-01
データセットの問題
出力の有害度の算出
安全性の整合性

Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models

Authors: Jianhong Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Oubo Ma, Zhou Feng, Hangtao Zhang, Jichao Bi, Chunqiang Hu | Published: 2026-10-01
データプライバシー管理
状態推定手法
評価結果

PACE: Provenance-Aware Capability Enforcement for Tool-Using LLM Agents

Authors: Fengpeng Li, Qizhou Wang, Yuke Hu, Kemou Li, Jun Liu, Haiwei Wu, Jiantao Zhou, Di Wang | Published: 2026-10-01
安全性の整合性
情報セキュリティ
状態遷移モデル

PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

Authors: Duong Hien Chi Kien, Thanh Trung Huynh | Published: 2026-10-01
深層強化学習
行動分析手法
金融サービスにおける生成AI

TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety

Authors: Fengpeng Li, Kemou Li, Qizhou Wang, Haiwei Wu, Jiantao Zhou, Di Wang | Published: 2026-10-01
不適切コンテンツ生成
安全性の整合性
攻撃の評価

Autonomous OSS Threat Detection via Taxonomy-Aligned LLMs

Authors: Md. Robiul Islam Niloy | Published: 2026-10-01
LLMの安全機構の解除
プロンプトリーキング
評価結果

Jev-IDS: System One Models for Network Intrusion Detection

Authors: Paulo Severo, Silvio E. Quincozes, Amanda Dias | Published: 2026-10-01
プロンプトインジェクション
検出手法の分析
流量分類手法

MOMAT: Mixture of Multiple Atlases for Low-Power Jailbreak Defense of Quantized LLMs

Authors: Boyang Li, Bingyu Shen, Weihao Hong, Zhiyuan Jiang, Xinlei Guan, Yan Ma, Miles Q. Li, Yi Sheng, Ruiyang Qin | Published: 2026-10-01
RAG
安全性の整合性
防御手法