Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents Authors: Paul Kassianik, Blaine Nelson, Yaron Singer | Published: 2026-07-16 コスト管理リソース消費分析攻撃検出手法 2026.07.16 文献データベース
When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space Authors: Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu | Published: 2026-07-16 データセットの影響モデル評価手法評価基準 2026.07.16 文献データベース
DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment Authors: Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren | Published: 2026-07-16 アライメントデータセットの影響リスク評価手法 2026.07.16 文献データベース
Random Logit Scaling: Defending Deep Neural Networks Against Black-Box Score-Based Adversarial Example Attacks Authors: Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh | Published: 2026-07-16 攻撃手法の説明敵対的学習脅威モデル 2026.07.16 文献データベース
Show Me How You Reason and I’ll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution Authors: Zlata Kikteva, Artur Romazanov, Annette Hautli-Janisz, Ramon Ruiz-Dolz | Published: 2026-07-16 AIによる出力の識別データセット分析著者貢献 2026.07.16 文献データベース
Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs Authors: Robert Graham, Edward Stevinson, Yariv Barsheshat | Published: 2026-07-16 インダイレクトプロンプトインジェクション倫理的考慮社会的影響 2026.07.16 文献データベース
Is External Database Protection Static in Retrieval-Augmented Generation? Rethinking Privacy Preservation under Dynamic Queries Authors: Gang Zhang, Mingyu Tian, Xukun Luan, Yuanchi Ma, Jinyan Liu | Published: 2026-07-16 RAGトレードオフ分析プライバシー保護手法 2026.07.16 文献データベース
Large Audio Language Models for Spoofing-Aware Speaker Verification Authors: Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir, Artem Dvirniak, Dmitrii Korzh, Oleg Y. Rogov | Published: 2026-07-16 AIによる出力のバイアスの検出SASV手法評価メトリクス 2026.07.16 文献データベース
MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents Authors: Jifeng Gao, Kang Xia, Yi Zhang, Xiaobin Hong, Mingkai Lin, Xingshen Wei, Wenzhong Li, Sanglu Lu | Published: 2026-07-16 インダイレクトプロンプトインジェクションメモリ腐敗の分類評価基準 2026.07.16 文献データベース
Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection Authors: Manuel Israel Cázares | Published: 2026-07-16 データセットの影響脆弱性予測評価基準 2026.07.16 文献データベース