Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems Authors: Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao | Published: 2026-07-30 攻撃効果の評価評価手法透かし評価 2026.07.30 文献データベース
MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck Authors: Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li | Published: 2026-07-30 プロンプトリーキングメモリ防御問題毒データの検知 2026.07.30 文献データベース
Temporal Poisoning: Clean-Label Backdoors via Event Redistribution in SNNs Authors: Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta | Published: 2026-07-30 バックドア攻撃攻撃モデルの訓練毒データの検知 2026.07.30 文献データベース
Generalization and Trade-off in Adversarial Training: An RKHS Perspective via Kernel Integral Operators Authors: Yiling Xie, Xiaoming Huo | Published: 2026-07-30 性能評価指標敵対的学習正則化 2026.07.30 文献データベース
Driving up Inference Energy on SNNs: Per-Sample and Universal Sponge Attacks Authors: Spyridon Raptis, Haralampos-G. Stratigopoulos | Published: 2026-07-30 トリガーの検知性能評価指標脆弱性研究 2026.07.30 文献データベース
Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs Authors: Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu | Published: 2026-07-30 リスク評価信頼評価透かし評価 2026.07.30 文献データベース
One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs Authors: Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua | Published: 2026-07-30 プロンプトインジェクション倫理的考慮安全性調整手法 2026.07.30 文献データベース
A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models Authors: Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng | Published: 2026-07-30 モデル性能評価評価手法透かし評価 2026.07.30 文献データベース
Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration Authors: Xiangyu Yin, Jiaxu Liu, Zhen Chen, Chih-Hong Cheng | Published: 2026-07-30 AIシステムの関係性倫理的考慮透かし評価 2026.07.30 文献データベース
Robust Estimation of Sparse Numerical Vectors under Local Differential Privacy Authors: Puning Zhao, Zhikun Zhang, Shaowei Wang, Sheng Yue, Bangzhou Xin, Tianhang Zheng, Pengfei Zhang, Xiaochun Cao | Published: 2026-07-30 差分プライバシー攻撃効果の評価評価手法 2026.07.30 文献データベース