AIセキュリティポータルbot

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

Authors: Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao | Published: 2026-07-30
攻撃効果の評価
評価手法
透かし評価

MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

Authors: Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li | Published: 2026-07-30
プロンプトリーキング
メモリ防御問題
毒データの検知

Temporal Poisoning: Clean-Label Backdoors via Event Redistribution in SNNs

Authors: Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta | Published: 2026-07-30
バックドア攻撃
攻撃モデルの訓練
毒データの検知

Generalization and Trade-off in Adversarial Training: An RKHS Perspective via Kernel Integral Operators

Authors: Yiling Xie, Xiaoming Huo | Published: 2026-07-30
性能評価指標
敵対的学習
正則化

Driving up Inference Energy on SNNs: Per-Sample and Universal Sponge Attacks

Authors: Spyridon Raptis, Haralampos-G. Stratigopoulos | Published: 2026-07-30
トリガーの検知
性能評価指標
脆弱性研究

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

Authors: Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu | Published: 2026-07-30
リスク評価
信頼評価
透かし評価

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

Authors: Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua | Published: 2026-07-30
プロンプトインジェクション
倫理的考慮
安全性調整手法

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

Authors: Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng | Published: 2026-07-30
モデル性能評価
評価手法
透かし評価

Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration

Authors: Xiangyu Yin, Jiaxu Liu, Zhen Chen, Chih-Hong Cheng | Published: 2026-07-30
AIシステムの関係性
倫理的考慮
透かし評価

Robust Estimation of Sparse Numerical Vectors under Local Differential Privacy

Authors: Puning Zhao, Zhikun Zhang, Shaowei Wang, Sheng Yue, Bangzhou Xin, Tianhang Zheng, Pengfei Zhang, Xiaochun Cao | Published: 2026-07-30
差分プライバシー
攻撃効果の評価
評価手法