文献データベース

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

Authors: Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua | Published: 2026-07-30
プロンプトインジェクション
倫理的考慮
安全性調整手法

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

Authors: Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng | Published: 2026-07-30
モデル性能評価
評価手法
透かし評価

Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration

Authors: Xiangyu Yin, Jiaxu Liu, Zhen Chen, Chih-Hong Cheng | Published: 2026-07-30
AIシステムの関係性
倫理的考慮
透かし評価

Robust Estimation of Sparse Numerical Vectors under Local Differential Privacy

Authors: Puning Zhao, Zhikun Zhang, Shaowei Wang, Sheng Yue, Bangzhou Xin, Tianhang Zheng, Pengfei Zhang, Xiaochun Cao | Published: 2026-07-30
差分プライバシー
攻撃効果の評価
評価手法

CHARGE: Leveraging CWE Hierarchies for Hardware Security SystemVerilog Assertion Generation

Authors: Xiao Tan, Cynthia Sturton | Published: 2026-07-30
脆弱性管理
評価手法
透かし評価

Revisiting the Adversarial Robustness of Graph-Based Traffic Forecasting

Authors: Qingzhao Zhang | Published: 2026-07-30
ポイズニング
敵対的学習
敵対的攻撃評価

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

Authors: Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen | Published: 2026-07-29
AIシステムの関係性
モデル性能評価
倫理的考慮

MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair

Authors: Xuanze Chen, Xukang Xie, Wentao Fu, Jiajun Zhou, Shanqing Yu, Qi Xuan | Published: 2026-07-29
毒性攻撃に特化した内容
評価手法
透かし

AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents

Authors: Ruoyu Wang, Heng Zhao, Renjie Wu, Mengnan Zhao, Zhixuan Chu, Wanyu Lin, Tianhang Zheng | Published: 2026-07-29
倫理的考慮
攻撃効果の評価
透かし評価

Defending Against Backdoor Attacks via Alignment Checking in Model-Contrastive Federated Learning

Authors: Hongliang Zhang, Zhongyuan Yu, Guijuan Wang, Tianqing He, Wenshuo Ma, Xiaosong Zhang, Jiguo Yu | Published: 2026-07-29
トリガーの検知
バックドアモデルの検知
モデル性能評価