Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs Authors: Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu | Published: 2026-07-30 Risk AssessmentTrust EvaluationWatermark Evaluation 2026.07.30 2026.08.01 Literature Database
One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs Authors: Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua | Published: 2026-07-30 Prompt InjectionEthical Considerations安全性調整手法 2026.07.30 2026.08.01 Literature Database
A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models Authors: Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng | Published: 2026-07-30 Model Performance EvaluationEvaluation MethodWatermark Evaluation 2026.07.30 2026.08.01 Literature Database
Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration Authors: Xiangyu Yin, Jiaxu Liu, Zhen Chen, Chih-Hong Cheng | Published: 2026-07-30 Relationship of AI SystemsEthical ConsiderationsWatermark Evaluation 2026.07.30 2026.08.01 Literature Database
Robust Estimation of Sparse Numerical Vectors under Local Differential Privacy Authors: Puning Zhao, Zhikun Zhang, Shaowei Wang, Sheng Yue, Bangzhou Xin, Tianhang Zheng, Pengfei Zhang, Xiaochun Cao | Published: 2026-07-30 Differential Privacy攻撃効果の評価Evaluation Method 2026.07.30 2026.08.01 Literature Database
CHARGE: Leveraging CWE Hierarchies for Hardware Security SystemVerilog Assertion Generation Authors: Xiao Tan, Cynthia Sturton | Published: 2026-07-30 Vulnerability ManagementEvaluation MethodWatermark Evaluation 2026.07.30 2026.08.01 Literature Database
Revisiting the Adversarial Robustness of Graph-Based Traffic Forecasting Authors: Qingzhao Zhang | Published: 2026-07-30 PoisoningAdversarial LearningAdversarial Attack Assessment 2026.07.30 2026.08.01 Literature Database
On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment Authors: Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen | Published: 2026-07-29 Relationship of AI SystemsModel Performance EvaluationEthical Considerations 2026.07.29 2026.07.31 Literature Database
MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair Authors: Xuanze Chen, Xukang Xie, Wentao Fu, Jiajun Zhou, Shanqing Yu, Qi Xuan | Published: 2026-07-29 Content Specialized for Toxicity AttacksEvaluation MethodWatermark 2026.07.29 2026.07.31 Literature Database
AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents Authors: Ruoyu Wang, Heng Zhao, Renjie Wu, Mengnan Zhao, Zhixuan Chu, Wanyu Lin, Tianhang Zheng | Published: 2026-07-29 Ethical Considerations攻撃効果の評価Watermark Evaluation 2026.07.29 2026.07.31 Literature Database