Literature Database

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

Authors: Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu | Published: 2026-07-30
Risk Assessment
Trust Evaluation
Watermark Evaluation

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

Authors: Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua | Published: 2026-07-30
Prompt Injection
Ethical Considerations
安全性調整手法

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

Authors: Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng | Published: 2026-07-30
Model Performance Evaluation
Evaluation Method
Watermark Evaluation

Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration

Authors: Xiangyu Yin, Jiaxu Liu, Zhen Chen, Chih-Hong Cheng | Published: 2026-07-30
Relationship of AI Systems
Ethical Considerations
Watermark Evaluation

Robust Estimation of Sparse Numerical Vectors under Local Differential Privacy

Authors: Puning Zhao, Zhikun Zhang, Shaowei Wang, Sheng Yue, Bangzhou Xin, Tianhang Zheng, Pengfei Zhang, Xiaochun Cao | Published: 2026-07-30
Differential Privacy
攻撃効果の評価
Evaluation Method

CHARGE: Leveraging CWE Hierarchies for Hardware Security SystemVerilog Assertion Generation

Authors: Xiao Tan, Cynthia Sturton | Published: 2026-07-30
Vulnerability Management
Evaluation Method
Watermark Evaluation

Revisiting the Adversarial Robustness of Graph-Based Traffic Forecasting

Authors: Qingzhao Zhang | Published: 2026-07-30
Poisoning
Adversarial Learning
Adversarial Attack Assessment

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

Authors: Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen | Published: 2026-07-29
Relationship of AI Systems
Model Performance Evaluation
Ethical Considerations

MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair

Authors: Xuanze Chen, Xukang Xie, Wentao Fu, Jiajun Zhou, Shanqing Yu, Qi Xuan | Published: 2026-07-29
Content Specialized for Toxicity Attacks
Evaluation Method
Watermark

AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents

Authors: Ruoyu Wang, Heng Zhao, Renjie Wu, Mengnan Zhao, Zhixuan Chu, Wanyu Lin, Tianhang Zheng | Published: 2026-07-29
Ethical Considerations
攻撃効果の評価
Watermark Evaluation