Literature Database

ToxScreen: Detecting Whether an LLM Has Been Poisoned

Authors: Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov | Published: 2026-07-29
Poisoning attack on RAG
Backdoor Detection
Content Specialized for Toxicity Attacks

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

Authors: Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang | Published: 2026-07-29
Prompt leaking
Risk Assessment
Early Detection Method

A First Look at Coding Agents’ Compliance with AI Contribution Rules in Open-Source Communities

Authors: Wenhao Yang, Runzhi He, Minghui Zhou | Published: 2026-07-29
Relationship of AI Systems
Risk Management
Compliance with Ethical Guidelines

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

Authors: Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu, Shuo Wang, Tao Lei, Xin Ouyang, Xiaomeng Li | Published: 2026-07-29
Risk Assessment
Vulnerability Management
Watermark

Physically Real-time Infrared Attack against Optical Flow Estimation Networks

Authors: Shen You, Wei Jiang, Jiarui Liu, Yijian Ye, Qiuzhen Lin, Xiangtao Li, Ka-Chun Wong | Published: 2026-07-29
Adversarial Attack Assessment
Physical Adversarial Attack
Watermark

FakeIDet3-DB: Refining Digital Attacks and Patch Extraction for Secure ID Benchmarking

Authors: Muñoz-Haro Javier, Teruel Andres, Tolosana Ruben, DeAlcala Daniel, Vera-Rodriguez Ruben, Morales Aythami, Fierrez Julian | Published: 2026-07-29
Dataset evaluation
Detection of Deepfakes
Watermark Evaluation

Borrowed Strength: Best-of-N Search over a Code EncodingBreaks Self-Check Jailbreak Defenses

Authors: Haoyu Zhang, Shibo Zheng, Xiangchen Guan, Zhuoxi Wang, Zijian Xiao, Mohammad Zandsalimy, Shanu Sushmita | Published: 2026-07-29
Large Language Model
攻撃効果の評価
Watermark Evaluation

Guarding Organizations Against Malware Risk: A Novel Graph-Based Malware Detection Method

Authors: Yinan Gao, Jiarong Xu, Xiaohang Zhao, Xiao Fang | Published: 2026-07-29
プログラムグラフ解析
Malware Classification
Model Architecture

Recover, Decode, Reguard: Guard-Agnostic Defense Amplification againstEncoded VLM Jailbreaks

Authors: Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Zijian Xiao, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita | Published: 2026-07-29
Prompt Injection
Large Language Model
Watermark Evaluation

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

Authors: Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu | Published: 2026-07-29
Relationship of AI Systems
Model Performance Evaluation
Ethical Considerations