Literature Database

InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models

Authors: Chengyin Hu, Dingyi Lu, Jiaju Han, Xiang Chen, Weiwen Shi, Jiahuan Long, Yiwei Wei, Jiujiang Guo | Published: 2026-09-02
Model Robustness
攻撃手法の効果
評価結果

ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models

Authors: Da Cheng Gu, Yifei Dong, Xinghao Yang, Yongshun Gong, Wei Liu | Published: 2026-09-02
Prompt leaking
Model Extraction Attack
攻撃手法の効果

WeaveMark: Robust and Scalable Multi-bit LLM Watermarking via Coded Payload Spreading

Authors: Gang-Hyun Park, Ju-Hyeong Lee, Hee-Youl Kwak, Dae-Young Yun | Published: 2026-09-02
Dynamic Error Correction Code
evaluation metrics
Watermark Removal Technology

FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs

Authors: Zhengyi Jin, Ru Zhang, Xiao Chen, Xinbo Liu, Jiaxuan Lin, Jia Huang, Jianyi Liu, Zhen Yang | Published: 2026-09-02
Cybersecurity
フレームワーク設計
評価のバランス

OBJECTION! Lawyer Agents Mitigate Guilty Bias in Legal Judgment Prediction

Authors: Jaehoon Jeong, Jay-Yoon Lee | Published: 2026-09-02
判決の説明性
対抗的エージェント
法的判断バイアス

C$^{3}$T: Counterfactual Causal Reasoning for Sentiment Shifts in Social-Media Conversation Trees

Authors: S M Rafiuddin, Atriya Sen | Published: 2026-09-02
介入効果分析
因果推論
Sentiment Analysis

Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models

Authors: Tianqi Xiao, Shiyao Cui, Minghao Zhang, Junxiao Yang, Renmiao Chen | Published: 2026-09-02
Prompt leaking
Model DoS
拒否メカニズム

When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning

Authors: Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang | Published: 2026-09-01
Certified Robustness
知識分析
Effectiveness Analysis of Defense Methods

Position: Privacy Is a Claim, Not a Property of Synthetic Data

Authors: Jiachen Zhao, Antonia Januszewicz, Taeho Jung | Published: 2026-09-01
Data Privacy Management
Membership Disclosure Risk
知識分析

Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents

Authors: Liming Pu, Xiaoxia Li, Yifu Liu, Teng Cao, Bin Yang | Published: 2026-09-01
ポリシー最適化
Machine Learning
評価結果