InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models Authors: Chengyin Hu, Dingyi Lu, Jiaju Han, Xiang Chen, Weiwen Shi, Jiahuan Long, Yiwei Wei, Jiujiang Guo | Published: 2026-09-02 Model Robustness攻撃手法の効果評価結果 2026.09.02 2026.09.04 Literature Database
ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models Authors: Da Cheng Gu, Yifei Dong, Xinghao Yang, Yongshun Gong, Wei Liu | Published: 2026-09-02 Prompt leakingModel Extraction Attack攻撃手法の効果 2026.09.02 2026.09.04 Literature Database
WeaveMark: Robust and Scalable Multi-bit LLM Watermarking via Coded Payload Spreading Authors: Gang-Hyun Park, Ju-Hyeong Lee, Hee-Youl Kwak, Dae-Young Yun | Published: 2026-09-02 Dynamic Error Correction Codeevaluation metricsWatermark Removal Technology 2026.09.02 2026.09.04 Literature Database
FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs Authors: Zhengyi Jin, Ru Zhang, Xiao Chen, Xinbo Liu, Jiaxuan Lin, Jia Huang, Jianyi Liu, Zhen Yang | Published: 2026-09-02 Cybersecurityフレームワーク設計評価のバランス 2026.09.02 2026.09.04 Literature Database
OBJECTION! Lawyer Agents Mitigate Guilty Bias in Legal Judgment Prediction Authors: Jaehoon Jeong, Jay-Yoon Lee | Published: 2026-09-02 判決の説明性対抗的エージェント法的判断バイアス 2026.09.02 2026.09.04 Literature Database
C$^{3}$T: Counterfactual Causal Reasoning for Sentiment Shifts in Social-Media Conversation Trees Authors: S M Rafiuddin, Atriya Sen | Published: 2026-09-02 介入効果分析因果推論Sentiment Analysis 2026.09.02 2026.09.04 Literature Database
Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models Authors: Tianqi Xiao, Shiyao Cui, Minghao Zhang, Junxiao Yang, Renmiao Chen | Published: 2026-09-02 Prompt leakingModel DoS拒否メカニズム 2026.09.02 2026.09.04 Literature Database
When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning Authors: Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang | Published: 2026-09-01 Certified Robustness知識分析Effectiveness Analysis of Defense Methods 2026.09.01 2026.09.03 Literature Database
Position: Privacy Is a Claim, Not a Property of Synthetic Data Authors: Jiachen Zhao, Antonia Januszewicz, Taeho Jung | Published: 2026-09-01 Data Privacy ManagementMembership Disclosure Risk知識分析 2026.09.01 2026.09.03 Literature Database
Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents Authors: Liming Pu, Xiaoxia Li, Yifu Liu, Teng Cao, Bin Yang | Published: 2026-09-01 ポリシー最適化Machine Learning評価結果 2026.09.01 2026.09.03 Literature Database