InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models Authors: Chengyin Hu, Dingyi Lu, Jiaju Han, Xiang Chen, Weiwen Shi, Jiahuan Long, Yiwei Wei, Jiujiang Guo | Published: 2026-09-02 モデルの堅牢性攻撃手法の効果評価結果 2026.09.02 文献データベース
ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models Authors: Da Cheng Gu, Yifei Dong, Xinghao Yang, Yongshun Gong, Wei Liu | Published: 2026-09-02 プロンプトリーキングモデル抽出攻撃攻撃手法の効果 2026.09.02 文献データベース
WeaveMark: Robust and Scalable Multi-bit LLM Watermarking via Coded Payload Spreading Authors: Gang-Hyun Park, Ju-Hyeong Lee, Hee-Youl Kwak, Dae-Young Yun | Published: 2026-09-02 動的エラー訂正コード評価指標透かし除去技術 2026.09.02 文献データベース
FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs Authors: Zhengyi Jin, Ru Zhang, Xiao Chen, Xinbo Liu, Jiaxuan Lin, Jia Huang, Jianyi Liu, Zhen Yang | Published: 2026-09-02 サイバーセキュリティフレームワーク設計評価のバランス 2026.09.02 文献データベース
OBJECTION! Lawyer Agents Mitigate Guilty Bias in Legal Judgment Prediction Authors: Jaehoon Jeong, Jay-Yoon Lee | Published: 2026-09-02 判決の説明性対抗的エージェント法的判断バイアス 2026.09.02 文献データベース
C$^{3}$T: Counterfactual Causal Reasoning for Sentiment Shifts in Social-Media Conversation Trees Authors: S M Rafiuddin, Atriya Sen | Published: 2026-09-02 介入効果分析因果推論感情分析 2026.09.02 文献データベース
Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models Authors: Tianqi Xiao, Shiyao Cui, Minghao Zhang, Junxiao Yang, Renmiao Chen | Published: 2026-09-02 プロンプトリーキングモデルDoS拒否メカニズム 2026.09.02 文献データベース
When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning Authors: Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang | Published: 2026-09-01 モデルの頑健性保証知識分析防御手法の効果分析 2026.09.01 文献データベース
Position: Privacy Is a Claim, Not a Property of Synthetic Data Authors: Jiachen Zhao, Antonia Januszewicz, Taeho Jung | Published: 2026-09-01 データプライバシー管理メンバーシップ開示リスク知識分析 2026.09.01 文献データベース
Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents Authors: Liming Pu, Xiaoxia Li, Yifu Liu, Teng Cao, Bin Yang | Published: 2026-09-01 ポリシー最適化機械学習評価結果 2026.09.01 文献データベース