文献データベース

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

Authors: Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu | Published: 2026-08-26
大規模言語モデル
脆弱性評価手法
視覚的セマンティクス

MACGen: Toward Functionally Correct and Secure Code Generation via Multi-Agent Collaboration

Authors: Miseon Yu, Jaehoon Choi, Younghan Lee, Yunheung Paek | Published: 2026-08-26
システム開発
セキュリティ考慮
プロンプトインジェクション

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness

Authors: Yi Chen, Hanna Hsieh, Shuhong Liu, Chuanbo Hua, Zihan Ma, Kun Wang, Joo-Young Kim | Published: 2026-08-26
モデルの堅牢性
深層ネットワークの堅牢性
知識蒸留

Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks

Authors: Andrey Labunets | Published: 2026-08-26
ポイズニング
モデルの堅牢性
攻撃戦略分析

FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review

Authors: Suyang Zhong, Jingzhe Zhu, Qi Xu, Liyao Sun, Yin Wang, Qingqing Sun, Shuai Chen, Tianyi Zhang | Published: 2026-08-26
データセットの適用性
機械学習の応用
状態遷移モデル

LLMscope: Extracting LLM Assets from Edge AI Chips via Optical Probing

Authors: Dev Mehta, Lily Dukette, William Folan, Olivia Kochol, Noah Solomon, Shahin Tajik, Fatemeh Ganji | Published: 2026-08-26
インダイレクトプロンプトインジェクション
テストベッド
資産識別

Combining Self-Embedding Audio Watermarking with Ultra-Low-Bitrate Neural Codecs

Authors: Yigitcan Özer, Xin Wang, Zhe Zhang, Junichi Yamagishi | Published: 2026-08-26
信号解析
自己進化型フレームワーク
防御メカニズム

A Training-Free Proactive Defense Against Partial Speech Manipulation via Self-Embedding Steganography

Authors: Yigitcan Özer, Zhe Zhang, Wanying Ge, Xin Wang, Junichi Yamagishi | Published: 2026-08-26
信号解析
防御メカニズム
音声透かし技術

Prompt Structure Redistributes, Not Reduces: An Empirical Analysis of Security-Weaknesses in LLM-Generated Python Code

Authors: Maitreyee Das Urmi, Jessica Pourleyli, Fabio Santos, Glaucia Melo | Published: 2026-08-25
セキュリティ考慮
プロンプトインジェクション
プロンプトリーキング

Right Diagnoses, Decorative Reasoning:A Perturbation Audit of Medical Chain-of-Thought

Authors: Mengzhu Xu, Jifan Gao, Xia Jiang, Yaoxin Wu, Xi Long | Published: 2026-08-25
信頼性スコアリング
医療データの透かし設定
研究方法論