文献データベース

Language Modeling is Monotone Compression

Authors: Noam Mazor, Andrew Morgan, Rafael Pass | Published: 2026-10-08
情報理論的アプローチ
深層学習
通信効率

NOMOS: Compiling Written Policies into Statically Verified Tool-Call Gates for LLM Agents

Authors: Min-Young Yu, Tony Kim, Jang Won Choi | Published: 2026-10-08
セキュリティ考慮
ルール検証
脆弱性評価手法

Open-MMUnlearning: Unifying Methods and Evaluation for MLLM Unlearning

Authors: Junkai Chen, Yuhao He, Qianshan Wei, Junxiang You, Jingwen Shao, Junkai Lin, Zhongkai Yue, Xiaotian Ye, Zhengbo Jiao, Jiali Cheng, Zhijie Deng, Kening Zheng, Ruiqi Liu, Hadi Amiri, Yi Yu, Zhenan Sun, Qi Li, Ka-Ho Chow, Sijia Liu, Liang Wang, Jiaqi Li, Shu Wu | Published: 2026-10-07
データセット評価
モデル性能評価
評価のバランス

SLDR: Defending Against Malicious Fine-tuning via Selective Layers Recovery and Dynamic Routing

Authors: Hui Zhang, Yachao Yuan, Jiayun Wang, Yuanzhuo Li, Hongtao Wang, Yali Yuan | Published: 2026-10-07
モデルDoS
倫理基準遵守
出力の有害度の算出

On the Reliability of LLM-Based Vulnerability Patching Benchmarks

Authors: Dang K Le, Wenxuan Shi, Xinyu Xing | Published: 2026-10-07
LLMの安全機構の解除
データセット評価
脆弱性評価手法

Beyond Reward Suppression: Near-Optimal Offline Attacks on Warm-Start Bandits with Bounded Rewards

Authors: Qirun Zeng, Manhin Poon, Xiangxiang Dai, Qixin Zhang, Jinhang Zuo | Published: 2026-10-07
攻撃シナリオ分析
最適化戦略
透かし攻撃

Constrained-Action AI Remediation for SIEM/XDR via a NeMo-Guardrails Proxy

Authors: Georgios Koutidis, Nikolaos Kekatos, Tom Nianios, Alexios Lekidis | Published: 2026-10-07
RAGへのポイズニング攻撃
ガードレール効果
セキュリティ考慮

Defensive Sufficiency in a Stackelberg Model of AI Security

Authors: Subhabrata Majumdar, Rajlakshmi Chavan | Published: 2026-10-07
攻撃シナリオ分析
最適化戦略
脆弱性評価手法

A Deafening Silence: Catastrophic Forgetting Lives in the Output Embeddings of Tokens the Data Never Speaks

Authors: Jonghyun Han, Younghoon Song, Jongyoul Park | Published: 2026-10-07
プロンプトリーキング
モデル性能評価
深層学習

Pareto-optimal quantum kernel selection for unsupervised anomaly detection on real malware beaconing data

Authors: Boaz Micah, Nadia Milazzo, Maissa Beji, Borja Aizpurua, Llorenç Espinosa-Portalés, Esteban Payares, Ghada Ben Slama, Luc Andrea, Michel Kurek, Thomas Cope, Olivier Salomon | Published: 2026-10-07
マルウェア検出シナリオ
モデル性能評価
量子機械学習