文献データベース

Finite-Sample Probabilistic Safety Certification for AI-Based Grid-Edge Coordination

Authors: Yihong Zhou, Hanbin Yang, Thomas Morstyn | Published: 2026-09-23
モデルの堅牢性
モデル評価手法
安全性調整手法

Your Model Is Leaking: Covert Information Transfer through LLM Residual Streams

Authors: Mingyuan Li, Yanna Jiang, Guangsheng Yu, Qin Wang, Xu Wang, Wei Ni, Ren Ping Liu | Published: 2026-09-23
モデル抽出攻撃
情報漏洩の原因
攻撃検出

A Bulletproof Business? Towards Detecting Infrastructure-as-a-Service Offerings on Telegram

Authors: Roy Ricaldi, Kristiyan Kyurkchiev, Irdin Pekaric | Published: 2026-09-23
Telegramにおけるサイバー犯罪
サイバー犯罪サービス
バックドアモデルの検知

Only Pay What You Must Spend: On-Demand Privacy Budget Payment for Differentially Private RAG

Authors: Zhonghao Sun, Zhiliang Tian, Xinyue Fang, Shuo Ma, Juhua Zhang, Yiping Song, Dongsheng Li | Published: 2026-09-23
RAG
プライバシー分析
差分プライバシー

Psychoacoustically Aligned Latent Smoothing for Adversarial Robustness of Full-Duplex Speech-to-Speech Dialogue Models

Authors: Kian Shamsaie, Iman Modarressi | Published: 2026-09-23
モデルDoS
モデルの堅牢性
敵対的攻撃

Automated Extraction of Records of Processing Activities (RoPA) Using Hybrid RAG and Locally Deployed Large Language Models

Authors: To Duy Hinh, Nguyen Le Quoc Anh, Phan Van Tri, Khuong Nguyen-An | Published: 2026-09-23
データセット分析
データ管理システム
情報抽出手法

Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning

Authors: Ruihan Wu, Rui Yang, Donggeon David Oh, Duy Nguyen, Haimin Hu | Published: 2026-09-23
ゲーム理論
ポリシーエンジニアリング
安全性と競争力

Multi-View Fusion for Encrypted C2 Detection: A Leakage-Controlled Measurement Study of Evaluation Pitfalls

Authors: Hoang-Huy Nguyen-Huu, Van-Tri Phan, Khuong Nguyen-An | Published: 2026-09-23
攻撃者のアプローチ
特徴選択手法
通信セキュリティ

CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments

Authors: Yuxuan Li, Will Epperson, Wesley Deng, Zezhou Huang | Published: 2026-09-23
バイアス
モデルの堅牢性
意思決定プロセスの分析

A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem

Authors: Laizhen Li, Xuan Wang, Peicheng Zhao, Juanjuan Zhao, Kejiang Ye, Cheng-zhong Xu, Xitong Gao | Published: 2026-09-22
システム設定
情報漏洩
攻撃戦略分析