Literature Database

Privacy-Preserving and Verifiable Approximate Distributed Coded Computing

Authors: Xavier Martínez-Luaña, Alba Gude-Santos, Manuel Fernández-Veiga, Rebeca P. Díaz-Redondo | Published: 2026-07-02
Byzantine Attack Countermeasures
Differential Privacy
脆弱性評価

A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

Authors: Samiha A. Ismail, Fan X. Chen, Ali Merali | Published: 2026-07-02
Model Evaluation
Review and Investigation
医療診断属性

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

Authors: William Hackett, Peter Garraghan | Published: 2026-07-02
Statistical Testing
脆弱性評価
Vulnerability Assessment Method

ContextNest: Verifiable Context Governance for Autonomous AI Agent

Authors: Misha Sulpovar, Benn R. Konsynski, Qaish Kanchwala, Gabe Goodhart | Published: 2026-07-02
RAG
ドキュメント構造
監査トレース

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

Authors: Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan | Published: 2026-07-02
Alignment
Prompt Injection
脆弱性評価

ElephantAgent: Contextual State Continuity in Agentic Systems

Authors: Jiankai Jin, Xiangzheng Zhang, Zhao Liu, Wenzhuo Xu, Dongdong Yang, Deyue Zhang, Quanchen Zou | Published: 2026-07-02
Indirect Prompt Injection
エージェント操作手法
Vulnerability Management

Safety Targeted Embedding Exploit via Refinement

Authors: Joshua Adrian Cahyono | Published: 2026-07-02
Prompt Injection
Prompt leaking
Vulnerability Management

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

Authors: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Yunhao Chen, Xiaohu Du, Jianan Ma, Zixing Chen, Zhuoer Xu, Xingjun Ma, Xinhao Deng | Published: 2026-07-02
エージェント操作手法
Threat Model
Vulnerability Management

DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning

Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02
Backdoor Attack
Detection of Poison Data for Backdoor Attacks
Model Performance Evaluation

Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack

Authors: Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen | Published: 2026-07-02
Backdoor Attack
Detection of Poison Data for Backdoor Attacks
メタ学習