IF-GUIDE: Influence Function-Guided Detoxification of LLMs Authors: Zachary Coalson, Juhan Bae, Nicholas Carlini, Sanghyun Hong | Published: 2025-06-02 | Updated: 2025-06-09 テキストデトキシフィケーション倫理声明影響関数 2025.06.02 文献データベース
Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents Authors: Rongwu Xu, Xiaojian Li, Shuo Chen, Wei Xu | Published: 2025-02-17 | Updated: 2025-03-23 インダイレクトプロンプトインジェクション倫理声明意思決定ダイナミクス 2025.02.17 2025.04.03 文献データベース