arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-02 至 2025-12-02 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 9 篇

2507.08068 2025-12-02 cs.LG 79%

Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions

分位数奖励策略优化:与点估计回归和精确分区函数对齐

Simon Matrenok, Skander Moalla, Caglar Gulcehre

机构 * CLAIRE, EPFL(CLAIRE,瑞士联邦理工学院)

专题命中 AI治理与伦理 :alignment(title);DPO(abstract);分类 cs.LG

AI总结 QRPO通过分位数奖励实现点绝对奖励学习,保留DPO的简单性和离线适用性,同时提升在聊天和编码任务中的性能。

Comments 58 pages, NeurIPS2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19362 2025-12-02 cs.CV cs.AI cs.CL cs.CY cs.LG 70%

LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences

LOTUS: 一种用于从质量到社会偏见和用户偏好的详细图像描述的排行榜

Yusuke Hirota, Boyi Li, Ryo Hachiuma, Yueh-Hua Wu, Boris Ivanovic, Yuta Nakashima, Marco Pavone, Yejin Choi, Yu-Chiang Frank Wang, Chao-Han Huck Yang

机构 * NVIDIA Research(NVIDIA研究)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 LOTUS是一种用于评估详细图像描述质量、偏见和社会偏见的排行榜,通过定制标准满足不同用户偏好,揭示了模型在不同评估标准上的表现差异。

Comments Accepted to ACL 2025. Leaderboard: huggingface.co/spaces/nvidia/lotus-vlm-bias-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00742 2025-12-02 cs.CY cs.AI 62%

On the Regulatory Potential of User Interfaces for AI Agent Governance

关于用户界面在AI代理治理中的调节潜力

K. J. Kevin Feng, Tae Soo Kim, Rock Yuren Pang, Faria Huq, Tal August, Amy X. Zhang

机构 * University of Washington(华盛顿大学) KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学香槟分校)

专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过调节AI代理的用户界面来增强透明性和行为规范,从而在系统和基础设施层面实现治理。

Comments RegML workshop at NeurIPS 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00461 2025-12-02 cs.CY cs.CL 62%

Whose Personae? Synthetic Persona Experiments in LLM Research and Pathways to Transparency

谁的人设?LLM研究中的人设实验及透明化路径

Jan Batzner, Volker Stocker, Bingjun Tang, Anusha Natarajan, Qinhao Chen, Stefan Schmid, Gjergji Kasneci

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨了LLM研究中合成人设实验的代表性与生态效度问题,提出透明化检查表以提升评估的严谨性和实证性。

Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, 343-354

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 57%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00410 2025-12-02 cs.RO cs.AI 57%

Balancing Efficiency and Fairness: An Iterative Exchange Framework for Multi-UAV Cooperative Path Planning

平衡效率与公平:多无人机协作路径规划的迭代交换框架

Hongzong Li, Luwei Liao, Xiangguang Dai, Yuming Feng, Rong Feng, Shiqin Tang

机构 * The Hong Kong University of Science and Technology(香港科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Computer Science and Engineering, Chongqing Three Gorges University(重庆三峡大学计算机科学与工程学院) Chinese Academy of Sciences, New Territories, Hong Kong(中国科学院香港新 Territories 分院) City University of Hong Kong, Kowloon, Hong Kong(香港城市大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出一种迭代交换框架,用于多无人机协作路径规划,通过任务交换和路径细化平衡效率与公平性,实验表明其在总距离和makespan之间取得更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09439 2025-12-02 cs.CY cs.SY eess.SY 57%

Towards Ethical AI in Power Electronics: How Engineering Practice and Roles Must Adapt

迈向电力电子中的伦理AI:工程实践和角色必须如何适应

Fanfan Lin, Peter Wilson, Xinze Li, Alan Mantooth

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨电力电子中AI伦理的重要性,提出四个核心伦理支柱,并呼吁工程师和IEEE推动伦理标准与人才发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01571 2025-12-02 cs.NI 50%

Velocity-Adaptive Access Scheme for Semantic-Aware Vehicular Networks: Joint Fairness and AoI Optimization

面向语义感知车联网的自适应接入方案:公平性与信息年龄优化的联合优化

Xiao Xu, Qiong Wu, Pingyi Fan, Kezhi Wang, Nan Cheng, Wen Chen, Khaled B. Letaief

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出一种面向语义感知车联网的自适应接入方案,通过联合优化公平性与信息年龄,利用顺序凸近似和大语言模型算法提升通信效率与安全性。

Comments This paper has been submitted to IEEE transactions on moblie computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00428 2025-12-02 cs.CV 50%

Recognizing Pneumonia in Real-World Chest X-rays with a Classifier Trained with Images Synthetically Generated by Nano Banana

用Nano Banana生成的合成图像训练分类器以在真实世界胸片中识别肺炎

Jiachuan Peng, Kyle Lam, Jianing Qiu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 利用Nano Banana生成的合成图像训练分类器,实现在真实世界胸片中识别肺炎,取得较高AUROC和AUPR,但存在提示设计和数据对齐的挑战。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏