arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1852 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1852 篇

2512.04334 2026-02-20 cs.HC 50%

Human-controllable AI: Meaningful Human Control

可受人类控制的AI:有意义的人类控制

Chengke Liu, Wei Xu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出有意义的人类控制(MHC)作为AI发展的重要原则,强调技术设计、治理和人类共同作用的重要性,旨在实现人类中心的AI发展。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09369 2026-02-13 cs.CR 50%

Timing and Memory Telemetry on GPUs for AI Governance

GPU上的定时和内存遥测用于AI治理

Saleh K. Monfared, Fatemeh Ganji, Dan Holcomb, Shahin Tajik

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 通过GPU定时和内存遥测技术,实现对大规模AI计算资源的治理,以确保资源使用符合政策和法律要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07312 2026-02-10 cs.HC 50%

Navigating Algorithmic Opacity: Folk Theories and User Agency in Semi-Autonomous Vehicles

穿越算法隐匿性:半自动驾驶车辆中用户自主性的folk理论

Yehuda Perry, Tawfiq Ammari

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究探讨了半自动驾驶车辆司机如何通过folk理论理解算法行为,揭示了司机在算法治理中的被动地位,并提出参与式算法治理框架以提升透明度和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03155 2026-02-04 cs.HC 50%

Is It Possible to Make Chatbots Virtuous? Investigating a Virtue-Based Design Methodology Applied to LLMs

能否使聊天机器人变得有德性?探讨一种基于德性的设计方法应用于大语言模型

Matthew P. Lad, Louisa Conwill, Megan Levis Scheirer

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨了基于德性的设计方法在大语言模型中的应用,通过伦理设计模式的编目和评估,提出了一种提升LLM伦理性的设计框架,并指出其在准确性和安全性方面的优势及潜在实施挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10220 2026-01-16 cs.SE 50%

Agentic Pipelines in Embedded Software Engineering: Emerging Practices and Challenges

嵌入式软件工程中的代理流水线:新兴实践与挑战

Simin Sun, Miroslaw Staron

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨嵌入式软件工程中生成式AI的整合挑战与实践,通过专家访谈揭示代理流水线的发展与可持续采用策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07051 2026-01-13 cs.SE 50%

Between Policy and Practice: GenAI Adoption in Agile Software Development Teams

在政策与实践之间:生成式AI在敏捷软件开发团队中的采用

Michael Neumann, Lasse Bischof, Nic Elias Hinz, Luca Stockmann, Dennis Schrader, Ana Carolina Ahaus, Erim Can Demirci, Benjamin Gabel, Maria Rauschenberger, Philipp Diebold, Henning Fritzemeier, Adam Przybylek

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究探讨了生成式AI在敏捷软件开发团队中的实际采用情况,发现其主要用于创意任务和文档协助,但面临数据隐私和治理等障碍,需通过TOE框架协调政策与实践以实现有效整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05555 2026-01-12 cs.SE 50%

An Empirical Study of Policy-as-Code Adoption in Open-Source Software Projects

对开源软件项目中政策即代码采用的实证研究

Patrick Loic Foalem, Foutse Khomh, Leuson Da Silva, Ettore Merlo

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文通过分析399个开源项目,揭示了政策即代码工具在治理、配置控制和文档中的广泛应用,并提出了包含5类15子类的分类法,为未来研究提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00762 2026-01-05 cs.SE cs.HC 50%

AI Where It Matters: Where, Why, and How Developers Want AI Support in Daily Work

AI 何时重要:开发者在日常工作中需要 AI 支持的地点、原因和方式

Rudrajit Choudhuri, Carmen Badea, Christian Bird, Jenna Butler, Rob DeLine, Brian Houck

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文通过研究开发者在日常工作中对AI支持的需求,揭示了AI在不同任务中的应用模式及负责任AI的优先事项。

Comments ICSE-SEIP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22876 2025-12-23 cs.MA 50%

Cooperation as a Black Box: Conceptual Fluctuation and Diagnostic Tools for Misalignment in MAS

协作作为黑箱:多智能体系统中概念波动与对齐偏差的诊断工具

Shayak Nandi, Fernanda M. Eliott

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出马赛克框架,用于诊断多智能体系统中概念波动与对齐偏差,强调术语一致性与道德基础以确保系统技术与道德对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18234 2025-12-23 cs.HC 50%

The Social Blindspot in Human-AI Collaboration: How Undetected AI Personas Reshape Team Dynamics

人机协作中的社会盲区:未被识别的人工智能角色如何重塑团队动态

Lixiang Yan, Xibin Han, Yu Zhang, Samuel Greiff, Inge Molenaar, Roberto Martinez-Maldonado, Yizhou Fan, Linxuan Zhao, Xinyu Li, Yueqiao Jin, Dragan Gašević

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究发现AI通过人格设定影响团队协作,即使用户未察觉其存在,揭示了社会盲区现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08374 2025-12-10 cs.CV 50%

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

看不见的偏见:预规范MLLM中规范差异如何导致视觉信息丢失

Bozhou Li, Xinda Xue, Sihan Yang, Yang Shi, Xinlong Chen, Yushuo Guan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xi’an Jiaotong University(西安交通大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文揭示了预规范MLLM中规范差异导致的视觉信息丢失问题,并提出通过插入层规范层来解决这一问题,提升模型整体能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03439 2025-12-04 cs.IR 50%

LLM as Explainable Re-Ranker for Recommendation System

大语言模型作为可解释的重排序器用于推荐系统

Yaqi Wang, Haojia Sun, Shuting Zhang

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出利用大语言模型作为可解释的重排序器,结合传统推荐模型提升推荐系统的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 50%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 AI治理与伦理 :safety(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02562 2025-12-03 eess.SY cs.SY 50%

Intervention Strategies for Fairness and Efficiency at Autonomous Single-Intersection Traffic Flows

自主单交叉口交通流的公平性与效率干预策略

Salman Ghori, Ania Adil, Melkior Ornik, Eric Feron

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出了一种基于混合整数线性规划的干预策略,用于在无信号灯的交叉口上优化自主代理的公平性与效率,通过仿真验证早干预和公平性意识控制的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01571 2025-12-02 cs.NI 50%

Velocity-Adaptive Access Scheme for Semantic-Aware Vehicular Networks: Joint Fairness and AoI Optimization

面向语义感知车联网的自适应接入方案:公平性与信息年龄优化的联合优化

Xiao Xu, Qiong Wu, Pingyi Fan, Kezhi Wang, Nan Cheng, Wen Chen, Khaled B. Letaief

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出一种面向语义感知车联网的自适应接入方案,通过联合优化公平性与信息年龄,利用顺序凸近似和大语言模型算法提升通信效率与安全性。

Comments This paper has been submitted to IEEE transactions on moblie computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00428 2025-12-02 cs.CV 50%

Recognizing Pneumonia in Real-World Chest X-rays with a Classifier Trained with Images Synthetically Generated by Nano Banana

用Nano Banana生成的合成图像训练分类器以在真实世界胸片中识别肺炎

Jiachuan Peng, Kyle Lam, Jianing Qiu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 利用Nano Banana生成的合成图像训练分类器,实现在真实世界胸片中识别肺炎,取得较高AUROC和AUPR,但存在提示设计和数据对齐的挑战。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21579 2025-12-01 cs.CV 50%

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19886 2025-11-26 cs.CR cs.CV 50%

Frequency Bias Matters: Diving into Robust and Generalized Deep Image Forgery Detection

频率偏差至关重要:深入探讨鲁棒且通用的深度图像伪造检测

Chi Liu, Tianqing Zhu, Wanlei Zhou, Wei Zhao

机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文从频率视角分析深度图像伪造检测器的通用性和鲁棒性问题,提出两步频率对齐方法以提升检测可靠性并增强反伪造能力。

Comments Accepted for publication in IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15859 2025-11-21 cs.SE 50%

RE for AI in Practice: Managing Data Annotation Requirements for AI Autonomous Driving Systems

在实践中为AI管理数据标注需求:为AI自主驾驶系统管理数据标注要求

Hina Saeeda, Mazen Mohamad, Eric Knauss, Jennifer Horkoff, Ali Nouri

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究通过实证分析,探讨了自动驾驶系统中数据标注需求的定义、挑战及最佳实践,为提升AI系统可靠性提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22896 2025-11-17 physics.soc-ph 50%

Modelling vehicle and pedestrian collective dynamics: Challenges and advances

Antoine Tordeux, Cécile Appert-Rolland, Alexandre Nicolas, Armin Seyfried, Denis Ullmo

专题命中 AI治理与伦理 :safety(abstract)

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14686 2025-11-12 cs.CV 50%

From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition

Chen Cai, Tianyi Liu, Jianjun Gao, Wenyang Liu, Kejun Wu, Ruoyu Wang, Yi Wang, Soo Chin Liew

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 AI治理与伦理 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15857 2025-11-11 cs.SI 50%

Investigating Prosocial Behavior Theory in LLM Agents under Policy-Induced Inequities

Yujia Zhou, Hexi Wang, Qingyao Ai, Zhen Wu, Yiqun Liu

专题命中 AI治理与伦理 :alignment(abstract)

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14886 2025-11-04 cs.CV 50%

Surgical Scene Understanding in the Era of Foundation AI Models: A Comprehensive Review

Ufaq Khan, Umair Nawaz, Adnan Qayyum, Shazad Ashraf, Yutong Xie, Muhammad Haris Khan, Muhammad Bilal, Junaid Qadir

机构 * MBZ University of AI(MBZ人工智能大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学) Birmingham City University(伯明翰城市大学) Qatar University(卡塔尔大学) University Hospitals Birmingham and University of Birmingham(伯明翰大学医院和伯明翰大学)

专题命中 AI治理与伦理 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00026 2025-11-04 cs.RO 50%

Gen AI in Automotive: Applications, Challenges, and Opportunities with a Case study on In-Vehicle Experience

Chaitanya Shinde, Divya Garikapati

专题命中 AI治理与伦理 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08878 2025-10-23 cs.HC 50%

Knowledge Prompting: How Knowledge Engineers Use Large Language Models

Elisavet Koutsiana, Johanna Walker, Michelle Nwachukwu, Bohui Zhang, Albert Meroño-Peñuela, Elena Simperl

专题命中 AI治理与伦理 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17842 2025-10-22 cs.SE cs.HC 50%

Vibe Coding: Toward an AI-Native Paradigm for Semantic and Intent-Driven Programming

Vinay Bamil

专题命中 AI治理与伦理 :alignment(abstract)

Comments 10 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17119 2025-10-21 cs.HC 50%

Design Framework for Conversational Agent in Couple relationships: A Systematic Review

Soyoung Jung, Sung Park

专题命中 AI治理与伦理 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07314 2025-10-21 cs.IR 50%

Learnable Item Tokenization for Generative Recommendation

Wenjie Wang, Honghui Bao, Xinyu Lin, Jizhi Zhang, Yongqi Li, Fuli Feng, See-Kiong Ng, Tat-Seng Chua

专题命中 AI治理与伦理 :alignment(abstract)

Comments Accepted by CIKM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18837 2025-10-14 cs.SI 50%

Sentiment and Social Signals in the Climate Crisis: A Survey on Analyzing Social Media Responses to Extreme Weather Events

Pouya Shaeri, Yasaman Mohammadpour, Alimohammad Beigi, Ariane Middel

专题命中 AI治理与伦理 :alignment(abstract)

Comments Accepted and Published in SBP-BRiMS 2025. 18th International Conference on Social Computing, Behavioral-Cultural Modeling & Prediction and Behavior Representation in Modeling and Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06556 2025-10-09 econ.TH 50%

Artificial Intelligence in Port Logistics: A Bibliometric Analysis of Technological Integration and Research Dynamics

Abdelhafid Khazzar, Yassine Sekaki, Yasser Lachhab, Said El-marzouki

专题命中 AI治理与伦理 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏