arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1852 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1852 篇

2512.23430 2025-12-30 cs.CL 57%

C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMs

C2PO:诊断和解构大语言模型中的偏见捷径

Xuan Feng, Bo An, Tianlong Gu, Liang Chang, Fengrui Hao, Peipeng Yu, Shuai Zhao

机构 * Jinan University(济南大学) Nanyang Technological University(南洋理工大学) Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心) Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 C2PO通过因果对比偏好优化框架,解决大语言模型中的偏见问题,同时保持推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21699 2025-12-29 cs.AI 57%

Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning

迈向负责任和可解释的AI代理:基于共识驱动的推理

Eranga Bandara, Tharaka Hewa, Ross Gore, Sachin Shetty, Ravi Mukkamala, Peter Foytik, Abdul Rahman, Safdar H. Bouk, Xueping Liang, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Florida International University, USA(佛罗里达国际大学) Nanyang Technological University, Singapore(南洋理工大学) University of Colombo, Sri Lanka(科伦坡大学) Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04489 2025-12-29 cs.CY 57%

The Decision Path to Control AI Risks Completely: Fundamental Control Mechanisms for AI Governance

完全控制AI风险的决策路径:AI治理的基本控制机制

Yong Tao

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出通过五支柱和六种控制机制,构建AI治理架构,以全面控制AI风险并减少潜在威胁。

Comments Added 1 paragraph to Ackowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19950 2025-12-24 cs.CL cs.HC 57%

Bias Beneath the Tone: Empirical Characterisation of Tone Bias in LLM-Driven UX Systems

音调下的偏见:LLM驱动的UX系统中音调偏见的实证刻画

Heet Bodara, Md Masum Mushfiq, Isma Farah Siddiqui

机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL

AI总结 本文研究了LLM驱动UX系统中的音调偏见问题,通过合成数据集和弱监督方法,揭示了模型在对话中存在系统性的音调偏差,为设计公平可信的对话AI提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17180 2025-12-24 cs.RO cs.AI 57%

Conservative Bias in Multi-Teacher Learning: Why Agents Prefer Low-Reward Advisors

多教师学习中的保守偏见:为什么智能体更偏好低奖励顾问

Maher Mesto, Francisco Cruz

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Escuela de Ingeniería, Universidad Central de Chile(智利中央大学工程学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文揭示了多教师学习中智能体偏好保守低奖励顾问的现象,发现其受保守偏见主导,并在特定阈值下失效,同时在概念漂移情况下显著优于基线Q学习。

Comments 10 pages, 5 figures. Accepted at ACRA 2025 (Australasian Conference on Robotics and Automation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16873 2025-12-19 cs.AI 57%

The Social Responsibility Stack: A Control-Theoretic Architecture for Governing Socio-Technical AI

社会责任栈:一种基于控制理论的治理社会技术AI的架构

Otman A. Basir

机构 * Department of Electrical and Computer Engineering University of Waterloo(电气与计算机工程系滑铁卢大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出社会责任栈架构,通过控制理论将社会价值观嵌入AI系统,实现责任闭环控制,提升AI系统的可问责性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16532 2025-12-19 cs.AI cs.IR 57%

From Personalization to Prejudice: Bias and Discrimination in Memory-Enhanced AI Agents for Recruitment

从个性化到偏见:记忆增强型AI招聘代理中的偏见与歧视

Himanshu Gharat, Himanshi Agrawal, Gourab K. Patro

机构 * Phi Labs, Quantiphi Inc.(Phi实验室、Quantiphi公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究揭示了记忆增强型AI招聘代理中偏见的系统性引入与强化,强调了对LLM基础AI代理的额外防护措施的必要性。

Comments In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26)

Journal ref In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26), 2026, Boise, ID, USA. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16408 2025-12-19 cs.LG cs.MA 57%

NDRL: Cotton Irrigation and Nitrogen Application with Nested Dual-Agent Reinforcement Learning

NDRL:基于嵌套双智能体强化学习的棉花灌溉与氮肥施用

Ruifeng Xu, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Xinjiang Key Laboratory of Signal Detection and Processing(新疆信号检测与处理重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 NDRL通过嵌套双智能体强化学习优化棉花灌溉与氮肥施用,提升产量和资源利用效率。

Comments Accepted by ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17361 2025-12-19 cs.LG cs.CR 57%

Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias

相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持

Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schonherr, Yisroel Mirsky

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。

Journal ref The Network and Distributed System Security Symposium (NDSS). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20764 2025-12-18 cs.CL 57%

Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions

感知差异?真实与LLM生成CBT对话中情感弧的比较分析

Xiaoyi Wang, Jiwei Zhang, Guangtao Zhang, Honglei Guo

机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。

Comments Accepted at 2025 EMNLP findings,19 page,2 figures

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13739 2025-12-17 cs.CV cs.AI 57%

Human-AI Collaboration Mechanism Study on AIGC Assisted Image Production for Special Coverage

面向特殊报道的AIGC辅助图像生成中的人机协作机制研究

Yajie Yang, Yuqing Zhao, Xiaochao Xi, Yinan Zhu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种人机协作机制,用于在特殊报道中通过AIGC辅助图像生成,结合高精度分割、语义对齐和风格调节技术,确保内容准确性和可验证性。

Comments AAAI-AISI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13699 2025-12-17 cs.CY 57%

Us-vs-Them bias in Large Language Models

大语言模型中的‘我们 vs 他们’偏见

Tabia Tanzin Prama, Julia Witte Zimmerman, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY

AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12652 2025-12-16 cs.AI cs.MA 57%

Value-Aware Multiagent Systems

具有价值意识的多智能体系统

Nardine Osman

机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究 institute (IIIA-CSIC))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种具有价值意识的多智能体系统框架,通过三个核心支柱实现价值对齐和行为可解释性,并展示了其在现实领域的应用。

Journal ref In Coordination, Organizations, Institutions, Norms, and Ethics for Governance of Multi-Agent Systems XVII. COINE 2024. LNCS, vol 15398. Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12501 2025-12-16 cs.AI 57%

SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation

SafeGen: 在文本到图像生成中嵌入伦理保障

Dang Phuong Nam, Nguyen Kieu, Pham Thanh Hieu

机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08981 2025-12-11 cs.CV cs.AI 57%

Mitigating Bias with Words: Inducing Demographic Ambiguity in Face Recognition Templates by Text Encoding

通过词语缓解偏见:通过文本编码在人脸识别模板中诱导人口统计学模糊性

Tahar Chettaoui, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫研究所(IGD)) TU Darmstadt(德累斯顿技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 通过引入文本编码,UTIE在人脸识别模板中诱导人口统计学模糊性,以减少偏见并提升验证性能。

Comments Accepted at BMVC workshop (SRBS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06616 2025-12-10 cs.HC cs.AI 57%

Memory Power Asymmetry in Human-AI Relationships: Preserving Mutual Forgetting in the Digital Age

人机关系中的记忆权力不对称:在数字时代保持相互遗忘

Rasam Dorri, Rami Zwick

机构 * School of Business, University of California, Riverside(加州大学河滨分校商学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出记忆权力不对称概念,探讨人机关系中因记忆能力差异导致的权力失衡,并提出六个恢复健康记忆平衡的设计原则。

Comments 31 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07909 2025-12-10 cs.CR cs.CY 57%

Agentic Artificial Intelligence for Ethical Cybersecurity in Uganda: A Reinforcement Learning Framework for Threat Detection in Resource-Constrained Environments

代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测

Ibrahim Adabara, Bashir Olaniyi Sadiq, Aliyu Nuhu Shuaibu, Yale Ibrahim Danjuma, Venkateswarlu Maninti, Mutebi Joe

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。

Comments 29 pages, 7 figures, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 57%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12758 2025-12-09 cs.CL 57%

Democratic or Authoritarian? Probing a New Dimension of Political Biases in Large Language Models

民主或威权?探讨大型语言模型中政治偏见的新维度

David Guzman Piedrahita, Irene Strauss, Bernhard Schölkopf, Rada Mihalcea, Zhijing Jin

机构 * University of Zürich(苏黎世大学) ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统研究所) University of Michigan(密歇根大学) University of Toronto(多伦多大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型在民主与威权政治偏见方面的表现,通过引入F-scale、FavScore和角色模型探测方法,揭示了模型在不同语言提示下对民主与威权倾向性的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04408 2025-12-05 cs.AI 57%

Executable Governance for AI: Translating Policies into Rules Using LLMs

可执行治理 for AI:利用 LLMs 将政策翻译成规则

Gautam Varma Datla, Anudeep Vurity, Tejaswani Dash, Tazeem Ahmad, Mohd Adnan, Saima Rafi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。

Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04232 2025-12-05 q-bio.PE cs.CY 57%

Decentralized Social Media and Artificial Intelligence in Digital Public Health Monitoring

去中心化的社交媒体与人工智能在数字公共卫生监测中的应用

Marcel Salathé, Sharada P. Mohanty

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文探讨了去中心化社交媒体与人工智能在数字公共卫生监测中的应用,分析了数据获取与AI技术之间的矛盾,并提出了适应性策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15478 2025-12-04 cs.CL 57%

A Group Fairness Lens for Large Language Models

为大语言模型引入群体公平性视角

Guanqun Bi, Yuqiang Xie, Lei Shen, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文提出从群体公平性角度评估大语言模型的偏见,引入 GFAIR 数据集和 GF-THINK 方法,以缓解模型中的偏见问题。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02508 2025-12-03 cs.LG 57%

Water Quality Estimation Through Machine Learning Multivariate Analysis

通过机器学习多变量分析估计水质

Marco Cardia, Stefano Chessa, Alessio Micheli, Antonella Giuliana Luminare, Francesca Gambineri

机构 * University of Pisa(比萨大学) ARCHA S.R.L.(ARCHA公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文通过结合紫外-可见光谱与机器学习,提出了一种用于水质评估的多变量分析方法,以实现快速、准确且可解释的水质参数检测。

Comments The paper has been accepted at Italian Workshop on Neural Networks (WIRN) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 57%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00410 2025-12-02 cs.RO cs.AI 57%

Balancing Efficiency and Fairness: An Iterative Exchange Framework for Multi-UAV Cooperative Path Planning

平衡效率与公平:多无人机协作路径规划的迭代交换框架

Hongzong Li, Luwei Liao, Xiangguang Dai, Yuming Feng, Rong Feng, Shiqin Tang

机构 * The Hong Kong University of Science and Technology(香港科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Computer Science and Engineering, Chongqing Three Gorges University(重庆三峡大学计算机科学与工程学院) Chinese Academy of Sciences, New Territories, Hong Kong(中国科学院香港新 Territories 分院) City University of Hong Kong, Kowloon, Hong Kong(香港城市大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出一种迭代交换框架,用于多无人机协作路径规划,通过任务交换和路径细化平衡效率与公平性,实验表明其在总距离和makespan之间取得更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09439 2025-12-02 cs.CY cs.SY eess.SY 57%

Towards Ethical AI in Power Electronics: How Engineering Practice and Roles Must Adapt

迈向电力电子中的伦理AI:工程实践和角色必须如何适应

Fanfan Lin, Peter Wilson, Xinze Li, Alan Mantooth

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨电力电子中AI伦理的重要性,提出四个核心伦理支柱,并呼吁工程师和IEEE推动伦理标准与人才发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22483 2025-12-01 cs.LG 57%

Enhancing Trustworthiness with Mixed Precision: Benchmarks, Opportunities, and Challenges

通过混合精度提升可信度:基准测试、机遇与挑战

Guanxi Lu, Hao Mark Chen, Zhiqiang Que, Wayne Luk, Hongxiang Fan

机构 * Department of Computing Imperial College London(计算系 帝国理工学院伦敦分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文研究了量化对可信度指标的影响,提出了一种混合精度集合投票方法,提升了可信度指标性能。

Comments ASP-DAC 2026 Special Session

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20783 2025-11-27 cs.CL 57%

On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey

在预训练语言模型中通用文本嵌入的作用:综述

Meishan Zhang, Xin Zhang, Xinping Zhao, Shouzheng Huang, Baotian Hu, Min Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文综述了预训练语言模型在通用文本嵌入中的作用,探讨了其架构、核心方法及未来研究方向。

Comments 45 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 57%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20230 2025-11-20 cs.LG 57%

Coresets from Trajectories: Selecting Data via Correlation of Loss Differences

Manish Nagaraj, Deepak Ravikumar, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

Journal ref Transactions on Machine Learning Research 2025, issn=2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏