arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-09 至 2026-01-09 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2601.04394 2026-01-09 cs.CL 85%

ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models

ARREST: 对抗鲁棒调节提升大语言模型的安全性与真实性

Sharanya Dasgupta, Arkaprabha Basu, Sujoy Nath, Swagatam Das

机构 * Electronics and Communication Sciences Unit (ECSU), Indian Statistical Institute Kolkata, University of Surrey, and Indian Institute Of Technology Delhi(电子与通信科学单元(ECSU)、印度统计研究所科钦分校、萨里大学和印度理工学院德里)

专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 ARREST通过对抗鲁棒调节提升大语言模型的安全性与真实性,通过外部网络纠正表征不匹配并生成软拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04739 2026-01-09 cs.CY cs.AI cs.LG 82%

A Framework for Responsible AI Systems: Building Societal Trust through Domain Definition, Trustworthy AI Design, Auditability, Accountability, and Governance

负责任人工智能系统的设计框架:通过领域定义、可信AI设计、可审计性、可问责性和治理建立社会信任

Andrés Herrera-Poyatos, Javier Del Ser, Marcos López de Prado, Fei-Yue Wang, Enrique Herrera-Viedma, Francisco Herrera

机构 * Deparment of Computer Science and Artificial Intelligence and Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI), University of Granada(计算机科学与人工智能系和安达卢西亚数据科学与计算智能研究所(DaSCI),格拉纳达大学) TECNALIA (BRTA)(TECNALIA(BRTA)) University of the Basque Country (UPV/EHU)(巴斯克大学(UPV/EHU)) School of Engineering, Cornell University(工程学院,康奈尔大学) ADIA Lab(ADIA实验室) Computational Research Department, Lawrence Berkeley National Laboratory(计算研究部,劳伦斯伯克利国家实验室) Intelligent Systems for Robotics and Automation Laboratory, Macau University of Science and Technology(机器人与自动化智能系统实验室,澳门科学技术大学)

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一个整合领域定义、可信AI设计、可审计性、可问责性和治理的RAI系统设计框架,旨在通过建立社会信任实现负责任的人工智能。

Comments 27 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05184 2026-01-09 cs.AI cs.CL 62%

Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop

大语言模型自我消耗表现性循环中的观测与对策

Yaxuan Wang, Zhongteng Cai, Yujia Bao, Xueru Zhang, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) The Ohio State University(俄亥俄州立大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自我消耗表现性循环(SCPL)概念,通过实验发现表现性循环会增加偏好偏见并降低差异偏见,设计奖励拒绝采样策略以缓解偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 62%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04249 2026-01-09 cs.AI 57%

Fuzzy Representation of Norms

模糊表示规范

Ziba Assadi, Paola Inverardi

机构 * Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于模糊逻辑的SLEEC规则表示方法,用于在自主系统中嵌入伦理要求,以解决AI系统可能遇到的伦理困境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04238 2026-01-09 cs.CY 57%

Generative AI for Social Impact

生成式AI用于社会影响

Lingkai Kong, Cheol Woo Kim, Davin Choo, Milind Tambe

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 生成式AI通过LLM代理和扩散模型解决社会影响中的部署瓶颈,实现可扩展且人类对齐的资源优化系统。

Comments To appear in IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏