arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 11 篇

2601.10599 2026-01-21 cs.CY 83%

Institutional AI: A Governance Framework for Distributional AGI Safety

机构AI:分布式AGI安全的治理框架

Federico Pierucci, Marcello Galisai, Marcantonio Syrnikov Bracale, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09212 2026-01-21 cs.CL 79%

Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment

针对对齐偏差:一种基于冲突意识的奖励模型驱动LLM对齐框架

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang, Xinru Liu

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于冲突意识的框架,通过识别和缓解代理模型与策略间的冲突来提升大语言模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12652 2026-01-21 cs.CY 77%

Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking

大语言模型部署中的伦理风险:医疗伦理“ Jailbreak”评估

Chutian Huang, Dake Cao, Jiacheng Ji, Yunlou Fan, Chengze Yan, Hanhui Xu

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 本文评估了大语言模型在医疗伦理领域面临的安全风险,发现七种主流模型在对抗测试中表现不一,其中Claude-Sonnet-4-Reasoning表现最稳健,而其他五种模型几乎全部失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13122 2026-01-21 cs.AI 70%

Responsible AI for General-Purpose Systems: Overview, Challenges, and A Path Forward

通用系统责任AI:概述、挑战与前行之路

Gourab K Patro, Himanshi Agrawal, Himanshu Gharat, Supriya Panigrahi, Nim Sherpa, Vishal Vaddina, Dagnachew Birru

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了通用AI系统在责任AI方面的挑战,并提出C2V2需求以指导未来系统的开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11583 2026-01-21 cs.CY cs.AI cs.MA 62%

Bit-politeia: An AI Agent Community in Blockchain

Bit-politeia: 区块链上的一个AI代理社区

Xing Yang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 Bit-politeia通过区块链和AI代理构建公平高效的资源分配系统,以减少传统同行评审中的偏见和资源集中问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11369 2026-01-21 cs.GT cs.AI 57%

Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs

机构AI:通过公共治理图治理多智能体Cournot市场中的LLM合谋

Marcantonio Bracale Syrnikov, Federico Pierucci, Marcello Galisai, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) Sapienza University of Rome(罗马大学萨皮恩扎分校) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) VU Amsterdam(阿姆斯特丹自由大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过公共治理图治理多智能体Cournot市场合谋问题,展示机构AI框架在减少合谋行为方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12727 2026-01-21 cs.HC cs.AI 57%

AI-exhibited Personality Traits Can Shape Human Self-concept through Conversations

基于AI表现的人格特质可通过对话影响人类自我概念

Jingshu Li, Tianqi Song, Nattapat Boonprakong, Zicheng Zhu, Yitian Yang, Yi-Chieh Lee

机构 * Computer Science(计算机科学) National University of Singapore(新加坡国立大学) School of Computing(计算学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本研究发现基于AI的人格特质可通过对话影响用户自我概念,揭示了AI在人机交互中的潜在影响及设计启示。

Comments ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09478 2026-01-21 cs.IR cs.AI 57%

Bridging Semantic Understanding and Popularity Bias with LLMs

通过大语言模型弥合语义理解和流行偏见之间的鸿沟

Renqiang Luo, Dong Zhang, Yupeng Gao, Wen Shi, Mingliang Hou, Jiaying Liu, Zhe Wang, Shuo Yu

机构 * Jilin University Changchun China Dalian University of Technology Dalian China Jinan University \& TAL Education Group Guangzhou China Jilin University Dalian University of Technology Jinan University \& TAL Education Group

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出FairLRM框架,通过大语言模型增强对流行偏见的语义理解,提升推荐系统的公平性和准确性。

Comments 10 pages, 4 figs, WWW 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11953 2026-01-21 cs.LG 57%

Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration

在安全探索中约束强化学习中的低估偏差控制

Shiqing Gao, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文提出MICE方法,通过引入内在成本和偏差校正策略,有效控制约束强化学习中的低估偏差,减少约束违反并保持策略性能。

Comments Published in the 42nd International Conference on Machine Learning (ICML 2025, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11576 2026-01-21 cs.CY 57%

What Can Student-AI Dialogues Tell Us About Students' Self-Regulated Learning? An exploratory framework

学生-人工智能对话能告诉我们什么?关于学生自主学习能力的探索性框架

Long Zhang, Fangwei Lin, Weilin Wang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本研究通过分析学生与AI对话日志,提出DHASRL框架,揭示主动对话模式与自主学习能力正相关,而反应性模式则负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15639 2026-01-21 cs.AI 57%

The AI Policy Module: Developing Computer Science Student Competency in AI Ethics and Policy

AI政策模块:培养计算机科学学生在AI伦理与政策方面的能力

James Weichert, Daniel Dunlap, Mohammed Farghally, Hoda Eldardiry

机构 * Computer Science \& Engineering University of Washington Seattle, USA

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AI政策模块2.0,通过课程改革提升学生在AI伦理与政策方面的素养,通过试点评估显示学生对AI伦理影响的担忧增加,同时增强了讨论AI监管的能力。

Comments Accepted at IEEE Frontiers in Education (FIE) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏