arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1852 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1852 篇

2603.23118 2026-07-30 cs.CV cs.MM 版本更新 50%

SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉

Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) Tsinghua University(清华大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08693 2026-07-30 cs.CR 版本更新 50%

Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research

自主渗透测试代理研究中的伦理声明

Andreas Happe, Jürgen Cito

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。

Comments Accepted at AutonomousCyber 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17675 2026-07-29 cs.SE cond-mat.mtrl-sci 版本更新 50%

Bridging the Gap on AI-Assisted Scientific Software Development Through Transparency and Traceability

通过透明性和可追溯性弥合人工智能辅助科学软件开发的差距

Chaitanya Bhave, Pierre-Clément A. Simon, Casey Icenhour, Lin Yang, Cody J. Permann, Daniel Schwen, Christopher S. Ritter

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨了在严格软件质量保证背景下如何负责任地使用人工智能辅助科学软件开发,提出了一种结构化框架用于AI辅助的验证与验证案例开发,以确保软件质量。

Comments 11 figures, 25 main pages (42 total pages including supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交 50%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18988 2026-07-28 cs.CV 版本更新 50%

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

DobicVLM:通过群体相对策略优化使胸部X光报告生成与临床基础的程序化奖励保持一致

Thanni Adewuyi, Angelica Obayi, Andem Aniekan, Samuel Okoko, Angel Ezendu, Ephraim Usani, Ademide Animasaun, Philip Chibundu, Christian Maurice, Mary Donald Essien, Oluwaseun Odunsi, Oluwasegun Oguntuase, Abiodun Adereni

机构 * Dobic Health(多比克健康公司) University of Ibadan(伊巴丹大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究针对自动胸部X光报告生成难题,提出DobicVLM模型,结合监督微调、GRPO及临床奖励,用可解释规则组件执行标准,经训练和评估,该模型多数标准优于Gemini 2.5 Flash,证明GRPO在资源受限设置中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19667 2026-07-23 eess.SY cs.SY 新提交 50%

A Human-AI Teaming Framework for Deep Reinforcement Learning-Based Voltage Regulation in Distribution Networks

一种用于配电网中基于深度强化学习的电压调节的人机协作框架

Mahmuda Akter, Hamidreza Nazaripouya

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对分布式能源资源增加致配电网电压调节难的问题,提出人机协作强化学习框架。该框架结合SAC智能体与自适应拉格朗日约束机制,并融入人类指导模块,在特定环境实现。相比基线方法,显著降低电压违规严重性及功率损耗。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25003 2026-07-21 cs.MA 50%

Emergent Coordinated Behaviors in Networked LLM Agents: Modeling the Strategic Dynamics of Information Operations

网络化生成代理中的涌现协调行为:信息操作的战略动态建模

Gian Marco Orlando, Jinyi Ye, Valerio La Gatta, Mahdi Saeedi, Vincenzo Moscato, Emilio Ferrara, Luca Luceri

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究了生成代理在模拟信息操作中的协调行为,发现通过共享目标即可实现接近人工协调的水平,揭示了自动化信息操作的社会风险。

Journal ref WWW '26: Proceedings of the ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 50%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15862 2026-07-20 math.OC 新提交 50%

PriEco-DRL: Joint Optimization of Electric-Bus Eco-Driving and Transit-Priority Adaptive Signals via Deep Reinforcement Learning

PriEco-DRL:基于深度强化学习的电动公交生态驾驶与公交优先自适应信号联合优化

Dingshan Sun, Ang Li, Chaopeng Tan, Zicheng Su, Wanjing Ma, Marco Rinaldi

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出PriEco-DRL框架,运用深度强化学习将电动公交生态驾驶与公交优先自适应信号控制相结合,采用优先级加权最大压力控制器及结构化奖励,经集中训练和分散执行,实验表明其能降低电动公交能耗,实现能量-时间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07070 2026-07-20 cs.SE 50%

Building an Open AIBOM Standard in the Wild

在真实环境中构建开放的AIBOM标准

Gopi Krishnan Rajbahadur, Keheliya Gallaba, Elyas Rashno, Arthit Suriyawongkul, Karen Bennet, Kate Stewart, Ahmed E. Hassan

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文通过行动研究方法,在真实环境中构建了AIBOM规范,旨在为人工智能系统提供开放的标准框架。

Comments Accepted to be published at the IEEE/ACM 48th International Conference on Software Engineering (ICSE) - Software Engineering in Practice (SEIP) track. April 12 - 18, 2026. Rio de Janeiro, Brazil

Journal ref Proc. IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP '26), 2026, pp. 842--853

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新 50%

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11601 2026-07-14 cs.CR 新提交 50%

Cardano's Voltaire Governance: Complete Specification and Research Program

卡尔达诺的伏尔泰治理:完整规范与研究计划

Nimrod Talmon, Oghenekaro Elem

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05442 2026-07-08 cs.GT 新提交 50%

The Oracle's Gambit: A Game-Theoretic Framework for Responsible AI Release

神谕者的策略:负责任的人工智能发布的博弈论框架

Christoph R. Landolt, Tobias Lorenz, Marta Kwiatkowska, Mario Fritz

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01485 2026-07-03 cs.IR 新提交 50%

CoPersona: Collaborative Persona Graphs for Robust LLM Personalization

CoPersona: 面向鲁棒LLM个性化的协作人格图

Yangtian Zhang, Leyao Wang, Hiren Madhu, Ngoc Bui, Walter Roznyatovskiy, Rex Ying

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。

Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00046 2026-07-02 cs.MA cs.SE 新提交 50%

A Role-Based Multi-Agent Model for Climate Adaptation Deliberation Across Living Labs

基于角色的多智能体模型用于生活实验室间气候适应讨论

Önder Gürcan, David Eric John Herbert, F. LeRon Shultz, Christopher Frantz, Ivan Puga-Gonzalez

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出一种模块化多层级智能体架构,整合基于动机的个体决策、社会影响网络和机构策略模块,以模拟气候治理中的复杂互动,支持情景探索。

Comments 4 pages, 1 figure, accepted as poster at the 21st annual Social Simulation Conference (SSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31762 2026-07-01 cs.HC 新提交 50%

Investigating LLM-Powered Dissenting Minority Support in Power-Imbalanced Group Decision-Making: Counterargument and Mediation as Intervention Strategies

探究LLM赋能的异议少数群体在权力不平衡群体决策中的支持:反驳与调解作为干预策略

Soohwan Lee, Seoyeong Hwang, Mingyu Kim, Dajung Kim, Kyungho Lee

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究开发了LLM赋能的异议少数支持系统,通过AI生成的反驳或AI调解消息来关注少数观点,实验发现反驳增强满意度但调解增加参与却降低心理安全感,揭示了参与与心理安全之间的支持悖论。

Comments Accepted at CSCW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31339 2026-07-01 cs.RO 新提交 50%

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems

验证门控的智能工业多机器人系统任务状态治理

Guoqin Tang, Qingxuan Jia, Yichen Tan, Zeyuan Huang, Ning Ji, Gang Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28340 2026-06-30 cs.IR 50%

Rethinking Fairness in LLM-Based Recommender Systems: A Survey

重新思考基于LLM的推荐系统中的公平性:一项综述

Song-Duo Ma, Chu-Yun Chen, Bang-An Li, Pin-Yu Chen, Shau-Yung Hsu, Yun-Nung Chen

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26729 2026-06-29 cs.HC 新提交 50%

'A bit of chaos and madness': The AI Assessment Scale and the work of assessment reform

“一丝混乱与疯狂”:AI评估量表与评估改革工作

Mike Perkins, Darius Postma, Jasper Roe, Susan Sisay, Craig Holdcroft

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。

Comments V2: Corrections of errata, additional limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01127 2026-06-24 cs.CR 版本更新 50%

Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense

多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习

Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18924 2026-06-18 cs.SD 新提交 50%

Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs

谁赢得冲突?音频大模型中文本偏差的机制可解释性

Hyebin Cho, Suho Yoo, Jaehyuk Jang, Changick Kim, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文通过机制分析揭示音频大模型中的文本主导偏差,发现文本路径主动抑制完整音频表征,并提出无训练干预方法back-patching以增强音频表征,缓解文本主导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14796 2026-06-16 cs.SE 新提交 50%

Faster Code, Deeper Debt? A Multivocal Literature Review on Technical Debt and Its Early Signs in LLM-Assisted Software Development

更快的代码,更深的债务?关于LLM辅助软件开发中技术债务及其早期迹象的多声部文献综述

Ramtin Ehsani, Shriya Rawal, Yuanfang Cai, Preetha Chatterjee

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 通过104篇文献的多声部综述,发现LLM辅助开发放大传统技术债务(代码、设计、文档债务)并引入新债务(快速集成、提示、伦理、数据、来源债务),提出人机协同、提示工程等缓解策略,但缺乏标准化基准。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17179 2026-06-16 cs.MA 版本更新 50%

Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection

公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究

Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang, Emily F. Wong, Paul Wang, Jason H. Moore, Tiffani J. Bright

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12258 2026-06-11 cs.CV 新提交 50%

Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning

连接昼夜:基于协同提示与原型学习的无监督跨域重识别

Jiyang Xu, Rui Liu, Hang Dai

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出无监督昼夜重识别框架,结合提示学习和原型表示学习,通过两阶段训练实现无标注跨域身份关联,性能媲美全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07833 2026-06-11 cs.RO 版本更新 50%

Harnessing Embodied Agents: Runtime Governance for Policy-Constrained Execution

利用具身体 agent:运行时治理以实现政策约束执行

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出了一种政策约束执行框架,通过将 agent 认知与执行监督分离,增强了具身体 agent 的运行时治理能力,通过 1000 次随机模拟验证,显著提高了对未经授权动作的拦截率和系统恢复成功率。

Comments 36 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28167 2026-05-28 cs.CV 50%

DebFilter: Eradicating Biases Stashed in Value

DebFilter: 消除隐藏在值中的偏见

Seung Hyuk Lee, Songkuk Kim

机构 * School of Integrated Technology, BK21 Graduate Program in Intelligent Semiconductor Technology(整合技术学院,智能半导体技术BK21研究生项目)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出DebFilter,一种轻量级、无需训练的方法,通过调整交叉注意力中的值分量来纠正文本到图像扩散模型中的社会偏见,实现推理时偏差缓解。

Comments 8 pages, 7 figures, supplementary material included, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24729 2026-05-26 cs.HC 50%

"It Felt a Bit Eerie": Exploring Humanlike Interactions During Collaborative Writing with an Artificial Agent

"感觉有点诡异":与人工智能体协作写作中类人交互的探索

Michael Yin, Angela Chiang, Samuel Rhys Cox, Robert Xiao

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 通过构建三种不同类人程度的AI辅助编辑器并开展用户研究,探讨协作的时间与视觉维度如何影响写作体验及人机社会连接。

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23330 2026-05-25 cs.CR 50%

Security, Privacy, and Ethical Risks in OpenClaw

OpenClaw 中的安全、隐私与伦理风险

Yutong Jin, Zelin Zhang, Zhijin Lyu, Jianbing Ni

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文系统研究了本地可执行AI代理系统OpenClaw在安全、隐私、伦理及可追溯性方面的风险,并呼吁多方合作构建更安全可靠的AI代理系统。

Comments Accepted by Journal of Information and Intelligence(JII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21569 2026-05-22 cs.HC 50%

When Support Escalates Distress: Regulation and Escalation in LLM Responses to Venting and Advice-Seeking

当支持加剧压力:在LLM对倾诉和寻求建议的回应中的调节与加剧

Vivienne Bihe Chi, Adithya V Ganesan, Ryan L Boyd, Lyle Ungar, Sharath Chandra Guntuku

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究探讨了大型语言模型在不同求助风格(倾诉与寻求建议)下对压力的调节与加剧作用,通过分析Reddit帖子发现LLM回应中调节和加剧是独立的维度,且不同角色设定(默认、朋友、治疗师)对调节和加剧的影响不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13235 2026-05-14 cs.NI 50%

Intelligence Delivery Network: Toward an Internet Architecture for the AI Age

智能交付网络:面向人工智能时代的互联网架构

Hanling Wang, Qing Li, Dan Zhao, Yuhong Song, Xingchi Chen, Teng Gao, Peiyuan Zong, Zhuyun Qi, Yue Yu, Yong Jiang

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文提出智能交付网络(IDN),旨在通过将AI能力作为可交付的网络服务,解决传统云中心化部署在延迟、资源利用率和隐私问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏