arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1852 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1852 篇

2605.10850 2026-05-12 cs.CV 50%

Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

验证幻象:映射医学视觉问答中自我验证的可靠性边界

Ruinan Jin, Beidi Zhao, Myeongkyun Kang, Qiong Zhang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Redmin University of China(红矿大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08799 2026-05-12 cs.RO 50%

ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation

ElasticFlow: 语言引导操作中的弹性时间 horizon 的一步物理一致策略

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆校区) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(芬兰奥卢大学信息科技与电气工程学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 ElasticFlow通过弹性时间 horizon 机制和直接建模平均速度场,实现高效的一步映射,提升语言引导操作的物理一致性和效率。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05830 2026-05-08 cs.CR 50%

Fairness in Token Delegation: Mitigating Voting Power Concentration in DAOs

代币委托中的公平性:缓解DAO中的投票权集中问题

Johnnatan Messias, Ayae Ide

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究DAO治理中委托机制的问题,通过分析14个DAO论坛的数据,发现委托常与持有者优先级不一致,提出引入兴趣匹配以缓解权力集中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27825 2026-05-01 cs.SE 50%

Requirements Debt in AI-Enabled Perception Systems Development: An Industrial RE4AI Perspective

人工智能赋能感知系统开发中的需求债务:一种工业RE4AI视角

Hina Saeeda, Soniya Abraham

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文从工业RE4AI视角探讨AI赋能感知系统开发中的需求债务问题,分析功能和非功能需求演变如何产生并传播需求债务,揭示其对系统审计性、可靠性及认证准备性的负面影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23946 2026-05-01 physics.comp-ph physics.flu-dyn 50%

Learning subgrid interfacial area in two-phase flows with regime-dependent inductive biases

在两相流中利用相态依赖性归纳偏置学习子网格界面面积

Anirban Bhattacharjee, Luis H. Hatashita, Suhas S. Jain

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究了在湍流多相流中利用物理结构嵌入学习过程以提高机器学习可靠性,开发并评估了两种子网格闭合模型,发现物理约束模型在不同Weber数下能提升预测精度并抑制非物理伪影。

Comments 34 pages, 17 figures, journal preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 50%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 50%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 50%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10069 2026-04-17 cs.RO 50%

Humanoid Factors: Design Principles for AI Humanoids in Human Worlds

人形因素:人工智能人形在人类世界中的设计原则

Xinyuan Liu, Eren Sadikoglu, Ransalu Senanayake, Lixiao Huang

机构 * School of Computing and Augmented Intelligence, Arizona State University, AZ, USA(计算与增强智能学院,亚利桑那州立大学,亚利桑那州,美国) School of Manufacturing Systems and Networks, Arizona State University, AZ, USA(制造系统与网络学院,亚利桑那州立大学,亚利桑那州,美国) Human Systems Engineering, Arizona State University, AZ, USA(人机系统工程,亚利桑那州立大学,亚利桑那州,美国)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出人形因素框架,旨在指导人工智能人形与人类共存与协作的设计,强调物理、认知、社会和伦理四个支柱,以解决人形与人类交互中的新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13103 2026-04-16 cs.SE cs.MA 50%

Fairness in Multi-Agent Systems for Software Engineering: An SDLC-Oriented Rapid Review

多代理系统在软件工程中的公平性:面向软件开发生命周期的快速综述

Corey Yang-Smith, Ronnie de Souza Santos, Ahmad Abdellatif

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文综述了多代理系统在软件工程中的公平性研究,分析了LLM赋能环境下的公平性框架,指出当前研究在评估实践、泛化能力及缓解机制方面存在三大不足。

Comments 8 pages, 4 figures. Accepted to the LLMTrust workshop at FSE Companion 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08740 2026-04-15 econ.TH 50%

Misspecified Model Estimation and Its Impact on Predictions

模型误设估计及其对预测的影响

Junnan He, Lin Hu, Matthew Kovach, Anqi Li

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究线性统计模型中,因变量依赖于具有固定总体系数和观察特定潜系数的自变量及测量误差。决策者估计总体系数并用于预测给定观察的潜系数。分析模型误设如何扭曲预测,探讨残差信息与误设向量与潜变量到系数映射的对齐性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13538 2026-04-14 cs.SE cs.ET 50%

Model Context Protocol (MCP) at First Glance: Studying the Security and Maintainability of MCP Servers

模型上下文协议(MCP)初探:研究MCP服务器的安全性和可维护性

Mohammed Mehedi Hasan, Hao Li, Emad Fallahzadeh, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文首次对MCP服务器进行大规模实证研究,发现其存在八种独特漏洞,强调需专门的漏洞检测技术,并呼吁加强MCP生态系统的治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09655 2026-04-09 cs.CR 50%

How Secure is Code Generated by ChatGPT?

ChatGPT生成的代码安全性如何?

Raphaël Khoury, Anderson R. Avila, Jacob Brunelle, Baba Mamadou Camara

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究评估了ChatGPT生成代码的安全性,探讨了通过提示提高安全性的方法及AI生成代码的伦理问题。

Journal ref 2023 IEEE International Conference on Systems, Man, and Cybernetics (SMC) October 1-4, 2023, Oahu, Hawaii, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02499 2026-04-06 cond-mat.mtrl-sci 50%

CARBON-2D Topological Descriptor (C2DTD): An Interpretable and Physics-Informed Representation for Two-Dimensional Carbon Networks

CARBON-2D拓扑描述符(C2DTD):一种可解释且物理导向的二维碳网络表示方法

Felipe Hawthorne, Marcelo Lopes Pereira Junior, Fabiano Manoel de Andrade, Cristiano Francisco Woellner, Raphael Matozo Tromer

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出C2DTD,一种用于二维碳系统的物理导向结构表示方法,通过整合局部几何统计、紧凑径向结构特征和显式原始环拓扑,实现高效且可解释的预测性能,适用于小数据集和缺陷工程石墨烯的分析。

Comments 22 pages and 06 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01056 2026-04-02 eess.SY cs.SY 50%

A Functional Learning Approach for Team-Optimal Traffic Coordination

团队最优交通协调的函数学习方法

Weihao Sun, Gehui Xu, Alessio Moreschini, Thomas Parisini, Andreas A. Malikopoulos

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出基于核的方法的策略迭代函数学习框架,用于计算交通协调问题中的团队最优策略,结合二次调节项和非线性安全惩罚项,通过核空间近似求解,并在SUMO中验证。

Comments 8 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22588 2026-04-02 cs.HC cs.ET 50%

Practitioner Voices Summit: How Teachers Evaluate AI Tools through Deliberative Sensemaking

实践者声音峰会:教师如何通过 deliberative sensemaking 评估 AI 工具

Dorottya Demszky, Christopher Mah, Helen Higgins

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨教师在整合AI工具时的评估标准及支持条件,通过全国峰会收集61名数学教师制定的200余条评估标准,揭示了 deliberative sensemaking 的五种机制及TPACK与代理的相互促进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27411 2026-03-31 cs.HC 50%

Relational Co-Adaptation in Emotionally Supportive AI: Tensions in Authentic Emotional Interaction

情感支持型AI中的关系共适应:真实情感互动中的张力

Mengqi Shi

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了情感支持型AI中双向对齐的悖论,指出技术有效性可能引发伦理问题,如AI成为老年人唯一选项、情感需求与系统干预不匹配等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 50%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20237 2026-03-30 q-fin.ST 50%

Temporal Coverage Bias in Financial Panel Data: A Coverage-Aware Structuring Framework with Evidence from the Dhaka Stock Exchange

金融面板数据中的时间覆盖偏差:一种覆盖意识的结构化框架及达卡证券交易所的实证研究

Tashreef Muhammad

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出一种覆盖意识的结构化框架,用于解决金融面板数据中因时间覆盖不一致导致的偏差问题,并通过达卡证券交易所的数据验证了该方法对收益率动态和波动性的影响。

Comments 16 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02569 2026-03-30 cs.HC cs.RO 50%

Reframing Human-Robot Interaction Through Extended Reality: Unlocking Safer, Smarter, and More Empathic Interactions with Virtual Robots and Foundation Models

通过扩展现实重新定义人机交互:利用虚拟机器人和基础模型实现更安全、更智能和更具同理心的交互

Yuchong Zhang, Yong Ma, Danica Kragic

机构 * Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习部) Department of Clinical Medicine, University of Bergen(卑尔根大学临床医学系)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨通过扩展现实技术,利用基础模型驱动的虚拟机器人实现更安全、智能和具同理心的人机交互,同时讨论多模态大模型在认知和情感交互中的应用及潜在风险。

Comments This paper is under review

Journal ref Empathic Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22612 2026-03-25 cs.CR cs.HC 50%

BioShield: A Context-Aware Firewall for Securing Bio-LLMs

BioShield: 一种面向生物大语言模型的上下文感知防火墙

Protiva Das, Sovon Chakraborty, Sidhant Narula, Lucas Potter, Xavier-Lewis Palmer, Pratip Rana, Daniel Takabi, Mohammad Ghasemigol

专题命中 AI治理与伦理 :safety(abstract)

AI总结 BioShield通过上下文感知的提示扫描和响应验证,为生物领域大语言模型提供多层次安全防护,有效防止双重用途攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21386 2026-03-24 cs.CV 50%

Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation

缓解对象性偏差和区域到文本对齐问题以实现开放词汇全景分割

Nikolay Kormushev, Josip Šarić, Matej Kristan

机构 * University of Ljubljana(卢布尔雅那大学) ETH Zurich(苏黎世联邦理工学院) University of Zagreb(扎格reb大学) Faculty of Comp. and Inf. Science(计算机与信息科学系) Dept. of Computer Science(计算机科学系) Faculty of Elec. Eng. and Computing(电子工程与计算科学系)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出OVRCOAT框架,通过CLIP条件对象性调整和开放词汇掩码到文本细化,解决开放词汇全景分割中的对象性偏差和区域对齐问题,提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16099 2026-03-18 cs.CV 50%

OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder

OneWorld: 通过3D统一表示自编码器驯服场景生成

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Tongliang Liu, Mingming Gong, Jiawang Bian

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) AISphere Shanghai Jiao Tong University(上海交通大学) University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 OneWorld通过3D统一表示自编码器直接在3D空间中进行扩散,解决跨视角一致性和几何一致性问题,实验表明其生成的3D场景质量优于现有2D方法。

Comments Code: https://github.com/SensenGao/OneWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12600 2026-03-16 cs.HC 50%

How GenAI Mentor Configurations Shape Early Collaborative Dynamics: A Classroom Comparison of Individual and Shared Agents

生成式人工智能导师配置如何塑造早期协作动态:个体与共享代理的课堂比较

Siyu Zha, Weijing Liu, Fei Qin, Jie Cao, Yanjin Wang, Yujia Liu, Kaiyi Zhang, Jiangtao Gong, Yingqing Xu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了生成式人工智能配置对课堂协作调节的影响,发现共享AI促进收敛性协作,而个体AI则导致更分散的互动模式,需教师更多干预。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12406 2026-03-16 cs.SE 50%

Team Diversity Promotes Software Fairness: An Experiment on Fairness-Aware Requirements Prioritization

团队多样性促进软件公平性:一项关于公平意识需求优先级排序的实验

Cleyton Magalhes, Ronnie de Souza Santos, Bimpe Ayoola, Brody Stuart-Verner, Italo Santos

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了软件团队多样性对需求优先级排序中公平意识行为的影响,发现多样性团队更一致地拒绝存在公平风险的故事,且决策理由更强调包容性和伦理责任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04916 2026-03-13 cs.SE 50%

Classifier or Prompt: A Case Study on Legal Requirements Traceability

分类器或提示:关于法律要求可追溯性的案例研究

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出Kashif和RICE_LRT两种方法,分别通过分类器和提示工程解决法律要求的可追溯性问题,实验表明Kashif在F2得分上优于基线,RICE_LRT在更复杂的GDPR文档中表现更优。

Comments 32 pages, 7 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10773 2026-03-12 cs.HC 50%

AI-Generated Rubric Interfaces: K-12 Teachers' Perceptions and Practices

AI生成的评分标准界面:K-12教师的感知与实践

Bahare Riahi, Sayali Patukale, Joy Niranjan, Yogya Koneru, Tiffany Barnes, Veronica Cateté

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究探讨了K-12教师在使用AI生成评分标准时的感知与实践,发现AI生成的评分标准在结构和清晰度上有帮助,但需要教师监督以确保准确性和相关性。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08397 2026-03-10 eess.AS 50%

NLE: Non-autoregressive LLM-based ASR by Transcript Editing

NLE:基于大语言模型的语音识别的非自回归方法通过转录编辑

Avihu Dekel, Samuel Thomas, Takashi Fukada, George Saon

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 NLE通过非自回归方法实现高效语音识别,利用转录编辑技术在保持准确性的同时显著提升处理速度,适用于实时应用场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01450 2026-03-03 cs.CV 50%

Deepfake Forensics Adapter: A Dual-Stream Network for Generalizable Deepfake Detection

深度伪造取证适配器:一种通用深度伪造检测的双流网络

Jianfeng Liao, Yichen Wei, Raymond Chan Ching Bon, Shulan Wang, Kam-Pui Chow, Kwok-Yan Lam

机构 * Shenzhen Technology University(深圳技术大学) Singapore Institute of Technology(新加坡理工学院) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出深度伪造取证适配器,通过双流网络结合CLIP模型实现高效通用深度伪造检测。

Comments Accepted at ICDF2C 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16953 2026-03-03 cs.CV 50%

Towards Real Zero-Shot Camouflaged Object Segmentation without Camouflaged Annotations

面向无遮蔽标注的零样本遮蔽物分割

Cheng Lei, Jie Fan, Xinran Li, Tianzhu Xiang, Ao Li, Ce Zhu, Le Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Space42

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出了一种无需遮蔽标注的零样本遮蔽物分割框架,通过结合MIM、M-LLM和MFA机制,实现高效分割与快速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏