arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2604.21034 2026-05-08 cs.HC 50%

White Paper: Human-AI Collaboration in Conflict Analysis: Text Classifier Development with Peacebuilders

白皮书:冲突分析中的人机协作:与和平建设者共同开发文本分类器

Allan Kipyator Kipkemboi Cheboi, Julie Hawke, Hussam Abualfatah, Andrew Sutjahjo, Daniel Burkhardt Cerigo, Rachael Olpengs, William OBrien

专题命中 安全评测 :alignment(abstract)

AI总结 本文描述了肯尼亚和苏丹的和平建设者与数据科学家合作,开发基于AI的文本分类器以监控网络极化和仇恨言论,强调参与式标注过程和模型评估的改进效果。

Comments 17 pages, 5 tables V2 published with Build Up report formatting; no content changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05391 2026-05-08 cs.HC 50%

Every(bot) Makes Mistakes: Coding Big Five Personalities, Context, and Tone into an LLM Chatbot Recovery Code Framework

每个( bot )都会犯错:将大五人格、情境和语气编码到LLM聊天机器人恢复代码框架中

Rachel Hill, Tom Owen, Julian Hough

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一个结合大五人格、情境和语气的LLM聊天机器人恢复代码框架,通过实验验证其在提升错误恢复质量方面的有效性。

Comments 14 pages of main content, 3 figures, 4 tables, 9 appendices. This paper has been submitted to the Becker Friedman Institute 2026 AI in Social Sciences conference for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13281 2026-05-08 cs.CV 50%

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?

Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

机构 * The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Monash University(墨尔本大学) Video Rebirth University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract)

AI总结 VideoASMR-Bench通过细粒度音频视觉感知和感官沉浸性评估AI生成ASMR视频的检测能力,揭示了当前VLMs在识别AI生成ASMR视频上的不足以及VGMs生成逼真ASMR视频的能力。

Comments Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00927 2026-05-05 q-bio.OT 50%

BioVeil MATRIX: Uncovering and categorizing vulnerabilities of agentic biological AI scientists

BioVeil MATRIX: 洞察和分类代理生物AI科学家中的漏洞

Kimon Antonios Provatas, Avery Self, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 安全评测 :safety(abstract)

AI总结 研究探讨了代理生物AI科学家在多学科科学流程中的应用,指出现有安全评估无法覆盖双用途应用风险,提出BioVeil MATRIX作为防御分类体系,用于系统化分类生物安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28084 2026-05-01 eess.SY cs.SY 50%

Intelligent Self-tuning Active EMI Filtering for Electrified Automotive Power Systems Using Reinforcement Learning

基于强化学习的智能自适应电磁干扰滤波器用于电动汽车电力系统

Mahuizi Lu, Kelin Jia, Rajib Goswami, Yukun Hu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于强化学习的智能自适应电磁干扰滤波器,通过马尔可夫决策过程动态调整滤波参数,提升电磁兼容性和系统效率,实验显示在宽频范围内实现25-30dB的干扰衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV 50%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 50%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 安全评测 :alignment(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26614 2026-04-30 cs.CV 50%

State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

超越外观:诊断并改进基于指针的测量读数中的状态一致性

Yuanze Hu, Gen Li, Yuqin Lan, Qingchen Yu, Zhichao Yang, Junwei Jing, Zhaoxin Fan, Xiaotie Deng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) Beihang University(北航) Fudan University(复旦大学) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了多模态大语言模型在指针式测量读数任务中的表现问题,发现现有模型在状态一致性上存在缺陷,提出TriSCA框架以提升状态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26352 2026-04-30 cs.HC 50%

UIGaze: How Closely Can VLMs Approximate Human Visual Attention on User Interfaces?

UIGaze: VLMs在用户界面上如何接近人类视觉注意力?

Min Song, Yoonseong Lee, Yeonhu Seo

专题命中 安全评测 :alignment(abstract)

AI总结 UIGaze研究VLMs在用户界面中预测人类视觉注意力的能力,通过零样本坐标预测管道评估九种先进模型,发现VLMs在不同UI类型和更长时间观看中表现出不同程度的匹配。

Comments 6 pages, 4 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26079 2026-04-30 cs.CR 50%

Large Language Models as Explainable Cyberattack Detectors for Energy Industrial Control Systems

大语言模型作为可解释的网络攻击检测器用于能源工业控制系统

Weiyi Kong, Ahmad Mohammad Saber, Amr Youssef, Deepa Kundur

专题命中 安全评测 :safety(abstract)

AI总结 本文研究了大语言模型在工业控制系统中检测Modbus流量攻击的可行性,通过二分类任务实现对异常行为的检测,并生成可审计的事件记录。

Comments Accepted to ACM EnergySP 2026, co-located with ACM e-Energy 2026. Author accepted manuscript. 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 50%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25617 2026-04-29 physics.chem-ph 50%

AI-Powered Surrogate Modelling for Multiscale Combustion: A Critical Review and Opportunities

基于人工智能的多尺度燃烧代理建模:批判性回顾与机遇

Amirali Shateri, Zhiyin Yang, Yuying Yan, Manosh C. Paul, Jianfei Xie

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了人工智能在多尺度燃烧代理建模中的应用,分析了监督、无监督及物理引导学习方法的性能,并探讨了燃料转移性差、外推误差等挑战,提出未来发展的方向。

Comments Multiscale combustion; Surrogate modelling; Artificial intelligence; Chemical kinetics; Turbulent combustion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25175 2026-04-29 physics.soc-ph 50%

Indirect reciprocity beyond pairwise interactions

间接互惠超越 pairwise 互动

Ming Wei, Xin Wang, Junyu Lu, Longzhao Liu, Yishen Jiang, Hongwei Zheng, Shaoting Tang, Feng Fu

专题命中 安全评测 :alignment(abstract)

AI总结 研究提出多玩家间接互惠框架,揭示群体合作的稳定原则,并展示群体结构对声誉动态的影响,为人工智能中的合作对齐提供基准。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV 50%

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24890 2026-04-29 cs.CR 50%

Verifying Provenance of Digital Media: Why the C2PA Specifications Fall Short

验证数字媒体的来源:为何C2PA规范不足

Enis Golaszewski, Neal Krawetz, Alan T. Sherman, Edward Zieglar, Sai K. Matukumalli, Roberto Yus, Carson L. Kegley, Michael Barthel, William Bowman, Bharg Barot, Kaur Kullman

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究分析C2PA的安全性,发现其规范未能实现声称的安全目标及可信部署所需的关键功能,建议不用于高风险领域。

Comments This short non-technical whitepaper summarizes the findings and recommendations from our detailed technical study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12283 2026-04-29 cs.HC 50%

Large Language Models have Chain-of-Affect

大型语言模型具有情感链

Junjie Xu, Xingjiao Wu, Luwei Xiao, Yuzhe Yang, Jie Zhou, Zihao Zhang, Luhan Wang, Yi Huang, Nan Wu, Yingbin Zheng, Chao Yan, Cheng Jin, Honglin Li, Liang He

专题命中 安全评测 :alignment(abstract)

AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01553 2026-04-29 cs.IR 50%

IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of Data

IoDResearch:通过互联网的数据进行私有异构数据的深度研究

Zhuofan Shi, Zijie Guo, Xinjian Ma, Gang Huang, Yun Ma, Xiang Jing

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出IoDResearch框架,通过将异构资源转化为FAIR合规的数字对象,提升私有数据的检索效率和可重用性,实验表明其在检索、问答和报告生成任务中优于现有基线方法。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16391 2026-04-29 cs.SE 50%

Industry Practitioners Perspectives on AI Model Quality: Perceptions, Challenges, and Solutions

行业从业者对AI模型质量的视角:感知、挑战与解决方案

Chenyu Wang, Zhou Yang, Yunbo Lyu, Ze Shi Li, Daniela Damian, David Lo

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究通过访谈和调查,探讨行业从业者对AI模型质量属性的感知、挑战及解决方案,发现不同情境下优先级不同,数据不平衡影响模型正确性,主动学习等策略被广泛应用。

Comments Accepted by the International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24642 2026-04-28 cs.CV 50%

Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

探测CLIP对360度文本和视觉语义的理解

Hai Wang, Xiaochen Yang, Mingzhi Dong, Jing-Hao Xue

机构 * Department of Statistical Science, University College London, UK(伦敦大学统计科学系) School of Mathematics and Statistics, University of Glasgow, UK(格拉斯哥大学数学与统计学学院) Department of Computer Science, University of Bath, UK(巴斯大学计算机科学系)

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨CLIP模型对360度全景图像-文本对语义对齐的评估能力,提出新的评价方法,发现CLIP在处理360度视觉语义时存在局限,并提出LoRA微调框架以提升其理解能力。

Comments Project Page: https://littlewhitesea.github.io/360Semantics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24621 2026-04-28 cs.SE 50%

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions

评估基于大语言模型的软件工程工具:实践、挑战与未来方向

Utku Boran Torun, Veli Karakaya, Ali Babar, Eray Tüzün

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文探讨了基于大语言模型的软件工程工具的评估问题,分析了现有评估方法的局限性,并提出了未来研究方向以提升评估的可靠性与可扩展性。

Comments Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24146 2026-04-28 cs.CV 50%

EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT

EXACT:一种可解释的异常感知视觉基础模型,用于3D胸部CT分析

Xuguang Bai, Mingxuan Liu, Tongxi Song, Yifei Chen, Hongjia Yang, Kasidit Anmahapong, Zihan Li, Ying Zhou, Qiyuan Tian

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) Department of Radiology, Mianyang Central Hospital(绵阳市中心医院放射科) Center for Biomedical Imaging Research, Tsinghua University(清华大学生物医学成像研究中心)

专题命中 安全评测 :trustworthy(abstract)

AI总结 EXACT通过学习空间解析表示,提升3D胸部CT的异常检测与可解释性,优于现有医学基础模型,适用于多疾病诊断和报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23982 2026-04-28 cs.CV 50%

Hierarchical Prototype-based Domain Priors for Multiple Instance Learning in Multimodal Histopathology Analysis

层次化原型域先验用于多实例学习的多模态病理分析

Xuemei Qiu, Dawei Fan, Yebin Huang, Yanping Chen, Lifang Wei

机构 * College of Computer and Information Science, Fujian Agriculture and Forestry University(福建农林大学计算机与信息科学学院) College of Future Technology, Fujian Agriculture and Forestry University(福建农林大学未来技术学院) Digital Fujian Institute of Agricultural Big Data, Fujian Agriculture and Forestry University(福建农业大数据数字福建研究院) Department of Pathology, Clinical Oncology School of Fujian Medical University, and Fujian Cancer Hospital(福建医科大学临床肿瘤学院病理科及福建癌症医院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出HPDP框架,通过引入形态锚定原型系统和正弦位置编码,解决多实例学习中数据驱动黑箱问题,提升病理诊断与预后分析的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 50%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 安全评测 :safety(abstract)

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 50%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 安全评测 :safety(abstract)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV 50%

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

专题命中 安全评测 :alignment(abstract)

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24948 2026-04-28 cs.RO 50%

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training

World-Env: 利用世界模型作为虚拟环境进行VLA后训练

Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) AMap, Alibaba Group(阿里巴巴集团高德地图) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

专题命中 安全评测 :safety(abstract)

AI总结 针对VLA模型在数据稀缺场景下的性能下降问题,提出World-Env框架,通过虚拟仿真器替代真实环境,提升安全性和效率,实现任务完成检测与持续奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23288 2026-04-28 cs.NI 50%

An Agentic Framework for Intent Co-Creation in 6G NaaS: Architecture and Open-Source Model Evaluation

面向6G NaaS的意图共创作代理框架:架构与开源模型评估

Kostis Trantzas, Besiana Agko, Christos Tranoris, Irene Denazi

专题命中 安全评测 :safety(abstract)

AI总结 本文提出面向6G NaaS的意图驱动端到端 orchestration 框架,通过协作意图共创作提升复杂网络环境下的自主性,评估开源大语言模型在高分辨率意图到有效订单转换中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22513 2026-04-27 cs.NI 50%

Benchmarking LLM-Driven Network Configuration Repair

基于大语言模型的网络配置修复基准测试

Ioannis Protogeros, Rufat Asadli, Benjamin Hoffman, Laurent Vanbever

专题命中 安全评测 :safety(abstract)

AI总结 本文提出Cornetto基准测试,用于评估大语言模型在大规模网络配置修复中的功能性和扩展性,发现现有LLM在处理复杂场景时易引入回归问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22319 2026-04-27 cs.HC 50%

Rethinking AI-Mediated Minority Support in Power-Imbalanced Group Decision-Making: From Anonymity To Authenticity

重新思考权力失衡群体决策中的AI辅助少数群体支持:从匿名到真实性

Soohwan Lee, Kyungho Lee

专题命中 安全评测 :safety(abstract)

AI总结 本文探讨AI辅助通信中少数群体支持策略的平衡问题,发现匿名化输入虽提升参与度但降低心理安全,而自主反驳提升满意度并减少边缘化,揭示了匿名性、真实性、自主性和问责之间的权衡及权力不对称的风险。

Comments ACM CHI 2026 Workshop on Restoring Human Authenticity in AI-Mediated Communication (CHI '26 AI-MC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22245 2026-04-27 eess.AS 50%

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

通过时间聆听:为长音频理解实现精确的时间意识

Mingchen Shao, Hang Su, Wenjie Tian, Bingshen Mu, Zhennan Lin, Lichun Fan, Zhenbo Luo, Jian Luan, Lei Xie

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏