arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-02 至 2025-12-02 共收录 30 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2512.01786 2025-12-02 cs.AI cs.LG 81%

Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems

谁评判法官?LLM陪审团即需:构建可信的LLM评估系统

Xiaochuan Li, Ke Wang, Girija Gouda, Shubham Choudhary, Yaqun Wang, Linwei Hu, Joel Vaughan, Freddy Lecue

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM陪审团即需,通过动态学习框架提升LLM评估的可靠性和可扩展性,实验表明其在关键决策中的相关性优于传统方法。

Comments 66 pages, 22 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14469 2025-12-02 cs.CL cs.AI 81%

Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations

大语言模型在混合语言扰动下的归因安全故障

Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar, Sayan Layek, Parag Agrawal, Rima Hazra, Animesh Mukherjee

机构 * Microsoft Corporation(微软公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18008 2025-12-02 cs.CY cs.CL 81%

GermanPartiesQA: Benchmarking Commercial Large Language Models and AI Companions for Political Alignment and Sycophancy

GermanPartiesQA: 对商业大语言模型和AI伴侣在政治倾向和趋炎附势方面的基准测试

Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

机构 * TUM(慕尼黑大学) TUB(慕尼黑大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 GermanPartiesQA研究了六个商业LLMs在政治倾向和趋炎附势方面的表现,揭示了LLMs在生成事实性政党立场上的局限性以及模型特定的意识形态倾向模式。

Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop on LLM Evaluation and the International Monetary Fund's 12th Statistical Forum. GermanPartiesQA Benchmark under https://github.com/janbatzner/germanpartiesqa

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, pp. 330-342

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01080 2025-12-02 cond-mat.mtrl-sci cs.LG 79%

Building Trustworthy AI for Materials Discovery: From Autonomous Laboratories to Z-scores

构建可信的人工智能用于材料发现:从自主实验室到Z分数

Benhour Amirian, Ashley S. Dale, Sergei Kalinin, Jason Hattrick-Simpers

机构 * University of Toronto(多伦多大学) University of Tennessee(田纳西大学) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Schwartz Reisman Institute for Technology and Society(技术与社会斯瓦茨-雷曼研究所)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出GIFTERS框架,用于评估材料发现中AI方法的信任度,强调信任原则和改进方法,以确保AI加速发现的同时符合科学规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01373 2025-12-02 cs.CV 78%

SRAM: Shape-Realism Alignment Metric for No Reference 3D Shape Evaluation

SRAM:无参考3D形状评估的形状现实对齐度量

Sheng Liu, Tianyu Luan, Phani Nuney, Xuelu Feng, Junsong Yuan

专题命中 安全评测 :alignment(title,abstract)

AI总结 SRAM提出了一种基于大型语言模型的无参考3D形状评估度量,通过网格编码和现实感解码器实现与人类感知的对齐,优于现有方法并具有良好的泛化能力。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00142 2025-12-02 cs.CR cs.AI q-fin.CP q-fin.GN 74%

DeFi TrustBoost: Blockchain and AI for Trustworthy Decentralized Financial Decisions

去中心化金融信任提升:区块链与人工智能用于可信的去中心化金融决策

Swati Sachan, Dale S. Fickett

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 该研究提出一种结合区块链与可解释人工智能的去中心化金融信任提升框架,旨在解决贷款审批中的信任问题,并通过防篡改审计和数据存储策略提升监管合规性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01191 2025-12-02 cs.CL 70%

Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks

通用大语言模型在医疗基准测试中优于临床工具

Krithik Vishwanath, Mrigayu Ghosh, Anton Alyakin, Daniel Alexander Alber, Yindalon Aphinyanaphongs, Eric Karl Oermann

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 通用大语言模型在医疗基准测试中表现优于临床工具,揭示了临床AI系统在某些关键能力上的不足。

Comments 17 pages, 4 figures (2 regular, 2 supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00019 2025-12-02 cs.RO cs.AI cs.CV 70%

A Comprehensive Survey on Surgical Digital Twin

外科数字孪生的全面综述

Afsah Sharaf Khan, Falong Fan, Doohwan DH Kim, Abdurrahman Alshareef, Dong Chen, Justin Kim, Ernest Carter, Bo Liu, Jerzy W. Rozenblit, Bernard Zeigler

机构 * IEEE

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文综述了外科数字孪生的技术现状与挑战,提出分类方法并识别了验证、安全性和数据治理等开放问题,旨在推动其在临床中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00656 2025-12-02 cs.CL cs.CY 66%

Sycophancy Claims about Language Models: The Missing Human-in-the-Loop

语言模型中的趋炎附势主张:缺失的人工智能循环

Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

机构 * Weizenbaum Institute(韦岑鲍姆研究所) Technical University Berlin(柏林技术大学) Technical University Munich(慕尼黑技术大学)

专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.CY

AI总结 本文探讨了大型语言模型中趋炎附势现象的测量挑战,提出五个核心操作化定义,并指出当前研究缺乏对人类感知的评估,为未来研究提供建议。

Comments NeurIPS 2025 Workshop on LLM Evaluation and ICLR 2025 Workshop on Bi-Directional Human-AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01119 2025-12-02 cs.LG cs.AI 62%

World Model Robustness via Surprise Recognition

通过惊喜识别提升世界模型鲁棒性

Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22338 2025-12-02 cs.CL cs.AI 62%

Advancing Natural Language Formalization to First Order Logic with Fine-tuned LLMs

通过微调LLMs推进自然语言形式化到一阶逻辑

Felix Vossel, Till Mossakowski, Björn Gehrke

机构 * Osnabrück University(奥斯纳布鲁克大学) University of Zurich(苏黎世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调LLMs提升自然语言到一阶逻辑的转换性能,实验显示谓词可用性显著提升模型表现,T5模型优于大解码器-only模型,并能泛化至未见逻辑论证。

Comments 15 pages, 7 tables, accepted at the International Joint Conference on Learning & Reasoning (IJCLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17442 2025-12-02 cs.CL cs.AI 62%

Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring

Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能

Shiting Chen, Zijian Zhao, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00046 2025-12-02 cs.CL cs.AI 62%

Text Annotation via Inductive Coding: Comparing Human Experts to LLMs in Qualitative Data Analysis

通过归纳编码进行文本标注:在定性数据分析中比较人类专家与大语言模型

Angelina Parfenova, Andreas Marfurt, Alexander Denzler, Juergen Pfeffer

机构 * Lucerne University of Applied Sciences and Arts(卢塞恩应用科学大学) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了人类专家与大语言模型在定性数据分析中的表现,发现人类在处理复杂句子时表现优异,而LLMs在简单句子上表现更佳。

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12899 2025-12-02 cs.SE cs.CL cs.LG 62%

A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation

基于语义的优化方法用于修复大语言模型:代码生成的案例研究

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STAR方法,通过基于语义的优化修复大语言模型,提升代码生成的准确性和效率。

Comments 13 pages, 6 figure, 8 tables, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08906 2025-12-02 cs.CV cs.AI cs.CL cs.MM 62%

Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation

Prompt-OT: 一种用于视觉-语言模型适应中知识保留的最优传输正则化范式

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Hao Wang, Huayu Li, Haiyu Wu, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Arizona(亚利桑那大学) University of Notre Dame(圣母大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Prompt-OT通过最优传输正则化提升视觉-语言模型在知识保留和跨领域适应中的性能

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01958 2025-12-02 cs.AI 57%

Learned-Rule-Augmented Large Language Model Evaluators

学习规则增强的大语言模型评估器

Jie Meng, Jin Mao

机构 * Wuhan University(武汉大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出规则增强的LLM评估器,通过规则蒸馏和强化学习提升评估器的泛化能力与一致性,适用于多种评估场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01591 2025-12-02 cs.LG q-bio.NC 57%

Scaling and context steer LLMs along the same computational path as the human brain

按计算路径扩展和引导大语言模型,使其与人脑一致

Joséphine Raugel, Stéphane d'Ascoli, Jérémy Rapin, Valentin Wyart, Jean-Rémi King

机构 * Meta AI Laboratoire de Neurosciences Cognitives et Computationnelles (Inserm U960)(神经认知与计算实验室) Ecole Normale Supérieure - PSL(巴黎高等师范学院 - PSL)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究通过分析人脑和LLM的表示对齐性,发现两者在计算顺序上一致,但受模型大小和上下文长度影响。

Journal ref Neurips Proceedings 2025 - Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00837 2025-12-02 cs.LG 57%

IberFire -- a detailed creation of a spatio-temporal dataset for wildfire risk assessment in Spain

IberFire -- 一个用于西班牙野火风险评估的时空数据集的详细创建

Julen Erzibengoa, Meritxell Gómez-Omella, Izaro Goienetxea

机构 * Calvo Tekniker(Calvo技术员) Tekniker EHU(埃斯库德大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 IberFire是一个高分辨率的西班牙野火风险评估时空数据集,整合了120个特征,支持机器学习和深度学习建模,促进火灾预防和土地管理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01452 2025-12-02 cs.AI 57%

Automated Risk-of-Bias Assessment of Randomized Controlled Trials: A First Look at a GEPA-trained Programmatic Prompting Framework

随机对照试验风险偏误自动评估:一种基于GEPA训练的程序化提示框架初探

Lingbo Li, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 GEPA通过结构化优化生成一致的提示,提升随机对照试验偏误风险评估的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01419 2025-12-02 cs.CV cs.AI 57%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01174 2025-12-02 cs.CL 57%

DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks

DrawingBench:通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力

Hyunjun Kim, Sooyoung Ryu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 DrawingBench通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力,揭示了模型在复杂场景中的表现及外部监督的重要性。

Comments AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20729 2025-12-02 cs.AI cs.HC cs.MA 57%

Robust, Observable, and Evolvable Agentic Systems Engineering: A Principled Framework Validated via the Fairy GUI Agent

鲁棒、可观测和可进化的代理系统工程:一种经过Fairy GUI代理验证的原则性框架

Jiazheng Sun, Ruimeng Yang, Xu Han, Jiayang Niu, Mingxuan Li, Te Yang, Yongyong Lu, Xin Peng

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种原则性框架,通过Fairy GUI代理验证,解决了代理系统在鲁棒性、可观测性和可进化性方面的不足,提供了可维护和可扩展的代理AI系统设计方法。

Comments 50 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07993 2025-12-02 cs.CV cs.AI eess.IV q-bio.NC 57%

Multigranular Evaluation for Brain Visual Decoding

多粒度评估用于脑视觉解码

Weihao Xia, Cengiz Oztireli

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出BASIC框架,通过多粒度评估方法提升脑视觉解码的评估精度与解释性。

Comments AAAI 2026 (Oral). Code: https://github.com/weihaox/BASIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00134 2025-12-02 cs.SE cs.AI 57%

Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation

Asm2SrcEval: 评估大型语言模型在汇编到源代码翻译中的性能

Parisa Hamedi, Hamed Jelodar, Samita Bai, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) University of New Brunswick(新不伦瑞克大学) Faculty of Computer Science(计算机科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Asm2SrcEval基准,评估五种先进大语言模型在汇编到源代码翻译任务中的性能,揭示模型在文本相似性、流畅性和效率上的权衡,为程序翻译的准确性和效率研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00049 2025-12-02 cs.RO cs.AI 57%

Socially aware navigation for mobile robots: a survey on deep reinforcement learning approaches

面向移动机器人的社会感知导航:深度强化学习方法的综述

Ibrahim Khalil Kabir, Muhammad Faizan Mysorewala

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综述了深度强化学习在社会感知导航中的应用,分析了关键技术和挑战,提出未来需结合多种方法并建立平衡的评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 50%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 安全评测 :alignment(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 50%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 50%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 安全评测 :trustworthy(abstract)

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19480 2025-12-02 cs.CV 50%

Learning by Aligning 2D Skeleton Sequences and Multi-Modality Fusion

通过对齐2D骨骼序列和多模态融合进行学习

Quoc-Huy Tran, Muhammad Ahmed, Murad Popattia, M. Hassan Ahmed, Andrey Konin, M. Zeeshan Zia

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出通过2D骨骼热图和多模态融合提升时间视频对齐的自监督学习方法,实现更高的准确性和鲁棒性。

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 50%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏