arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-02 至 2025-12-02 共收录 79 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2512.01119 2025-12-02 cs.LG cs.AI 62%

World Model Robustness via Surprise Recognition

通过惊喜识别提升世界模型鲁棒性

Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22338 2025-12-02 cs.CL cs.AI 62%

Advancing Natural Language Formalization to First Order Logic with Fine-tuned LLMs

通过微调LLMs推进自然语言形式化到一阶逻辑

Felix Vossel, Till Mossakowski, Björn Gehrke

机构 * Osnabrück University(奥斯纳布鲁克大学) University of Zurich(苏黎世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调LLMs提升自然语言到一阶逻辑的转换性能,实验显示谓词可用性显著提升模型表现,T5模型优于大解码器-only模型,并能泛化至未见逻辑论证。

Comments 15 pages, 7 tables, accepted at the International Joint Conference on Learning & Reasoning (IJCLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17442 2025-12-02 cs.CL cs.AI 62%

Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring

Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能

Shiting Chen, Zijian Zhao, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00046 2025-12-02 cs.CL cs.AI 62%

Text Annotation via Inductive Coding: Comparing Human Experts to LLMs in Qualitative Data Analysis

通过归纳编码进行文本标注:在定性数据分析中比较人类专家与大语言模型

Angelina Parfenova, Andreas Marfurt, Alexander Denzler, Juergen Pfeffer

机构 * Lucerne University of Applied Sciences and Arts(卢塞恩应用科学大学) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了人类专家与大语言模型在定性数据分析中的表现,发现人类在处理复杂句子时表现优异,而LLMs在简单句子上表现更佳。

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12899 2025-12-02 cs.SE cs.CL cs.LG 62%

A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation

基于语义的优化方法用于修复大语言模型:代码生成的案例研究

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STAR方法,通过基于语义的优化修复大语言模型,提升代码生成的准确性和效率。

Comments 13 pages, 6 figure, 8 tables, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08906 2025-12-02 cs.CV cs.AI cs.CL cs.MM 62%

Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation

Prompt-OT: 一种用于视觉-语言模型适应中知识保留的最优传输正则化范式

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Hao Wang, Huayu Li, Haiyu Wu, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Arizona(亚利桑那大学) University of Notre Dame(圣母大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Prompt-OT通过最优传输正则化提升视觉-语言模型在知识保留和跨领域适应中的性能

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01958 2025-12-02 cs.AI 57%

Learned-Rule-Augmented Large Language Model Evaluators

学习规则增强的大语言模型评估器

Jie Meng, Jin Mao

机构 * Wuhan University(武汉大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出规则增强的LLM评估器,通过规则蒸馏和强化学习提升评估器的泛化能力与一致性,适用于多种评估场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01591 2025-12-02 cs.LG q-bio.NC 57%

Scaling and context steer LLMs along the same computational path as the human brain

按计算路径扩展和引导大语言模型,使其与人脑一致

Joséphine Raugel, Stéphane d'Ascoli, Jérémy Rapin, Valentin Wyart, Jean-Rémi King

机构 * Meta AI Laboratoire de Neurosciences Cognitives et Computationnelles (Inserm U960)(神经认知与计算实验室) Ecole Normale Supérieure - PSL(巴黎高等师范学院 - PSL)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究通过分析人脑和LLM的表示对齐性,发现两者在计算顺序上一致,但受模型大小和上下文长度影响。

Journal ref Neurips Proceedings 2025 - Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00837 2025-12-02 cs.LG 57%

IberFire -- a detailed creation of a spatio-temporal dataset for wildfire risk assessment in Spain

IberFire -- 一个用于西班牙野火风险评估的时空数据集的详细创建

Julen Erzibengoa, Meritxell Gómez-Omella, Izaro Goienetxea

机构 * Calvo Tekniker(Calvo技术员) Tekniker EHU(埃斯库德大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 IberFire是一个高分辨率的西班牙野火风险评估时空数据集,整合了120个特征,支持机器学习和深度学习建模,促进火灾预防和土地管理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01452 2025-12-02 cs.AI 57%

Automated Risk-of-Bias Assessment of Randomized Controlled Trials: A First Look at a GEPA-trained Programmatic Prompting Framework

随机对照试验风险偏误自动评估:一种基于GEPA训练的程序化提示框架初探

Lingbo Li, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 GEPA通过结构化优化生成一致的提示,提升随机对照试验偏误风险评估的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01419 2025-12-02 cs.CV cs.AI 57%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01174 2025-12-02 cs.CL 57%

DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks

DrawingBench:通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力

Hyunjun Kim, Sooyoung Ryu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 DrawingBench通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力,揭示了模型在复杂场景中的表现及外部监督的重要性。

Comments AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20729 2025-12-02 cs.AI cs.HC cs.MA 57%

Robust, Observable, and Evolvable Agentic Systems Engineering: A Principled Framework Validated via the Fairy GUI Agent

鲁棒、可观测和可进化的代理系统工程:一种经过Fairy GUI代理验证的原则性框架

Jiazheng Sun, Ruimeng Yang, Xu Han, Jiayang Niu, Mingxuan Li, Te Yang, Yongyong Lu, Xin Peng

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种原则性框架,通过Fairy GUI代理验证,解决了代理系统在鲁棒性、可观测性和可进化性方面的不足,提供了可维护和可扩展的代理AI系统设计方法。

Comments 50 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07993 2025-12-02 cs.CV cs.AI eess.IV q-bio.NC 57%

Multigranular Evaluation for Brain Visual Decoding

多粒度评估用于脑视觉解码

Weihao Xia, Cengiz Oztireli

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出BASIC框架,通过多粒度评估方法提升脑视觉解码的评估精度与解释性。

Comments AAAI 2026 (Oral). Code: https://github.com/weihaox/BASIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00134 2025-12-02 cs.SE cs.AI 57%

Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation

Asm2SrcEval: 评估大型语言模型在汇编到源代码翻译中的性能

Parisa Hamedi, Hamed Jelodar, Samita Bai, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) University of New Brunswick(新不伦瑞克大学) Faculty of Computer Science(计算机科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Asm2SrcEval基准,评估五种先进大语言模型在汇编到源代码翻译任务中的性能,揭示模型在文本相似性、流畅性和效率上的权衡,为程序翻译的准确性和效率研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00049 2025-12-02 cs.RO cs.AI 57%

Socially aware navigation for mobile robots: a survey on deep reinforcement learning approaches

面向移动机器人的社会感知导航:深度强化学习方法的综述

Ibrahim Khalil Kabir, Muhammad Faizan Mysorewala

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综述了深度强化学习在社会感知导航中的应用,分析了关键技术和挑战,提出未来需结合多种方法并建立平衡的评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 50%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 安全评测 :alignment(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 50%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 50%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 安全评测 :trustworthy(abstract)

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19480 2025-12-02 cs.CV 50%

Learning by Aligning 2D Skeleton Sequences and Multi-Modality Fusion

通过对齐2D骨骼序列和多模态融合进行学习

Quoc-Huy Tran, Muhammad Ahmed, Murad Popattia, M. Hassan Ahmed, Andrey Konin, M. Zeeshan Zia

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出通过2D骨骼热图和多模态融合提升时间视频对齐的自监督学习方法,实现更高的准确性和鲁棒性。

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 50%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 9 篇

2507.08068 2025-12-02 cs.LG 79%

Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions

分位数奖励策略优化:与点估计回归和精确分区函数对齐

Simon Matrenok, Skander Moalla, Caglar Gulcehre

机构 * CLAIRE, EPFL(CLAIRE,瑞士联邦理工学院)

专题命中 AI治理与伦理 :alignment(title);DPO(abstract);分类 cs.LG

AI总结 QRPO通过分位数奖励实现点绝对奖励学习,保留DPO的简单性和离线适用性,同时提升在聊天和编码任务中的性能。

Comments 58 pages, NeurIPS2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19362 2025-12-02 cs.CV cs.AI cs.CL cs.CY cs.LG 70%

LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences

LOTUS: 一种用于从质量到社会偏见和用户偏好的详细图像描述的排行榜

Yusuke Hirota, Boyi Li, Ryo Hachiuma, Yueh-Hua Wu, Boris Ivanovic, Yuta Nakashima, Marco Pavone, Yejin Choi, Yu-Chiang Frank Wang, Chao-Han Huck Yang

机构 * NVIDIA Research(NVIDIA研究)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 LOTUS是一种用于评估详细图像描述质量、偏见和社会偏见的排行榜,通过定制标准满足不同用户偏好,揭示了模型在不同评估标准上的表现差异。

Comments Accepted to ACL 2025. Leaderboard: huggingface.co/spaces/nvidia/lotus-vlm-bias-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00742 2025-12-02 cs.CY cs.AI 62%

On the Regulatory Potential of User Interfaces for AI Agent Governance

关于用户界面在AI代理治理中的调节潜力

K. J. Kevin Feng, Tae Soo Kim, Rock Yuren Pang, Faria Huq, Tal August, Amy X. Zhang

机构 * University of Washington(华盛顿大学) KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学香槟分校)

专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过调节AI代理的用户界面来增强透明性和行为规范,从而在系统和基础设施层面实现治理。

Comments RegML workshop at NeurIPS 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00461 2025-12-02 cs.CY cs.CL 62%

Whose Personae? Synthetic Persona Experiments in LLM Research and Pathways to Transparency

谁的人设?LLM研究中的人设实验及透明化路径

Jan Batzner, Volker Stocker, Bingjun Tang, Anusha Natarajan, Qinhao Chen, Stefan Schmid, Gjergji Kasneci

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨了LLM研究中合成人设实验的代表性与生态效度问题,提出透明化检查表以提升评估的严谨性和实证性。

Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, 343-354

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 57%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00410 2025-12-02 cs.RO cs.AI 57%

Balancing Efficiency and Fairness: An Iterative Exchange Framework for Multi-UAV Cooperative Path Planning

平衡效率与公平:多无人机协作路径规划的迭代交换框架

Hongzong Li, Luwei Liao, Xiangguang Dai, Yuming Feng, Rong Feng, Shiqin Tang

机构 * The Hong Kong University of Science and Technology(香港科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Computer Science and Engineering, Chongqing Three Gorges University(重庆三峡大学计算机科学与工程学院) Chinese Academy of Sciences, New Territories, Hong Kong(中国科学院香港新 Territories 分院) City University of Hong Kong, Kowloon, Hong Kong(香港城市大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出一种迭代交换框架,用于多无人机协作路径规划,通过任务交换和路径细化平衡效率与公平性,实验表明其在总距离和makespan之间取得更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09439 2025-12-02 cs.CY cs.SY eess.SY 57%

Towards Ethical AI in Power Electronics: How Engineering Practice and Roles Must Adapt

迈向电力电子中的伦理AI:工程实践和角色必须如何适应

Fanfan Lin, Peter Wilson, Xinze Li, Alan Mantooth

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨电力电子中AI伦理的重要性,提出四个核心伦理支柱,并呼吁工程师和IEEE推动伦理标准与人才发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01571 2025-12-02 cs.NI 50%

Velocity-Adaptive Access Scheme for Semantic-Aware Vehicular Networks: Joint Fairness and AoI Optimization

面向语义感知车联网的自适应接入方案:公平性与信息年龄优化的联合优化

Xiao Xu, Qiong Wu, Pingyi Fan, Kezhi Wang, Nan Cheng, Wen Chen, Khaled B. Letaief

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出一种面向语义感知车联网的自适应接入方案,通过联合优化公平性与信息年龄,利用顺序凸近似和大语言模型算法提升通信效率与安全性。

Comments This paper has been submitted to IEEE transactions on moblie computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00428 2025-12-02 cs.CV 50%

Recognizing Pneumonia in Real-World Chest X-rays with a Classifier Trained with Images Synthetically Generated by Nano Banana

用Nano Banana生成的合成图像训练分类器以在真实世界胸片中识别肺炎

Jiachuan Peng, Kyle Lam, Jianing Qiu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 利用Nano Banana生成的合成图像训练分类器,实现在真实世界胸片中识别肺炎,取得较高AUROC和AUPR,但存在提示设计和数据对齐的挑战。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏