arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-11 至 2025-12-11 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9 篇

2211.11963 2025-12-11 cs.RO cs.LG 79%

Learning-based social coordination to improve safety and robustness of cooperative autonomous vehicles in mixed traffic

基于学习的社会协调以提高混合交通中协作自动驾驶车辆的安全性和鲁棒性

Rodolfo Valiente, Behrad Toghi, Mahdi Razzaghpour, Ramtin Pedarsani, Yaser P. Fallah

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于多智能体强化学习的方法,通过量化自动驾驶车辆的社会偏好并引入利他主义,提升其在混合交通中与人类驾驶车辆协作的安全性和鲁棒性。

Comments arXiv admin note: substantial text overlap with arXiv:2202.00881

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02603 2025-12-11 eess.AS cs.CL cs.SD 74%

SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation

SEAL:用于带有检索增强生成的语音大语言模型的语音嵌入对齐学习

Chunyu Sun, Bingyu Liu, Zhichao Cui, Junhan Shi, Anbin Qi, Tian-hao Zhang, Dinghao Zhou, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 SEAL通过统一的语音和文本嵌入框架,提升语音大语言模型的检索效率与准确性,减少延迟并增强多模态检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08936 2025-12-11 cs.HC cs.AI cs.CY 73%

A Principle-based Framework for the Development and Evaluation of Large Language Models for Health and Wellness

基于原则的大型语言模型在健康与健身领域开发与评估框架

Brent Winslow, Jacqueline Shreibati, Javier Perez, Hao-Wei Su, Nichole Young-Lin, Nova Hammerquist, Daniel McDuff, Jason Guss, Jenny Vafeiadou, Nick Cain, Alex Lin, Erik Schenck, Shiva Rajagopal, Jia-Ru Chung, Anusha Venkatakrishnan, Amy Armento Lee, Maryam Karimzadehgan, Qingyou Meng, Rythm Agarwal, Aravind Natarajan, Tracy Giest

机构 * Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于原则的框架,用于系统评估LLM在健康与健身领域的应用,通过迭代开发生命周期整合综合评估技术,提升系统安全性和用户反馈的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09552 2025-12-11 cs.CL 57%

Systematic Framework of Application Methods for Large Language Models in Language Sciences

大型语言模型在语言科学中应用方法的系统框架

Kun Sun, Rong Wang

机构 * Tongji University, China(同济大学) University of Tübingen, Germany(图宾根大学) Institute of Natural Language Processing, University of Stuttgart, Germany(斯图加特大学自然语言处理研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出两个系统框架,指导LLMs在语言科学中的战略应用,通过方法选择和多阶段研究流程提升研究的可重复性和科学性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08352 2025-12-11 cs.CV cs.AI 57%

Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception

评估小型视觉-语言模型在距离依赖性交通感知中的表现

Nikos Theodoridis, Tim Brophy, Reenu Mohandas, Ganesh Sistu, Fiachra Collins, Anthony Scanlan, Ciaran Eising

机构 * University of Limerick(利默里克大学) Data Driven Computer Engineering Research Centre(数据驱动计算机工程研究中心) Lero, The Irish Software Research Centre(Lero爱尔兰软件研究中心) Valeo Vision Systems(瓦莱欧视觉系统)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文评估了小型视觉-语言模型在距离依赖性交通感知任务中的表现,发现其在感知能力上显著弱于人类。

Comments Published in IEEE Open Journal of Vehicular Technology. Final version available at: https://ieeexplore.ieee.org/document/11230063

Journal ref IEEE Open Journal of Vehicular Technology, vol. 7, pp. 54-72, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.00881 2025-12-11 cs.RO cs.LG 57%

Robustness and Adaptability of Reinforcement Learning based Cooperative Autonomous Driving in Mixed-autonomy Traffic

基于混合自主交通的强化学习协同自动驾驶的鲁棒性与适应性

Rodolfo Valiente, Behrad Toghi, Ramtin Pedarsani, Yaser P. Fallah

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于多智能体强化学习的方法,用于提高自动驾驶车辆在混合自主交通环境中的鲁棒性和适应性,通过隐式学习人类驾驶行为以优化社会效用和安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 50%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 安全评测 :alignment(abstract)

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09092 2025-12-11 cs.CV 50%

Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining Disasters

解释未见的:多模态视觉-语言推理用于地下矿难中的情境感知

Mizanur Rahman Jewel, Mohamed Elmahallawy, Sanjay Madria, Samuel Frimpong

机构 * Missouri University of Science and Technology(密苏里科学与技术大学) Washington State University(华盛顿州立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出MDSE框架,通过多模态视觉-语言推理提升地下矿难情境感知能力,实现更准确的描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17353 2025-12-11 cs.CE 50%

RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding

RoadBench: 一种用于道路损伤理解的视觉-语言基础模型和基准

Xi Xiao, Yunbei Zhang, Janet Wang, Lin Zhao, Yuxiang Wei, Hengjia Li, Yanshu Li, Xinyuan Song, Xiao Wang, Swalpa Kumar Roy, Hao Xu, Tianyang Wang

专题命中 安全评测 :safety(abstract)

AI总结 RoadBench通过整合视觉与文本信息,提出RoadCLIP模型,显著提升道路损伤识别性能,为基础设施监测提供新基准。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏