arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-19 至 2026-01-19 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2601.10527 2026-01-19 cs.AI cs.CL cs.CV cs.LG 85%

A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告

Xingjun Ma, Yixu Wang, Hengyuan Xu, Yutao Wu, Yifan Ding, Yunhan Zhao, Zilong Wang, Jiabin Hua, Ming Wen, Jianan Liu, Ranjie Duan, Yifeng Gao, Yingshui Tan, Yunhao Chen, Hui Xue, Xin Wang, Wei Cheng, Jingjing Chen, Zuxuan Wu, Bo Li, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation institute(上海创新研究院) Deakin University(德克萨斯大学) UIUC(伊利诺伊大学香槟分校)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。

Comments 41 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07173 2026-01-19 cs.CL cs.AI cs.CV 81%

Better Language Models Exhibit Higher Visual Alignment

表现更佳的语言模型具有更高的视觉对齐性

Jona Ruthardt, Gertjan J. Burghouts, Serge Belongie, Yuki M. Asano

机构 * Fundamental AI Lab, University of Technology Nuremberg(技术基础人工智能实验室,不莱梅技术大学) Intelligent Imaging, TNO(智能成像,TNO) Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ShareLock 方法,通过融合冻结的视觉和语言模型骨干,提升视觉对齐能力,实现高效跨语言图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11286 2026-01-19 cs.AI 79%

XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making

XChoice: 用于基于LLM的受限选择决策中的可解释性AI-人类对齐评估

Weihong Qi, Fan Huang, Rasika Muralidharan, Jisun An, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 XChoice是一种用于评估基于LLM的受限选择决策中AI-人类对齐的可解释框架,通过机制模型恢复可解释参数以诊断不一致并支持改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09105 2026-01-19 cs.AI cs.CL cs.CV 79%

AviationLMM: A Large Multimodal Foundation Model for Civil Aviation

AviationLMM:民用航空的大规模多模态基础模型

Wenbin Li, Jingling Wu, Xiaoyong Lin. Jing Chen, Cong Chen

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 AviationLMM旨在通过统一民用航空的异构数据流,提升航空安全与效率,推动可信且隐私保护的航空人工智能生态系统发展。

Comments Accepted by 2025 7th International Conference on Interdisciplinary Computer Science and Engineering (ICICSE 2025), Chongqing, China; 9 pages,1 figure,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05879 2026-01-19 cs.HC 71%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 安全评测 :alignment(title)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12537 2026-01-19 cs.CL cs.AI eess.AS 62%

What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study

什么使LLM为中心的语音生成中的良好语音分词器?系统研究

Xiaoran Fan, Zhichao Sun, Yangfan Gao, Jingfei Xiong, Hang Yan, Yifei Cao, Jiajun Sun, Shuo Li, Zhihao Zhang, Zhiheng Xi, Yuhao Zhou, Senjie Jin, Changhao Jiang, Junjie Ye, Ming Zhang, Rui Zheng, Zhenhua Han, Yunke Zhang, Demei Yan, Shaokang Dong, Tao Ji, Tao Gui

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM为中心的语音生成中语音分词器设计的影响,通过引入多令牌预测和说话人感知生成,提升了语音生成的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11039 2026-01-19 cs.SD cs.CL 57%

SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models

SonicBench: 解剖大音频语言模型中的物理感知瓶颈

Yirong Sun, Yanjun Chen, Xin Qiu, Gang Zhang, Hongyu Chen, Daokuan Wu, Chengming Li, Min Yang, Dawei Zhu, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Amazon AGI(亚马逊人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SonicBench通过评估大音频语言模型在物理属性感知上的能力,揭示其在基础听觉理解上的不足,指出瓶颈在于对齐和解码阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10904 2026-01-19 cs.AI 57%

ARC Prize 2025: Technical Report

ARC 2025奖项:技术报告

François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了ARC-AGI-2基准竞赛中精炼循环对AGI进展的作用,分析了当前AI推理的局限性,并预览了ARC-AGI-3的交互推理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15055 2026-01-19 cs.CL 57%

Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory

陷入基准?基于项目反应理论重新思考大语言模型基准测试

Hongli Zhou, Hui Huang, Ziqing Zhao, Lvyuan Han, Huicheng Wang, Kehai Chen, Muyun Yang, Wei Bao, Jian Dong, Bing Xu, Conghui Zhu, Hailong Cao, Tiejun Zhao

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出PSN-IRT框架,用于评估大语言模型基准的有效性,揭示现有基准的测量缺陷,并展示如何构建更符合人类偏好的小型基准。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11475 2026-01-19 cs.CV 50%

Generative Scenario Rollouts for End-to-End Autonomous Driving

生成场景回放用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Shizhong Han, Hsin-Pai Cheng, Yunxiao Shi, Meysam Sadeghigooghari, Shweta Mahajan, Apratim Bhattacharyya, Litian Liu, Risheek Garrepalli, Thomas Svantesson, Fatih Porikli, Hong Cai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 安全评测 :alignment(abstract)

AI总结 GeRo通过自回归回放策略,结合规划与生成,提升自动驾驶系统的长期推理和多代理规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17004 2026-01-19 cs.CV 50%

A Synthetic Benchmark for Collaborative 3D Semantic Occupancy Prediction in V2X-Enabled Autonomous Driving

用于V2X赋能自动驾驶的协作3D语义占用预测合成基准

Hanlin Wu, Pengfei Lin, Ehsan Javanmardi, Naren Bao, Bo Qian, Hao Si, Manabu Tsukada

机构 * The School of Information Science and Technology, The University of Tokyo(信息科学与技术学系,东京大学) National Institute of Informatics(信息机构)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出用于V2X赋能自动驾驶的协作3D语义占用预测合成基准,通过高分辨率传感器和基线模型提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏