arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-08 至 2026-01-08 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2601.03444 2026-01-08 cs.CL cs.AI cs.HC 81%

Grading Scale Impact on LLM-as-a-Judge: Human-LLM Alignment Is Highest on 0-5 Grading Scale

评分尺度对LLM作为裁判的影响:人类与LLM的对齐在0-5评分尺度上最高

Weiyue Li, Minda Zhao, Weixuan Dong, Jiahui Cai, Yuze Wei, Michael Pocress, Yi Li, Wanyan Yuan, Xiaoyue Wang, Ruoyu Hou, Kaiyuan Lou, Wenqi Zeng, Yutong Yang, Yilun Du, Mengyu Wang

机构 * Harvard University(哈佛大学) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) UC San Diego(圣地亚哥大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了评分尺度对LLM作为裁判一致性的影响,发现0-5评分尺度在人类与LLM之间产生最强的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 79%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03783 2026-01-08 cs.CL 70%

HearSay Benchmark: Do Audio LLMs Leak What They Hear?

HearSay基准:音频大语言模型是否泄露所听内容?

Jin Wang, Liang Lin, Kaiwen Luo, Weiliu Wang, Yitian Chen, Moayad Aloqaily, Xuehai Tang, Zhenhong Zhou, Kun Wang, Li Sun, Qingsong Wen

机构 * XDU(北华大学) NTU(国立台湾大学) NCEPU(南京工程大学) BUPT(北京邮电大学) SHU(上海大学) UAEU(阿联酋大学) UCAS-IIE(中国科学院大学国际学院) Squirrel AI

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 HearSay基准研究发现音频大语言模型通过声纹泄露隐私,揭示其固有隐私风险及安全机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03743 2026-01-08 cs.CL cs.AI 62%

O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL

O-Researcher: 通过多智能体蒸馏和智能体强化学习构建开放式深度研究模型

Yi Yao, He Zhu, Piaohong Wang, Jincheng Ren, Xinlong Yang, Qianben Chen, Xiaowan Li, Dingfeng Shi, Jiaxian Li, Qiexiang Wang, Sinuo Wang, Xinpeng Liu, Jiaqi Wu, Minghao Liu, Wangchunshu Zhou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 O-Researcher通过多智能体蒸馏和智能体强化学习,构建开放式深度研究模型,实现开源模型在多个基准上的性能提升。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17394 2026-01-08 cs.CL cs.CV cs.CY 62%

Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?

视觉语言模型是否是跨文化理论思维推理者?

Zabir Al Nazi, GM Shahariar, Md. Abrar Hossain, Wei Peng

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03986 2026-01-08 cs.CL 57%

Benchmark^2: Systematic Evaluation of LLM Benchmarks

Benchmark^2: 大语言模型评估基准的系统性评估

Qi Qian, Chengsong Huang, Jingwen Xu, Changze Lv, Muling Wu, Wenhao Liu, Xiaohua Wang, Zhenghua Wang, Zisu Huang, Muzhao Tian, Jianhan Xu, Kun Hu, He-Da Wang, Yao Hu, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) Xiaohongshu Inc.(小红书公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00224 2026-01-08 cs.CL cs.SE 57%

Talk Less, Verify More: Improving LLM Assistants with Semantic Checks and Execution Feedback

少说多查:通过语义检查和执行反馈改进LLM助手

Yan Sun, Ming Cai, Stanley Kok

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出Q*和Feedback+两种验证技术,通过语义检查和执行反馈提升LLM助手的输出准确性与可靠性。

Comments WITS 2025 (Workshop on Information Technologies and Systems 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12302 2026-01-08 cs.CV cs.CL cs.RO 57%

From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving

从人类意图到动作预测:意图驱动的端到端自动驾驶

Huan Zheng, Yucheng Zhou, Tianyi Yan, Jiayi Su, Hongjun Chen, Dubing Chen, Xingtai Gui, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研究院有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出意图驱动的端到端自动驾驶框架,通过引入新的评估协议和两种解决方案范式,提升自动驾驶对高层次人类意图的理解和实现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07198 2026-01-08 cs.CV cs.CL 57%

Generating Storytelling Images with Rich Chains-of-Reasoning

通过丰富的推理链生成叙事图像

Xiujie Song, Qi Jia, Shota Watanabe, Xiaoyi Pang, Ruijie Chen, Mengyue Wu, Kenny Q. Zhu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) East China University of Technology, China(东华大学,中国) University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 57%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17118 2026-01-08 cs.CL 57%

After Retrieval, Before Generation: Enhancing the Trustworthiness of Large Language Models in Retrieval-Augmented Generation

检索后,生成前:增强检索增强生成中大型语言模型的可信度

Xinbang Dai, Huikang Hu, Yuncheng Hua, Jiaqi Li, Yongrui Chen, Rihui Jin, Nan Hu, Guilin Qi

机构 * Southeast University(东南大学) University of New South Wales(新南威尔士大学) Noah’s Ark Lab(诺亚实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 BRIDGE框架通过动态确定响应策略,提升检索增强生成中大型语言模型的可信度,实验显示其在准确性上优于基线方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03780 2026-01-08 cs.SE 50%

Assessing and Improving the Representativeness of Code Generation Benchmarks Using Knowledge Units (KUs) of Programming Languages -- An Empirical Study

基于编程语言知识单元(KUs)评估和改进代码生成基准的代表性——一项实证研究

Md Ahasanuzzaman, Bram Adams, Emad Fallahzadeh, Gustavo A. Oliva, Ahmed E. Hassan

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过分析编程语言知识单元(KUs)的覆盖情况,提出基于提示的框架改进代码生成基准的代表性,从而更准确评估LLM的代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01217 2026-01-08 eess.IV cs.CV 50%

Learn2Reg 2024: New Benchmark Datasets Driving Progress on New Challenges

Learn2Reg 2024:新基准数据集推动新挑战的进步

Lasse Hansen, Wiebke Heyer, Christoph Großbröhmer, Frederic Madesta, Thilo Sentker, Wang Jiazheng, Yuxi Zhang, Hang Zhang, Min Liu, Junyi Wang, Xi Zhu, Yuhua Li, Liwen Wang, Daniil Morozov, Nazim Haouchine, Joel Honkamaa, Pekka Marttinen, Yichao Zhou, Zuopeng Tan, Zhuoyuan Wang, Yi Wang, Hongchao Zhou, Shunbo Hu, Yi Zhang, Qian Tao, Lukas Förner, Thomas Wendler, Bailiang Jian, Christian Wachinger, Jin Kim, Dan Ruan, Marek Wodzinski, Henning Müller, Tony C. W. Mok, Xi Jia, Jinming Duan, Mikael Brudfors, Seyed-Ahmad Ahmadi, Yunzheng Zhu, William Hsu, Tina Kapur, William M. Wells, Alexandra Golby, Aaron Carass, Harrison Bai, Yihao Liu, Perrine Paul-Gilloteaux, Joakim Lindblad, Nataša Sladoje, Andreas Walter, Junyu Chen, Reuben Dorent, Alessa Hering, Mattias P. Heinrich

机构 * EchoScout GmbH Institute of Medical Informatics(医学信息学研究所) Institute of Applied Medical Informatics(应用医学信息学研究所) Institute of Computational Neuroscience(计算神经科学研究所) School of Artificial Intelligence and Robotics(人工智能与机器人学院) Cornell University(康奈尔大学) University of Electronic Science and Technology of China(电子科技大学) Mechanical Engineering Department(机械工程系) Harvard Medical School(哈佛医学院) Technical University of Munich(慕尼黑技术大学) Aalto University(阿德莱德大学) Canon Medical Systems (China) Co., Ltd.(佳能医疗系统(中国)有限公司) Smart Medical Imaging, Learning and Engineering (SMLE) Lab(智能医学影像、学习和工程实验室) School of Information Science and Engineering(信息科学与工程学院) Department of Imaging Physics(影像物理系) Clinical Computational Medical Imaging Research(临床计算医学成像研究) TUM Klinikum Rechts der Isar(慕尼黑工业大学医院) University of California(加州大学) AGH University of Krakow(克拉科夫应用科学大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Learn2Reg 2024通过引入新任务和数据集,推动医学图像配准领域在模态多样性和任务复杂性方面的进展。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:034

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09818 2026-01-08 cs.CV 50%

ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video

ViMoNet: 一种多模态视觉-语言框架,用于从运动和视频中理解人类行为

Rajan Das Gupta, Lei Wei, Md Yeasin Rahat, Nafiz Fahad, Abir Ahmed, Liew Tze Hui

机构 * Department of Computer Science, American International University–Bangladesh (AIUB)(美国国际大学-孟加拉国计算机科学系) Faculty of Psychology, Shinawatra University(信武大学心理学系) Faculty of Information Science and Technology, Multimedia University(多媒体大学信息科学与技术系) Department of Information Technology, Washington University of Science & Technology(华盛顿科学与技术大学信息科技系)

专题命中 安全评测 :alignment(abstract)

AI总结 ViMoNet通过整合运动和视频数据,提出多模态视觉-语言框架,有效提升人类行为理解与医疗保健应用潜力。

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏