arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2601.17824 2026-01-27 cs.HC cs.IR 50%

OwlerLite: Scope- and Freshness-Aware Web Retrieval for LLM Assistants

OwlerLite:面向LLM助手的范围和新鲜度感知网络检索

Saber Zerhoudi, Michael Dinzinger, Michael Granitzer, Jelena Mitrovic

专题命中 安全评测 :trustworthy(abstract)

AI总结 OwlerLite通过用户定义的范围和数据新鲜度提升LLM助手的检索可控性和可信度。

Journal ref Proceedings of the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 50%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16456 2026-01-26 cs.SE 50%

RubberDuckBench: A Benchmark for AI Coding Assistants

RubberDuckBench:AI代码助手的基准测试

Ferida Mohammad, Fatma Ayad, Petros Maniatis, Satish Chandra, Elizabeth Dinella

专题命中 安全评测 :trustworthy(abstract)

AI总结 RubberDuckBench通过评估20种LLM在代码问题上的表现,揭示了AI代码助手在一致性、准确性及谎言生成方面的不足,为未来研究提供基准。

Comments LLM4Code @ ICSE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05806 2026-01-26 cs.RO 50%

Modular Autonomy with Conversational Interaction: An LLM-driven Framework for Decision Making in Autonomous Driving

模块化自主性与对话交互:一种基于大语言模型的决策框架用于自动驾驶

Marvin Seegert, Korbinian Moller, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,技术大学慕尼黑工程与设计学院,技术大学慕尼黑)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于大语言模型的自动驾驶决策框架,通过交互层与Autoware集成,实现乘客高级命令的翻译与执行,提升模块化自动驾驶系统的安全性和扩展性。

Comments Submitted to the IEEE Intelligent Vehicles Symposium (IV 2026), Detroit, MI, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18306 2026-01-26 cs.HC 50%

Leveraging Peer, Self, and Teacher Assessments for Generative AI-Enhanced Feedback

利用同伴、自我和教师评估促进生成式AI增强的反馈

Alvaro Becerra, Ruth Cobos

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出在AICoFe系统中整合教师、同伴和自我评估,利用GenAI模型提升反馈效率与教学有效性。

Comments This paper has been accepted as a Full Paper in the main conference of the 2026 IEEE Global Engineering Education Conference (EDUCON)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18695 2026-01-26 cs.CV 50%

A Novel Deep Hybrid Framework with Ensemble-Based Feature Optimization for Robust Real-Time Human Activity Recognition

一种基于集成特征优化的新型深度混合框架用于鲁棒的实时人类活动识别

Wasi Ullah, Yasir Noman Khalid, Saddam Hussain Khan

机构 * Department of Computer Science, HITEC University(计算机科学系,HITEC大学) Department of Information Systems, College of Computer and Information Sciences, Princess Nourah bint Abdulrahman University (PNU)(信息系,计算机与信息科学学院,普里塞斯努拉·本·阿卜杜勒拉赫曼大学) University of Wollongong(沃林戈大学) College of Engineering and Technology, American University of Middle East(工程与技术学院,中东美国大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种基于集成特征优化的新型深度混合框架,通过自适应动态适应度共享和注意力机制提升实时人类活动识别的准确性和鲁棒性。

Comments 35 pages, 25 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15780 2026-01-23 cs.CV 50%

Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video

通过合成视频评估VLMs的情境与空间意识

Pascal Benschop, Justin Dauwels, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一个合成基准,评估VLMs在区分暴力与无害活动、跨视角角色绑定及细粒度轨迹对齐方面的性能,发现其表现仅略高于随机水平,且稳定颜色线索仅部分缓解了问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15366 2026-01-23 cs.CV 50%

AI-Based Culvert-Sewer Inspection

基于AI的涵洞-排水管检查

Christina Thrainer

机构 * Graz University of Technology(格拉茨技术大学) Institute of Visual Computing(视觉计算研究所) Institute of Human-Centred Computing(以人为本计算研究所) Gulf States Center for Environmental Informatics(海湾州环境信息中心)

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出三种基于AI的方法,旨在提高涵洞和排水管道缺陷分割的精度,解决数据稀缺问题。

Comments Masters thesis, University of Technology Graz, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20879 2026-01-23 cs.CV 50%

MultiHuman-Testbench: Benchmarking Image Generation for Multiple Humans

MultiHuman-Testbench: 多人图像生成的基准测试

Shubhankar Borse, Seokeon Choi, Sunghyun Park, Jeongho Kim, Shreya Kadambi, Risheek Garrepalli, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通AI研究)

专题命中 安全评测 :alignment(abstract)

AI总结 MultiHuman-Testbench提出了一种多人类图像生成的基准测试,通过多指标评估提升ID相似性,为研究提供标准化工具。

Comments Accepted at the NeurIPS 2025 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14460 2026-01-22 cs.IR 50%

Trust Me on This: A User Study of Trustworthiness for RAG Responses

相信我:对RAG响应可信度的用户研究

Weronika Łajewska, Krisztian Balog

专题命中 安全评测 :trustworthy(abstract)

AI总结 本研究通过用户实验探讨了不同解释类型如何影响用户对RAG响应的信任度,发现信任受响应清晰度和用户知识影响,而非单纯客观质量。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), March 29-April 2, 2026, Delft, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09660 2026-01-21 astro-ph.CO 50%

Measuring the Dark Matter Self-Interaction Cross-Section with Deep Compact Clustering for Robust Machine Learning Inference

利用深度紧致聚类测量暗物质自相互作用截面以实现稳健的机器学习推断

Ethan Tregidga, David Harvey, Luca Biggio, Felix Vecchi

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究提出利用深度紧致聚类技术,通过分析星系团图像来测量暗物质自相互作用截面,从而实现稳健的机器学习推断。

Comments 11 pages, 7 figures, submitted to A&A

Journal ref A&A 705, A152 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14163 2026-01-21 cs.SE cs.CR 50%

An Empirical Study on Remote Code Execution in Machine Learning Model Hosting Ecosystems

关于机器学习模型托管生态系统中远程代码执行的实证研究

Mohammed Latif Siddiq, Tanzim Hossain Romel, Natalie Sekerak, Beatrice Casey, Joanna C. S. Santos

专题命中 安全评测 :safety(abstract)

AI总结 本研究通过实证分析揭示了机器学习模型托管平台中远程代码执行的安全风险及开发者认知问题,提出安全与可用性平衡的改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13933 2026-01-21 cs.SE 50%

VulnResolver: A Hybrid Agent Framework for LLM-Based Automated Vulnerability Issue Resolution

VulnResolver: 一种基于大语言模型的混合代理框架用于LLM驱动的自动漏洞问题解决

Mingming Zhang, Xu Wang, Jian Zhang, Xiangxin Meng, Jiayi Zhang, Chunming Hu

专题命中 安全评测 :safety(abstract)

AI总结 VulnResolver是一种基于大语言模型的混合代理框架,通过上下文预收集和安全属性分析代理,实现自动化漏洞问题的高效解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13688 2026-01-21 math.OC cs.SY eess.SY 50%

Distributed Coverage Control on Poriferous Surface via Poly-Annulus Conformal Mapping

通过多环共形映射实现多孔表面的分布式覆盖控制

Xun Feng, Chao Zhai

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种基于多环共形映射的分布式覆盖控制方法,通过拓扑等价转换和梯度控制律实现多孔表面的高效覆盖与避障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13452 2026-01-21 cs.MA 50%

A simulation of urban incidents involving pedestrians and vehicles based on Weighted A*

基于加权A*算法的行人与车辆城市事件模拟

Edgar Gonzalez Fernandez

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于加权A*算法的行人与车辆城市事件模拟框架,通过多智能体系统建模,研究环境与行为对碰撞风险和效率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12716 2026-01-21 cs.CR 50%

CellularSpecSec-Bench: A Staged Benchmark for Evidence-Grounded Interpretation and Security Reasoning over 3GPP Specifications

CellularSpecSec-Bench: 一个分阶段的基准,用于基于证据的解释和3GPP规范的保安推理

Ke Xie, Xingyi Zhao, Yiwen Hu, Shuhan Yuan, Tian Xie

专题命中 安全评测 :safety(abstract)

AI总结 CellularSpecSec-Bench通过分阶段基准和统一框架,提升对3GPP规范的解释和安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 50%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03706 2026-01-21 cs.ET 50%

LLM-enhanced Air Quality Monitoring Interface via Model Context Protocol

基于模型上下文协议的LLM增强空气质量监测接口

Yu-Erh Pan, Ayesha Siddika Nipu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于模型上下文协议的LLM增强空气质量监测接口,通过整合实时传感器数据与对话接口,提升环境监测的准确性和用户友好性。

Comments Accepted at 7th International Symposium on Advanced Electrical and Communication Technologies (ISAECT), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11475 2026-01-19 cs.CV 50%

Generative Scenario Rollouts for End-to-End Autonomous Driving

生成场景回放用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Shizhong Han, Hsin-Pai Cheng, Yunxiao Shi, Meysam Sadeghigooghari, Shweta Mahajan, Apratim Bhattacharyya, Litian Liu, Risheek Garrepalli, Thomas Svantesson, Fatih Porikli, Hong Cai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 安全评测 :alignment(abstract)

AI总结 GeRo通过自回归回放策略,结合规划与生成,提升自动驾驶系统的长期推理和多代理规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17004 2026-01-19 cs.CV 50%

A Synthetic Benchmark for Collaborative 3D Semantic Occupancy Prediction in V2X-Enabled Autonomous Driving

用于V2X赋能自动驾驶的协作3D语义占用预测合成基准

Hanlin Wu, Pengfei Lin, Ehsan Javanmardi, Naren Bao, Bo Qian, Hao Si, Manabu Tsukada

机构 * The School of Information Science and Technology, The University of Tokyo(信息科学与技术学系,东京大学) National Institute of Informatics(信息机构)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出用于V2X赋能自动驾驶的协作3D语义占用预测合成基准,通过高分辨率传感器和基线模型提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08241 2026-01-14 cs.CV cs.DC 50%

Improving Zero-shot ADL Recognition with Large Language Models through Event-based Context and Confidence

通过基于事件的上下文和置信度提升零样本ADL识别

Michele Fiori, Gabriele Civitarese, Marco Colussi, Claudio Bettini

机构 * Dept. of Computer Science University of Milan, Milan, Italy(计算机科学系米兰大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出通过基于事件的上下文分割和新的置信度估计方法,改进零样本ADL识别,实验表明其在复杂数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07186 2026-01-13 cs.RO 50%

PROTEA: Securing Robot Task Planning and Execution

PROTEA:保障机器人任务规划与执行的安全性

Zainab Altaweel, Mohaiminul Al Nahian, Jake Juettner, Adnan Siraj Rakin, Shiqi Zhang

专题命中 安全评测 :safety(abstract)

AI总结 PROTEA通过LLM-as-a-Judge机制评估机器人任务计划的安全性,解决维度和历史挑战,提升任务规划系统的鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06779 2026-01-13 cs.CR 50%

CyberLLM-FINDS 2025: Instruction-Tuned Fine-tuning of Domain-Specific LLMs with Retrieval-Augmented Generation and Graph Integration for MITRE Evaluation

CyberLLM-FINDS 2025:基于检索增强生成和图集成的领域特定LLM指令微调方法用于MITRE评估

Vasanth Iyer, Leonardo Bobadilla, S. S. Iyengar

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出了一种基于检索增强生成和图集成的领域特定LLM微调方法,通过STIX威胁情报实现与MITRE ATT&CK技术的对齐,提升网络安全威胁情报分析的准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06728 2026-01-13 cs.RO 50%

Robust Evacuation for Multi-Drone Failure in Drone Light Shows

多无人机故障下的鲁棒疏散

Minhyuk Park, Aloysius K. Mok, Tsz-Chiu Au

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出了一种针对多无人机故障的鲁棒疏散算法,通过预测故障无人机轨迹并利用隐藏无人机实现快速恢复,提高无人机灯光秀的可靠性。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06616 2026-01-13 cs.HC 50%

LLM-Driven Accessible Interface: A Model-Based Approach

基于大语言模型的可及性界面:一种基于模型的方法

Blessing Jerry, Lourdes Moreno, Virginia Francisco, Raquel Hervas

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于模型的框架,利用大语言模型生成个性化、多模态且符合可及性标准的用户界面,通过结构化用户档案、声明性适应规则和验证提示模板,提升医疗场景中对认知和感官需求的可及性支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05606 2026-01-12 cs.MA 50%

Conformity Dynamics in LLM Multi-Agent Systems: The Roles of Topology and Self-Social Weighting

LLM多智能体系统中的从众动力学:拓扑结构与自我-社会权重的作用

Chen Han, Jin Tan, Bohan Yu, Wenzhen Zheng, Xijin Tang

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了LLM多智能体系统中网络拓扑和自我-社会权重对集体决策效率、鲁棒性及失败模式的影响。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11721 2026-01-09 stat.CO 50%

MDAS: A Diagnostic Approach to Assess the Quality of Data Splitting in Machine Learning

MDAS:一种评估机器学习中数据划分质量的诊断方法

Palash Ghosh, Bittu Karmakar, Eklavya Jain, J. Neeraja, Buddhananda Banerjee, Tanujit Chakraborty

专题命中 安全评测 :alignment(abstract)

AI总结 MDAS是一种用于评估机器学习中数据划分质量的诊断方法,通过新的差异度量来检测划分的统计兼容性,提升模型评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03780 2026-01-08 cs.SE 50%

Assessing and Improving the Representativeness of Code Generation Benchmarks Using Knowledge Units (KUs) of Programming Languages -- An Empirical Study

基于编程语言知识单元(KUs)评估和改进代码生成基准的代表性——一项实证研究

Md Ahasanuzzaman, Bram Adams, Emad Fallahzadeh, Gustavo A. Oliva, Ahmed E. Hassan

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过分析编程语言知识单元(KUs)的覆盖情况,提出基于提示的框架改进代码生成基准的代表性,从而更准确评估LLM的代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01217 2026-01-08 eess.IV cs.CV 50%

Learn2Reg 2024: New Benchmark Datasets Driving Progress on New Challenges

Learn2Reg 2024:新基准数据集推动新挑战的进步

Lasse Hansen, Wiebke Heyer, Christoph Großbröhmer, Frederic Madesta, Thilo Sentker, Wang Jiazheng, Yuxi Zhang, Hang Zhang, Min Liu, Junyi Wang, Xi Zhu, Yuhua Li, Liwen Wang, Daniil Morozov, Nazim Haouchine, Joel Honkamaa, Pekka Marttinen, Yichao Zhou, Zuopeng Tan, Zhuoyuan Wang, Yi Wang, Hongchao Zhou, Shunbo Hu, Yi Zhang, Qian Tao, Lukas Förner, Thomas Wendler, Bailiang Jian, Christian Wachinger, Jin Kim, Dan Ruan, Marek Wodzinski, Henning Müller, Tony C. W. Mok, Xi Jia, Jinming Duan, Mikael Brudfors, Seyed-Ahmad Ahmadi, Yunzheng Zhu, William Hsu, Tina Kapur, William M. Wells, Alexandra Golby, Aaron Carass, Harrison Bai, Yihao Liu, Perrine Paul-Gilloteaux, Joakim Lindblad, Nataša Sladoje, Andreas Walter, Junyu Chen, Reuben Dorent, Alessa Hering, Mattias P. Heinrich

机构 * EchoScout GmbH Institute of Medical Informatics(医学信息学研究所) Institute of Applied Medical Informatics(应用医学信息学研究所) Institute of Computational Neuroscience(计算神经科学研究所) School of Artificial Intelligence and Robotics(人工智能与机器人学院) Cornell University(康奈尔大学) University of Electronic Science and Technology of China(电子科技大学) Mechanical Engineering Department(机械工程系) Harvard Medical School(哈佛医学院) Technical University of Munich(慕尼黑技术大学) Aalto University(阿德莱德大学) Canon Medical Systems (China) Co., Ltd.(佳能医疗系统(中国)有限公司) Smart Medical Imaging, Learning and Engineering (SMLE) Lab(智能医学影像、学习和工程实验室) School of Information Science and Engineering(信息科学与工程学院) Department of Imaging Physics(影像物理系) Clinical Computational Medical Imaging Research(临床计算医学成像研究) TUM Klinikum Rechts der Isar(慕尼黑工业大学医院) University of California(加州大学) AGH University of Krakow(克拉科夫应用科学大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Learn2Reg 2024通过引入新任务和数据集,推动医学图像配准领域在模态多样性和任务复杂性方面的进展。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:034

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09818 2026-01-08 cs.CV 50%

ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video

ViMoNet: 一种多模态视觉-语言框架,用于从运动和视频中理解人类行为

Rajan Das Gupta, Lei Wei, Md Yeasin Rahat, Nafiz Fahad, Abir Ahmed, Liew Tze Hui

机构 * Department of Computer Science, American International University–Bangladesh (AIUB)(美国国际大学-孟加拉国计算机科学系) Faculty of Psychology, Shinawatra University(信武大学心理学系) Faculty of Information Science and Technology, Multimedia University(多媒体大学信息科学与技术系) Department of Information Technology, Washington University of Science & Technology(华盛顿科学与技术大学信息科技系)

专题命中 安全评测 :alignment(abstract)

AI总结 ViMoNet通过整合运动和视频数据,提出多模态视觉-语言框架,有效提升人类行为理解与医疗保健应用潜力。

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏