arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-24 至 2026-02-24 共收录 29 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 29 篇

2602.18729 2026-02-24 cs.CV cs.AI 88%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19614 2026-02-24 cs.SE cs.LG 85%

Workflow-Level Design Principles for Trustworthy GenAI in Automotive System Engineering

汽车系统工程中可信生成式人工智能的工作流级设计原则

Chih-Hong Cheng, Brian Hsuan-Cheng Liao, Adam Molin, Hasan Esen

机构 * Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) DENSO AUTOMOTIVE

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出可信生成式人工智能在汽车系统工程中工作流级设计原则,通过需求增量识别、SysML架构更新及可追溯测试保障安全关键系统工程的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV 78%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(title,abstract)

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18468 2026-02-24 cs.CY cs.CL 73%

The Algorithmic Unconscious: Structural Mechanisms and Implicit Biases in Large Language Models

算法无意识:大型语言模型中的结构机制与隐性偏见

Philippe Boisnard

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨了大型语言模型中结构性机制与隐性偏见,揭示了分词、注意力等机制对偏见的影响,并提出技术诊所框架以促进AI基础设施的批判性利用。

Comments 18 pages, 5 figures, Extended version of a paper presented at the international conference 'Artificial Intelligence and Transformations of Information' (LOGOS/FLSH, Hassan II University of Casablanca, Morocco, December 2025), accepted for publication in LOGOS after double-blind peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 71%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 安全评测 :trustworthy(title)

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19547 2026-02-24 cs.CR 67%

CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents

CIBER:代码解释器代理安全评估的综合基准

Lei Ba, Qinbin Li, Songze Li

专题命中 安全评测 :alignment(abstract);prompt injection(abstract)

AI总结 CIBER提出了一种综合基准,评估代码解释器代理对四种主要对抗性攻击的鲁棒性,揭示了模型架构、对齐和智能水平对安全的影响,以及自然语言伪装和安全极化现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18583 2026-02-24 cs.CL cs.AI cs.LG 67%

Luna-2: Scalable Single-Token Evaluation with Small Language Models

Luna-2:基于小语言模型的可扩展单令牌评估

Vatsal Goel, Rishon Dsouza, Nikhil Ega, Amey Ramesh Rambatla, Rob Friel, Shuai Shao, Yash Sheth

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02094 2026-02-24 cs.LG cs.CY stat.AP 62%

Crash Severity Risk Modeling Strategies under Data Imbalance

在数据不平衡情况下工作区碰撞严重性风险建模策略

Abdullah Al Mamun, Abyad Enan, Debbie A. Indah, Judith Mwakalonge, Gurcan Comert, Mashrur Chowdhury

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

AI总结 本研究探讨了在数据不平衡情况下,利用DMI特征选择和不同模型提升HS碰撞预测性能的方法。

Comments This second revised version has been resubmitted to the Transportation Research Record: Journal of the Transportation Research Board after addressing the reviewers' comments and is currently awaiting the final decision

Journal ref Transportation Research Record (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19584 2026-02-24 cs.LG cs.AI 62%

Interpolation-Driven Machine Learning Approaches for Plume Shine Dose Estimation: A Comparison of XGBoost, Random Forest, and TabNet

基于插值驱动的机器学习方法用于烟云闪烁剂量估计:XGBoost、随机森林和TabNet的比较

Biswajit Sadhu, Kalpak Gupte, Trijit Sadhu, S. Anand

机构 * Health Physics Division, Health Safety \& Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India Birla Institute of Technology And Science, Pilani, Rajasthan – 333031, India Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于插值驱动的机器学习方法,比较了XGBoost、随机森林和TabNet在烟云闪烁剂量估计中的性能,发现XGBoost在预测准确性上表现最佳。

Comments 28 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14488 2026-02-24 cs.CL cs.AI 62%

BETA-Labeling for Multilingual Dataset Construction in Low-Resource IR

BETA-标注用于低资源信息检索中多语言数据集构建

Md. Najib Hasan, Mst. Jannatun Ferdous Rain, Fyad Mohammed, Nazmul Siddique

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BETA-标注框架构建低资源语言信息检索数据集,探讨跨语言数据集重用的可行性和风险,揭示语言依赖性偏差对数据集可靠性的影响。

Comments This work was submitted without the consent of my current adviser. Additionally, it overlaps with my unpublished research work. In order to avoid potential academic and authorship conflicts, I am requesting withdrawal of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18891 2026-02-24 cs.CY cs.AI cs.HC 62%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18462 2026-02-24 cs.CY cs.AI 62%

Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents

评估基于人设的大型语言模型作为合成调查受访者可靠性

Erika Elizabeth Taday Morocho, Lorenzo Cima, Tiziano Fagni, Marco Avvenuti, Stefano Cresci

机构 * IIT-CNR, University of Pisa(IIT-CNR与比萨大学) University of Florence(佛罗伦萨大学) University of Pisa(比萨大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文评估了基于人设的LLM作为合成调查受访者可靠性,发现多属性提示可能引入偏差,影响子群体的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18460 2026-02-24 cs.CY cs.AI cs.HC 62%

The Doctor Will (Still) See You Now: On the Structural Limits of Agentic AI in Healthcare

医生还会见你:论代理AI在医疗领域的结构性限制

Gabriela Aránguiz Dias, Kiana Jafari, Allie Griffith, Carolina Aránguiz Dias, Grace Ra Kim, Lana Saadeddin, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Florida(佛罗里达大学) Montclair State University(蒙特克莱尔州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了代理AI在医疗领域应用中的结构性限制,指出技术期望、商业激励和临床约束的交汇对患者安全和责任归属产生实质性影响。

Comments 17 pages, 3 pages of appendix, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18456 2026-02-24 cs.CY cs.AI cs.HC 62%

Beyond single-channel agentic benchmarking

超越单一通道代理基准测试

Nelu D. Radpour

机构 * Florida State University(佛罗里达州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。

Comments 8 pages; 1 figure; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18450 2026-02-24 cs.CL cs.IT cs.LG math.IT 62%

Asymptotic Semantic Collapse in Hierarchical Optimization

层次优化中的渐近语义崩溃

Faruk Alpay, Bugra Kilictas

机构 * Department of Computer Engineering, Bahçeşehir University(计算机工程系,巴切希尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示了层次优化中语义逐渐趋同的现象,通过数学模型和实验验证了语义状态收敛及信息熵消失的特性。

Comments 23 pages, 2 figures. Includes a dataset-free benchmark with full metric reporting

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19629 2026-02-24 cs.HC cs.AI 57%

Cooperation After the Algorithm: Designing Human-AI Coexistence Beyond the Illusion of Collaboration

算法之后的合作:超越协作幻觉的人机共存设计

Tatia Codreanu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出人机共存的制度框架,通过六个设计原则和三个政策工具,构建可持续的可问责合作机制。

Comments 11 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17433 2026-02-24 cs.CY 57%

Preserving Historical Truth: Detecting Historical Revisionism in Large Language Models

守护历史真实:检测大语言模型中的历史修正主义

Francesco Ortu, Joeun Yook, Punya Syon Pandey, Keenan Samway, Bernhard Schölkopf, Alberto Cazzaniga, Rada Mihalcea, Zhijing Jin

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 该研究提出HistoricalMisinfo数据集,用于评估大语言模型在面对历史修正主义请求时的鲁棒性及事实准确性。

Comments Accepted at IASEAI 2026, non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14322 2026-02-24 cs.LG cs.LO 57%

Conformal Signal Temporal Logic for Robust Reinforcement Learning Control: A Case Study

符合信号时间逻辑用于鲁棒强化学习控制:一个案例研究

Hani Beirami, M M Manjurul Islam

机构 * ICASSP 2026

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出一种符合STL的屏蔽,用于增强强化学习在航空航天中的鲁棒性和安全性,通过实验验证其在复杂环境下的有效性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 57%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18650 2026-02-24 cs.MA cs.AI cs.IR 57%

NutriOrion: A Hierarchical Multi-Agent Framework for Personalized Nutrition Intervention Grounded in Clinical Guidelines

NutriOrion:一种基于临床指南的个性化营养干预分层多智能体框架

Junwei Wu, Runze Yan, Hanqi Luo, Darren Liu, Minxiao Wang, Kimberly L. Townsend, Lydia S. Hartwig, Derek Milketinas, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Texas Woman's University(德克萨斯女子大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 NutriOrion通过分层多智能体框架实现个性化营养干预,结合多目标优先级算法和安全约束机制,有效解决多病共存患者的饮食需求冲突与临床有效性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18623 2026-02-24 cs.HC cs.AI 57%

Finding the Signal in the Noise: An Exploratory Study on Assessing the Effectiveness of AI and Accessibility Forums for Blind Users' Support Needs

在噪声中寻找信号:对评估AI和可及性论坛对盲人用户支持需求有效性探索性研究

Satwik Ram Kodandaram, Jiawei Zhou, Xiaojun Bi, IV Ramakrishnan, Vikas Ashok

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过研究盲人用户与论坛和生成式AI工具的互动,发现其在信息过载和可靠性方面的问题,并提出改进辅助资源可靠性的设计方法。

Comments 20 pages incl. references, 5 figures. Full paper submission to CHI 2026. IRB-approved semi-structured interview study with 14 blind participants

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18437 2026-02-24 cs.IR cs.AI 57%

FineRef: Fine-Grained Error Reflection and Correction for Long-Form Generation with Citations

FineRef: 长形式生成中基于细粒度的错误反射与纠正方法

Yixing Peng, Licheng Zhang, Shancheng Fang, Yi Liu, Peijian Gu, Quan Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 FineRef通过细粒度错误反射与纠正框架,提升长形式生成中引用准确性与回答质量,实验显示其在多个指标上优于现有模型。

Comments 9 pages, 4figures, AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 57%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20137 2026-02-24 cs.CV 50%

Do Large Language Models Understand Data Visualization Rules?

大语言模型理解数据可视化规则吗?

Martin Sinnona, Valentin Bonas, Emmanuel Iarussi, Viviana Siless

机构 * Universidad Torcuato Di Tella(托科托迪特拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文评估了大语言模型在数据可视化规则检测中的性能,发现其在基本规则上表现良好,但在复杂规则上存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17258 2026-02-24 cs.CV 50%

FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding

FineVAU: 一种新的细粒度视频异常理解对齐基准

João Pereira, Vasco Lopes, João Neves, David Semedo

专题命中 安全评测 :alignment(abstract)

AI总结 FineVAU提出了一种新的视频异常理解基准,通过引入FVScore和FineW3数据集,提升对异常事件的细粒度和领域特定理解,解决现有评估方法与人类感知不一致的问题。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11035 2026-02-24 cs.HC 50%

SusBench: An Online Benchmark for Evaluating Dark Pattern Susceptibility of Computer-Use Agents

SusBench: 一个用于评估计算机使用代理对暗模式易感性的在线基准

Longjie Guo, Chenjie Yuan, Mingyuan Zhong, Robert Wolfe, Ruican Zhong, Yue Xu, Bingbing Wen, Hua Shen, Lucy Lu Wang, Alexis Hiniker

专题命中 安全评测 :trustworthy(abstract)

AI总结 SusBench通过构建真实暗模式评估CUAs对操纵性界面的易感性,发现人类和代理对预选、误导性措辞和隐藏信息等暗模式特别敏感。

Comments Accepted as a full paper to IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18643 2026-02-24 q-bio.QM 50%

Project Hermes: A Model-Agnostic Validation Layer for Wearable Health Prediction Systems

Project Hermes: 一种面向可穿戴健康预测系统的模型无关验证层

Richik Chakraborty

专题命中 安全评测 :trustworthy(abstract)

AI总结 Project Hermes通过模型无关的验证层,有效降低健康预测系统的假阳性率,提升临床信号的验证准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18500 2026-02-24 cs.CV cs.ET cs.HC 50%

Scaling Ultrasound Volumetric Reconstruction via Mobile Augmented Reality

通过移动增强现实实现超声体积重建的扩展

Kian Wei Ng, Yujia Gao, Deborah Khoo, Ying Zhen Tan, Chengzheng Mao, Haojie Cheng, Andrew Makmur, Kee Yuan Ngiam, Serene Goh, Eng Tat Khoo

机构 * National University Health System, Singapore(新加坡国家大学医疗系统) College of Design and Engineering, National University of Singapore, Singapore(新加坡国立大学设计与工程学院)

专题命中 安全评测 :safety(abstract)

AI总结 MARVUS通过移动增强现实技术提升超声体积重建的准确性和可重复性,减少用户间差异,提高临床应用的可行性和成本效益。

Comments Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09217 2026-02-24 cs.RO cs.CV stat.AP 50%

Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Rule

感知特性距离:在特定决策规则下动态条件下感知系统稳定性与鲁棒性测量

Boyu Jiang, Liang Shi, Zhengzhi Lin, Lanxin Xiang, Loren Stowe, Feng Guo

机构 * Department of Statistics, Virginia Tech(弗吉尼亚理工学院统计学系) Virginia Tech Transportation Institute(弗吉尼亚理工学院交通研究所)

专题命中 安全评测 :safety(abstract)

AI总结 提出感知特性距离(PCD)作为衡量动态条件下感知系统稳定性与鲁棒性的新指标,并通过SensorRainFall数据集验证其有效性。

Comments This paper has been accepted to the CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏