arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-24 至 2026-02-24 共收录 89 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 29 篇

2602.18583 2026-02-24 cs.CL cs.AI cs.LG 67%

Luna-2: Scalable Single-Token Evaluation with Small Language Models

Luna-2:基于小语言模型的可扩展单令牌评估

Vatsal Goel, Rishon Dsouza, Nikhil Ega, Amey Ramesh Rambatla, Rob Friel, Shuai Shao, Yash Sheth

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02094 2026-02-24 cs.LG cs.CY stat.AP 62%

Crash Severity Risk Modeling Strategies under Data Imbalance

在数据不平衡情况下工作区碰撞严重性风险建模策略

Abdullah Al Mamun, Abyad Enan, Debbie A. Indah, Judith Mwakalonge, Gurcan Comert, Mashrur Chowdhury

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

AI总结 本研究探讨了在数据不平衡情况下,利用DMI特征选择和不同模型提升HS碰撞预测性能的方法。

Comments This second revised version has been resubmitted to the Transportation Research Record: Journal of the Transportation Research Board after addressing the reviewers' comments and is currently awaiting the final decision

Journal ref Transportation Research Record (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19584 2026-02-24 cs.LG cs.AI 62%

Interpolation-Driven Machine Learning Approaches for Plume Shine Dose Estimation: A Comparison of XGBoost, Random Forest, and TabNet

基于插值驱动的机器学习方法用于烟云闪烁剂量估计:XGBoost、随机森林和TabNet的比较

Biswajit Sadhu, Kalpak Gupte, Trijit Sadhu, S. Anand

机构 * Health Physics Division, Health Safety \& Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India Birla Institute of Technology And Science, Pilani, Rajasthan – 333031, India Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于插值驱动的机器学习方法,比较了XGBoost、随机森林和TabNet在烟云闪烁剂量估计中的性能,发现XGBoost在预测准确性上表现最佳。

Comments 28 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14488 2026-02-24 cs.CL cs.AI 62%

BETA-Labeling for Multilingual Dataset Construction in Low-Resource IR

BETA-标注用于低资源信息检索中多语言数据集构建

Md. Najib Hasan, Mst. Jannatun Ferdous Rain, Fyad Mohammed, Nazmul Siddique

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BETA-标注框架构建低资源语言信息检索数据集,探讨跨语言数据集重用的可行性和风险,揭示语言依赖性偏差对数据集可靠性的影响。

Comments This work was submitted without the consent of my current adviser. Additionally, it overlaps with my unpublished research work. In order to avoid potential academic and authorship conflicts, I am requesting withdrawal of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18891 2026-02-24 cs.CY cs.AI cs.HC 62%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18462 2026-02-24 cs.CY cs.AI 62%

Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents

评估基于人设的大型语言模型作为合成调查受访者可靠性

Erika Elizabeth Taday Morocho, Lorenzo Cima, Tiziano Fagni, Marco Avvenuti, Stefano Cresci

机构 * IIT-CNR, University of Pisa(IIT-CNR与比萨大学) University of Florence(佛罗伦萨大学) University of Pisa(比萨大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文评估了基于人设的LLM作为合成调查受访者可靠性,发现多属性提示可能引入偏差,影响子群体的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18460 2026-02-24 cs.CY cs.AI cs.HC 62%

The Doctor Will (Still) See You Now: On the Structural Limits of Agentic AI in Healthcare

医生还会见你:论代理AI在医疗领域的结构性限制

Gabriela Aránguiz Dias, Kiana Jafari, Allie Griffith, Carolina Aránguiz Dias, Grace Ra Kim, Lana Saadeddin, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Florida(佛罗里达大学) Montclair State University(蒙特克莱尔州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了代理AI在医疗领域应用中的结构性限制,指出技术期望、商业激励和临床约束的交汇对患者安全和责任归属产生实质性影响。

Comments 17 pages, 3 pages of appendix, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18456 2026-02-24 cs.CY cs.AI cs.HC 62%

Beyond single-channel agentic benchmarking

超越单一通道代理基准测试

Nelu D. Radpour

机构 * Florida State University(佛罗里达州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。

Comments 8 pages; 1 figure; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18450 2026-02-24 cs.CL cs.IT cs.LG math.IT 62%

Asymptotic Semantic Collapse in Hierarchical Optimization

层次优化中的渐近语义崩溃

Faruk Alpay, Bugra Kilictas

机构 * Department of Computer Engineering, Bahçeşehir University(计算机工程系,巴切希尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示了层次优化中语义逐渐趋同的现象,通过数学模型和实验验证了语义状态收敛及信息熵消失的特性。

Comments 23 pages, 2 figures. Includes a dataset-free benchmark with full metric reporting

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19629 2026-02-24 cs.HC cs.AI 57%

Cooperation After the Algorithm: Designing Human-AI Coexistence Beyond the Illusion of Collaboration

算法之后的合作:超越协作幻觉的人机共存设计

Tatia Codreanu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出人机共存的制度框架,通过六个设计原则和三个政策工具,构建可持续的可问责合作机制。

Comments 11 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17433 2026-02-24 cs.CY 57%

Preserving Historical Truth: Detecting Historical Revisionism in Large Language Models

守护历史真实:检测大语言模型中的历史修正主义

Francesco Ortu, Joeun Yook, Punya Syon Pandey, Keenan Samway, Bernhard Schölkopf, Alberto Cazzaniga, Rada Mihalcea, Zhijing Jin

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 该研究提出HistoricalMisinfo数据集,用于评估大语言模型在面对历史修正主义请求时的鲁棒性及事实准确性。

Comments Accepted at IASEAI 2026, non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14322 2026-02-24 cs.LG cs.LO 57%

Conformal Signal Temporal Logic for Robust Reinforcement Learning Control: A Case Study

符合信号时间逻辑用于鲁棒强化学习控制:一个案例研究

Hani Beirami, M M Manjurul Islam

机构 * ICASSP 2026

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出一种符合STL的屏蔽,用于增强强化学习在航空航天中的鲁棒性和安全性,通过实验验证其在复杂环境下的有效性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 57%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18650 2026-02-24 cs.MA cs.AI cs.IR 57%

NutriOrion: A Hierarchical Multi-Agent Framework for Personalized Nutrition Intervention Grounded in Clinical Guidelines

NutriOrion:一种基于临床指南的个性化营养干预分层多智能体框架

Junwei Wu, Runze Yan, Hanqi Luo, Darren Liu, Minxiao Wang, Kimberly L. Townsend, Lydia S. Hartwig, Derek Milketinas, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Texas Woman's University(德克萨斯女子大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 NutriOrion通过分层多智能体框架实现个性化营养干预,结合多目标优先级算法和安全约束机制,有效解决多病共存患者的饮食需求冲突与临床有效性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18623 2026-02-24 cs.HC cs.AI 57%

Finding the Signal in the Noise: An Exploratory Study on Assessing the Effectiveness of AI and Accessibility Forums for Blind Users' Support Needs

在噪声中寻找信号:对评估AI和可及性论坛对盲人用户支持需求有效性探索性研究

Satwik Ram Kodandaram, Jiawei Zhou, Xiaojun Bi, IV Ramakrishnan, Vikas Ashok

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过研究盲人用户与论坛和生成式AI工具的互动,发现其在信息过载和可靠性方面的问题,并提出改进辅助资源可靠性的设计方法。

Comments 20 pages incl. references, 5 figures. Full paper submission to CHI 2026. IRB-approved semi-structured interview study with 14 blind participants

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18437 2026-02-24 cs.IR cs.AI 57%

FineRef: Fine-Grained Error Reflection and Correction for Long-Form Generation with Citations

FineRef: 长形式生成中基于细粒度的错误反射与纠正方法

Yixing Peng, Licheng Zhang, Shancheng Fang, Yi Liu, Peijian Gu, Quan Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 FineRef通过细粒度错误反射与纠正框架,提升长形式生成中引用准确性与回答质量,实验显示其在多个指标上优于现有模型。

Comments 9 pages, 4figures, AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 57%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20137 2026-02-24 cs.CV 50%

Do Large Language Models Understand Data Visualization Rules?

大语言模型理解数据可视化规则吗?

Martin Sinnona, Valentin Bonas, Emmanuel Iarussi, Viviana Siless

机构 * Universidad Torcuato Di Tella(托科托迪特拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文评估了大语言模型在数据可视化规则检测中的性能,发现其在基本规则上表现良好,但在复杂规则上存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17258 2026-02-24 cs.CV 50%

FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding

FineVAU: 一种新的细粒度视频异常理解对齐基准

João Pereira, Vasco Lopes, João Neves, David Semedo

专题命中 安全评测 :alignment(abstract)

AI总结 FineVAU提出了一种新的视频异常理解基准,通过引入FVScore和FineW3数据集,提升对异常事件的细粒度和领域特定理解,解决现有评估方法与人类感知不一致的问题。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11035 2026-02-24 cs.HC 50%

SusBench: An Online Benchmark for Evaluating Dark Pattern Susceptibility of Computer-Use Agents

SusBench: 一个用于评估计算机使用代理对暗模式易感性的在线基准

Longjie Guo, Chenjie Yuan, Mingyuan Zhong, Robert Wolfe, Ruican Zhong, Yue Xu, Bingbing Wen, Hua Shen, Lucy Lu Wang, Alexis Hiniker

专题命中 安全评测 :trustworthy(abstract)

AI总结 SusBench通过构建真实暗模式评估CUAs对操纵性界面的易感性,发现人类和代理对预选、误导性措辞和隐藏信息等暗模式特别敏感。

Comments Accepted as a full paper to IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18643 2026-02-24 q-bio.QM 50%

Project Hermes: A Model-Agnostic Validation Layer for Wearable Health Prediction Systems

Project Hermes: 一种面向可穿戴健康预测系统的模型无关验证层

Richik Chakraborty

专题命中 安全评测 :trustworthy(abstract)

AI总结 Project Hermes通过模型无关的验证层,有效降低健康预测系统的假阳性率,提升临床信号的验证准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18500 2026-02-24 cs.CV cs.ET cs.HC 50%

Scaling Ultrasound Volumetric Reconstruction via Mobile Augmented Reality

通过移动增强现实实现超声体积重建的扩展

Kian Wei Ng, Yujia Gao, Deborah Khoo, Ying Zhen Tan, Chengzheng Mao, Haojie Cheng, Andrew Makmur, Kee Yuan Ngiam, Serene Goh, Eng Tat Khoo

机构 * National University Health System, Singapore(新加坡国家大学医疗系统) College of Design and Engineering, National University of Singapore, Singapore(新加坡国立大学设计与工程学院)

专题命中 安全评测 :safety(abstract)

AI总结 MARVUS通过移动增强现实技术提升超声体积重建的准确性和可重复性,减少用户间差异,提高临床应用的可行性和成本效益。

Comments Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09217 2026-02-24 cs.RO cs.CV stat.AP 50%

Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Rule

感知特性距离:在特定决策规则下动态条件下感知系统稳定性与鲁棒性测量

Boyu Jiang, Liang Shi, Zhengzhi Lin, Lanxin Xiang, Loren Stowe, Feng Guo

机构 * Department of Statistics, Virginia Tech(弗吉尼亚理工学院统计学系) Virginia Tech Transportation Institute(弗吉尼亚理工学院交通研究所)

专题命中 安全评测 :safety(abstract)

AI总结 提出感知特性距离(PCD)作为衡量动态条件下感知系统稳定性与鲁棒性的新指标,并通过SensorRainFall数据集验证其有效性。

Comments This paper has been accepted to the CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 9 篇

2602.18582 2026-02-24 cs.AI cs.CL cs.HC cs.LG 82%

Hierarchical Reward Design from Language: Enhancing Alignment of Agent Behavior with Human Specifications

基于语言的层次奖励设计:通过人类规范增强智能体行为对齐

Zhiqin Qian, Ryan Diaz, Sangwon Seo, Vaibhav Unhelkar

机构 * Rice University(里士大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于语言的层次奖励设计(HRDL)和语言到层次奖励(L2HR)方法,用于通过人类规范增强智能体行为对齐,提升AI任务完成效果和规范遵守程度。

Comments Extended version of an identically-titled paper accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19159 2026-02-24 cs.AI cs.CL cs.LG 75%

Beyond Behavioural Trade-Offs: Mechanistic Tracing of Pain-Pleasure Decisions in an LLM

超越行为权衡:在LLM中疼痛-愉悦决策的机制追溯

Francesca Bianco, Derek Shiller

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了LLM在疼痛-愉悦决策中的内部机制,通过机制追溯揭示了价值信号的表示和因果作用,为AI意识和福利的讨论提供了证据基础。

Comments 24 pages, 8+1 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13033 2026-02-24 cs.CY cs.AI cs.CE cs.CL cs.SI 67%

Buy versus Build an LLM: A Decision Framework for Governments

买还是建一个大语言模型:政府的决策框架

Jiahao Lu, Ziwei Xu, William Tjhi, Junnan Li, Antoine Bosselut, Pang Wei Koh, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) AI Singapore(AI新加坡) Salesforce AI Research(Salesforce AI研究) EPFL(苏黎世联邦理工学院) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出政府在大语言模型决策中应考虑主权、安全、成本等因素的框架,帮助确定购买或建设更适合其需求的方法。

Comments The short version of this document is published as an ACM TechBrief at https://dl.acm.org/doi/epdf/10.1145/3797946, and this document is published as an ACM Technology Policy Council white paper at https://www.acm.org/binaries/content/assets/public-policy/buildvsbuyai.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09905 2026-02-24 cs.LG cs.AI cs.CV 62%

PRISM: Diversifying Dataset Distillation by Decoupling Architectural Priors

PRISM: 通过解耦架构先验来多样化数据集蒸馏

Brian B. Moser, Shalini Sarode, Federico Raue, Stanislav Frolov, Krzysztof Adamkiewicz, Arundhati Shanbhag, Joachim Folz, Tobias C. Nauen, Andreas Dengel

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU Kaiserslautern-Landau(科隆大学(RPTU))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 PRISM通过解耦架构先验提升数据集蒸馏的多样性与性能

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18459 2026-02-24 cs.CY cs.AI 62%

From Bias Mitigation to Bias Negotiation: Governing Identity and Sociocultural Reasoning in Generative AI

从偏见缓解到偏见协商:在生成式AI中治理身份与社会文化推理

Zackary Okun Dunivin, Bingyi Han, John Bollenbocher

机构 * Institute for Social Science, University of Stuttgart(斯图加特大学社会科学研究所) Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) Department of Linguistics, University of Texas Austin TX USA(德克萨斯大学语言学系) Department of Linguistics, University of Texas(德克萨斯大学语言学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出偏见协商作为生成式AI治理身份与社会文化推理的新框架,通过实证研究探讨其在缓解偏见和提升社会公正中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19682 2026-02-24 cs.CY 57%

Beyond the Binary: A nuanced path for open-weight advanced AI

超越二元:开放权重高级AI的细致路径

Bengüsu Özcan, Alex Petropoulos, Max Reddel

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出了一种基于安全评估的分层模型发布方法,旨在解决开放权重高级AI模型在安全性和监管方面的挑战。

Comments This publication was originally designed and optimised for web and published on cfg.eu. Minor formatting differences may appear in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07754 2026-02-24 cs.AI cs.HC 57%

Humanizing AI Grading: Student-Centered Insights on Fairness, Trust, Consistency and Transparency

让AI评分更人性化:以学生为中心的公平性、信任、一致性与透明性洞察

Bahare Riahi, Viktoriia Storozhevykh, Veronica Catete

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本研究通过比较AI与人工评分反馈,探讨学生对AI评分系统在公平性、信任、一致性与透明性方面的看法,并提出人本化AI的设计原则。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏