arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2602.20759 2026-02-25 cs.CL 57%

Overton Pluralistic Reinforcement Learning for Large Language Models

奥顿多元强化学习用于大语言模型

Yu Fu, Seongho Son, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出OP-GRPO框架,通过强化学习使大语言模型生成多样化响应,提升人类视角覆盖和视角独特性,实验证明其在自然语言推理任务中的优越性能。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20513 2026-02-25 cs.CL 57%

From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility

从性能到目的:一种用于评估大语言模型效用的社技术分类

Gavin Levinson, Keith Feldman

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出LUX框架,用于评估大语言模型在不同应用场景中的效用,涵盖性能、交互、运营和治理四个领域,并提供动态工具支持框架探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07525 2026-02-25 cs.CV cs.AI 57%

EHWGesture -- A dataset for multimodal understanding of clinical gestures

EHWGesture -- 一个用于多模态理解临床手势的数据集

Gianluca Amprimo, Alberto Ancilotto, Alessandro Savino, Fabio Quazzolo, Claudia Ferraris, Gabriella Olmo, Elisabetta Farella, Stefano Di Carlo

机构 * Department of Control and Computer Engineering, Politecnico di Torino(控制与计算机工程系,都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) CNR-IEIIT(意大利国家研究委员会-IEIIT)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 EHWGesture是一个包含五个临床相关手势的多模态视频数据集,用于提升临床手势理解的多模态分析能力。

Comments Accepted at ICCV 2025 Workshop on AI-driven Skilled Activity Understanding, Assessment & Feedback Generation

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01080 2026-02-25 cs.LG cs.PF 57%

Development and Comparative Evaluation of Three Artificial Intelligence Models (NLP, LLM, JEPA) for Predicting Triage in Emergency Departments: A 7-Month Retrospective Proof-of-Concept

三种人工智能模型(NLP、LLM、JEPA)在急诊科分诊中的开发与比较评估:一项7个月的回顾性概念验证

Edouard Lansiaux, Ramy Azzouz, Emmanuel Chazard, Amélie Vromant, Eric Wiel

机构 * Department of Emergency Lille University Hospital(里尔大学医院急诊科) Centre Antipoison, Lille University Hospital(里尔大学医院毒物中心) Department of Public Health, EA 2694 & ULR 2694-METRICS(公共卫生部门,EA 2694及ULR 2694-METRICS) Lille University(里尔大学) Emergency Department Hôpital Pitié-Salpêtrière, AP-HP(皮蒂埃-萨尔佩特里耶医院急诊科,AP-HP)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究评估了三种AI模型在急诊科分诊中的表现,发现基于LLM的URGENTIAPARSE在准确性和预测住院需求方面表现最佳,为提升急诊科患者安全和效率提供了新的方向。

Comments 13 pages, 7 figures, 3 tables

Journal ref 2025:2:1-10 BDCAT '25: Proceedings of the IEEE/ACM 12th International Conference on Big Data Computing, Applications and Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19629 2026-02-24 cs.HC cs.AI 57%

Cooperation After the Algorithm: Designing Human-AI Coexistence Beyond the Illusion of Collaboration

算法之后的合作:超越协作幻觉的人机共存设计

Tatia Codreanu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出人机共存的制度框架,通过六个设计原则和三个政策工具,构建可持续的可问责合作机制。

Comments 11 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17433 2026-02-24 cs.CY 57%

Preserving Historical Truth: Detecting Historical Revisionism in Large Language Models

守护历史真实:检测大语言模型中的历史修正主义

Francesco Ortu, Joeun Yook, Punya Syon Pandey, Keenan Samway, Bernhard Schölkopf, Alberto Cazzaniga, Rada Mihalcea, Zhijing Jin

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 该研究提出HistoricalMisinfo数据集,用于评估大语言模型在面对历史修正主义请求时的鲁棒性及事实准确性。

Comments Accepted at IASEAI 2026, non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14322 2026-02-24 cs.LG cs.LO 57%

Conformal Signal Temporal Logic for Robust Reinforcement Learning Control: A Case Study

符合信号时间逻辑用于鲁棒强化学习控制:一个案例研究

Hani Beirami, M M Manjurul Islam

机构 * ICASSP 2026

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出一种符合STL的屏蔽,用于增强强化学习在航空航天中的鲁棒性和安全性,通过实验验证其在复杂环境下的有效性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 57%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18650 2026-02-24 cs.MA cs.AI cs.IR 57%

NutriOrion: A Hierarchical Multi-Agent Framework for Personalized Nutrition Intervention Grounded in Clinical Guidelines

NutriOrion:一种基于临床指南的个性化营养干预分层多智能体框架

Junwei Wu, Runze Yan, Hanqi Luo, Darren Liu, Minxiao Wang, Kimberly L. Townsend, Lydia S. Hartwig, Derek Milketinas, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Texas Woman's University(德克萨斯女子大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 NutriOrion通过分层多智能体框架实现个性化营养干预,结合多目标优先级算法和安全约束机制,有效解决多病共存患者的饮食需求冲突与临床有效性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18623 2026-02-24 cs.HC cs.AI 57%

Finding the Signal in the Noise: An Exploratory Study on Assessing the Effectiveness of AI and Accessibility Forums for Blind Users' Support Needs

在噪声中寻找信号:对评估AI和可及性论坛对盲人用户支持需求有效性探索性研究

Satwik Ram Kodandaram, Jiawei Zhou, Xiaojun Bi, IV Ramakrishnan, Vikas Ashok

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过研究盲人用户与论坛和生成式AI工具的互动,发现其在信息过载和可靠性方面的问题,并提出改进辅助资源可靠性的设计方法。

Comments 20 pages incl. references, 5 figures. Full paper submission to CHI 2026. IRB-approved semi-structured interview study with 14 blind participants

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18437 2026-02-24 cs.IR cs.AI 57%

FineRef: Fine-Grained Error Reflection and Correction for Long-Form Generation with Citations

FineRef: 长形式生成中基于细粒度的错误反射与纠正方法

Yixing Peng, Licheng Zhang, Shancheng Fang, Yi Liu, Peijian Gu, Quan Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 FineRef通过细粒度错误反射与纠正框架,提升长形式生成中引用准确性与回答质量,实验显示其在多个指标上优于现有模型。

Comments 9 pages, 4figures, AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 57%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17999 2026-02-23 cs.HC cs.AI 57%

Aurora: Neuro-Symbolic AI Driven Advising Agent

Aurora:神经符号AI驱动的建议代理

Lorena Amanda Quincoso Lugones, Christopher Kverne, Nityam Sharadkumar Bhimani, Ana Carolina Oliveira, Agoritsa Polyzou, Christine Lisetti, Janki Bhimani

机构 * Florida International University(佛罗里达国际大学) Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Aurora通过神经符号AI结合检索增强生成、符号推理和课程数据库,实现大规模、可验证的学术建议,提升推荐准确性和效率。

Comments Accepted to 41st ACM/SIGAPP Symposium On Applied Computing. 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17770 2026-02-23 cs.CV cs.LG 57%

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH:解锁野外文本条件手部运动建模的上下文化语言模型

Balamurugan Thambiraja, Omid Taheri, Radek Danecek, Giorgio Becherini, Gerard Pons-Moll, Justus Thies

机构 * Technical University of Darmstadt(德累斯顿技术大学) Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tuebingen(图宾根大学) Tubingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 CLUTCH通过引入3D-HIW数据集和SHIFT架构,提出基于LLM的手部动画系统,提升野外手部运动建模的保真度与泛化能力。

Comments ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13469 2026-02-20 cs.HC cs.AI 57%

How Multimodal Large Language Models Support Access to Visual Information: A Diary Study With Blind and Low Vision People

多模态大语言模型如何支持视障人士获取视觉信息:一项与盲人和低视力人士的日记研究

Ricardo E. Gonzalez Penuela, Crescentia Jung, Sharon Y Lin, Ruiying Hu, Shiri Azenkot

机构 * Cornell University(康奈尔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究探讨了多模态大语言模型如何通过视觉助手技能支持视障人士获取视觉信息,并发现其在实际应用中的表现及改进方向。

Comments 24 pages, 17 figures, 7 tables, appendix section, to appear main track CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17185 2026-02-20 cs.HC cs.AI 57%

The Bots of Persuasion: Examining How Conversational Agents' Linguistic Expressions of Personality Affect User Perceptions and Decisions

说服的机器人:探讨对话代理的语言性人格表达如何影响用户感知和决策

Uğur Genç, Heng Gu, Chadha Degachi, Evangelos Niforatos, Senthil Chandrasegaran, Himanshu Verma

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了对话代理通过语言表达的人格如何影响用户在慈善捐赠中的感知和决策,发现人格特征显著影响用户信任和捐赠行为。

Comments Accepted to be presented at CHI'26 in Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16938 2026-02-20 cs.CL 57%

ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders

ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架

Ofer Meshi, Krisztian Balog, Sally Goldman, Avi Caciularu, Guy Tennenholtz, Jihwan Jeong, Amir Globerson, Craig Boutilier

机构 * Google(谷歌)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21193 2026-02-20 cs.CL 57%

Estonian Native Large Language Model Benchmark

爱沙尼亚原生大语言模型基准

Helena Grete Lillepalu, Tanel Alumäe

机构 * Department of Software Science, Tallinn University of Technology, Estonia(软件科学系,塔林技术大学,爱沙尼亚)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出爱沙尼亚语言的大语言模型基准,通过七个多样化的数据集评估不同模型的性能,结合人类和LLM评判方法,验证了高性能模型在爱沙尼亚语言评估中的有效性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16650 2026-02-19 cs.CE cs.AI 57%

Retrieval Augmented Generation of Literature-derived Polymer Knowledge: The Example of a Biodegradable Polymer Expert System

文献衍生聚合物知识的检索增强生成:生物降解聚合物专家系统的例子

Sonakshi Gupta, Akhlak Mahmood, Wei Xiong, Rampi Ramprasad

机构 * School of Computational Science and Engineering(计算科学与工程学院) Georgia Institute of Technology(佐治亚理工学院) Matmerize, Inc.(Matmerize公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于检索增强生成的聚合物知识系统,通过构建结构化知识图谱和语义向量方法,提升生物降解聚合物领域的文献检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15913 2026-02-19 eess.IV cs.AI cs.CV 57%

Foundation Models for Medical Imaging: Status, Challenges, and Directions

医学影像中的基础模型:现状、挑战与方向

Chuang Niu, Pengwei Wu, Bruno De Man, Ge Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了医学影像中基础模型的现状、挑战与未来方向,强调了通用型模型在跨模态和临床任务中的适应能力及临床应用的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15809 2026-02-18 stat.AP cs.AI 57%

Decision Quality Evaluation Framework at Pinterest

Pinpoint 决策质量评估框架

Yuqi Tian, Robert Paine, Attila Dobi, Kevin O'Sullivan, Aravindh Manickavasagam, Faisal Farooq

机构 * Pinterest

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Pinpoint 提出了一种决策质量评估框架,通过高可信度黄金集和智能采样管道,提升内容安全系统的数据驱动管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15769 2026-02-18 cs.CL 57%

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

ViTaB-A:在视觉表格归因上评估多模态大语言模型

Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 ViTaB-A研究了多模态大语言模型在视觉表格归因中的表现,发现其在证据归因方面存在显著缺陷,影响透明性和可追溯性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15391 2026-02-18 cs.AI 57%

Improving LLM Reliability through Hybrid Abstention and Adaptive Detection

通过混合回避与自适应检测提升大语言模型可靠性

Ankit Sharma, Nachiket Tapas, Jyotiprakash Patra

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于上下文感知的自适应回避框架,通过动态调整安全阈值和级联检测机制,提升大语言模型在安全与效用之间的平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15072 2026-02-18 cs.CV cs.AI 57%

GRAFNet: Multiscale Retinal Processing via Guided Cortical Attention Feedback for Enhancing Medical Image Polyp Segmentation

GRAFNet:通过引导性皮层注意反馈进行多尺度视网膜处理以增强医学图像息肉分割

Abdul Joseph Fofanah, Lian Wen, Alpha Alimamy Kamara, Zhongyi Zhang, David Chen, Albert Patrick Sankoh

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 GRAFNet通过引导性皮层注意反馈模块提升医学图像息肉分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14955 2026-02-17 cs.CL cs.SE 57%

Tool-Aware Planning in Contact Center AI: Evaluating LLMs through Lineage-Guided Query Decomposition

接触中心AI中的工具感知规划:通过 lineage 引导的查询分解评估LLMs

Varun Nathan, Shreyas Guha, Ayush Kumar

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出接触中心AI中的工具感知规划框架,通过lineage引导查询分解评估LLMs,揭示工具理解的不足及简计划的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14721 2026-02-17 cs.AI 57%

WebWorld: A Large-Scale World Model for Web Agent Training

WebWorld: 一个大规模的世界模型用于网络代理训练

Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen Yu, Fei Huang, Junyang Lin, Zuozhu Liu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 WebWorld是一个大规模开放网络模拟器,通过大规模训练实现网络代理的有效训练,展示了在多个领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14675 2026-02-17 cs.CL 57%

Crowdsourcing Piedmontese to Test LLMs on Non-Standard Orthography

众包皮埃蒙特语以测试LLM在非标准正写法上的表现

Gianluca Vico, Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查理大学数学与物理学院形式与应用语言学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 通过众包皮埃蒙特语数据集测试LLM在非标准正写法上的表现,发现分词惩罚但分类性能接近主流语言,翻译结果存在不对称性。

Comments 17 pages, 6 figures, at VarDial20226

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10551 2026-02-17 cs.CV cs.AI 57%

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

C^2ROPE: 3D 大多模态模型推理中的因果连续旋转位置编码

Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, USTC(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, USTC(中国科学技术大学人工智能与数据科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 C^2ROPE通过引入空间-时间连续位置编码和切比雪夫因果掩码,解决3D多模态模型中视觉特征连续性和因果关系建模问题。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13593 2026-02-17 cs.LG stat.AP stat.ML 57%

Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs

校准的预测下界:在大语言模型中时间到不安全采样的预测下界

Hen Davidov, Shai Feldman, Gilad Freidkin, Yaniv Romano

机构 * Department of Computer Science, Technion IIT(计算机科学系) Department of Statistics, University of Oxford(统计系) Department of Electrical and Computer Engineering, Technion IIT(电气与计算机工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于生存分析的校准技术,用于构建大语言模型中时间到不安全采样的预测下界,以提高安全风险评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14160 2026-02-17 cs.AI 57%

Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning

过程监督多智能体强化学习用于可靠的临床推理

Chaeeun Lee, T. Michael Yates, Pasquale Minervini, T. Ian Simpson

机构 * School of Informatics, University of Edinburgh, UK(信息学院,爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种过程监督的多智能体强化学习框架,用于提升基因-疾病有效性校准的临床推理准确性与过程忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏