arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2601.21128 2026-01-30 cs.AI 57%

Beyond a Single Reference: Training and Evaluation with Paraphrases in Sign Language Translation

超越单一参考:在手语翻译中使用同义词进行训练和评估

Václav Javorek, Tomáš Železný, Alessa Carbo, Marek Hrúz, Ivan Gruber

机构 * University of West Bohemia(西波希米亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出通过生成同义词参考提升手语翻译评估的准确性,引入BLEUpara度量标准并验证其与人类判断的一致性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20852 2026-01-29 cs.LG cs.CV 57%

C3Box: A CLIP-based Class-Incremental Learning Toolbox

C3Box: 基于CLIP的类增量学习工具箱

Hao Sun, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 C3Box是一个基于CLIP的类增量学习工具箱,整合了多种CIL方法,提供统一框架和标准化流程,提升持续学习研究的可重复性和实用性。

Comments The code is available at https://github.com/LAMDA-CL/C3Box

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09785 2026-01-29 cs.AI 57%

AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics

AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量

Bakhtawar Ahtisham, Kirk Vanacore, Jinsook Lee, Zhuqian Zhou, Doug Pietrzak, Rene F. Kizilcec

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20757 2026-01-29 cs.CL 57%

Persona Prompting as a Lens on LLM Social Reasoning

作为LLM社会推理的镜像:人格提示

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann, Vera Schmitt, Nils Feldhus

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。

Comments 9 Pages, EACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20546 2026-01-29 cs.CL 57%

Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models

超越发散性创造:基于人类的大型语言模型创造力评估

Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CDAT任务,基于人类创造力理论,评估LLMs在新颖性与适当性之间的平衡,发现较小模型更具创造力,而高级模型更注重适当性。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16778 2026-01-29 cs.LG 57%

GCL-OT: Graph Contrastive Learning with Optimal Transport for Heterophilic Text-Attributed Graphs

GCL-OT:基于最优传输的图对比学习用于异质文本属性图

Yating Ren, Yikun Ban, Huobin Tan

机构 * Yating Ren, Yikun Ban, Huobin Tan

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 GCL-OT通过最优传输和定制机制解决文本属性图中的异质性问题,提升结构-文本对齐效果。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03001 2026-01-29 cs.CL 57%

LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation

LEGO-Eval: 向通过工具增强合成3D具身环境的细粒度评估迈进

Gyeom Hwangbo, Hyungjoo Chae, Minseok Kang, Hyeonjong Ju, Soohyun Oh, Jinyoung Yeo

机构 * Yonsei University(延世大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 LEGO-Eval通过工具增强合成3D具身环境,提供细粒度评估框架和基准测试集,提升场景与指令对齐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14398 2026-01-29 cs.CL 57%

YNTP-100: A Benchmark for Your Next Token Prediction with 100 People

YNTP-100: 一个用于下一步令牌预测的基准,包含100人

Shiyao Ding, Takayuki Ito

机构 * Kyoto University(京都大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08734 2026-01-29 cs.CL 57%

NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context

NurValues: 临床情境下大型语言模型护理价值观的现实评估

Ben Yao, Qiuchi Li, Yazhou Zhang, Siyu Yang, Bohan Zhang, Prayag Tiwari, Jing Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Copenhagen(哥本哈根大学) Tianjin University(天津大学) Tongji Hospital of Tongji Medical College of Huazhong University of Science and Technology(华中科技大学同济医学院同济医院) Beijing University of Chinese Medicine(北京中医药大学) Halmstad University(哈马尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 NurValues通过首个护理价值对齐基准,评估LLMs在临床情境中是否符合护理核心价值观,发现通用LLMs在公正维度表现最差。

Comments 39 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13369 2026-01-29 cs.CL 57%

Reducing Hallucinations in Language Model-based SPARQL Query Generation Using Post-Generation Memory Retrieval

通过生成后记忆检索减少基于语言模型的SPARQL查询生成中的幻觉

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔理工学院) Mila - Quebec AI Institute(魁北克人工智能研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出PGMR框架,通过生成后记忆检索减少语言模型生成SPARQL查询时的URI幻觉,提升查询准确性和系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01256 2026-01-29 cs.CV cs.LG 57%

NLPrompt: Noise-Label Prompt Learning for Vision-Language Models

NLPrompt: 噪声标签提示学习用于视觉-语言模型

Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) University of Technology Sydney(悉尼科技大学) University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19818 2026-01-28 cs.LG cs.NA math.NA 57%

Learn and Verify: A Framework for Rigorous Verification of Physics-Informed Neural Networks

学习与验证:用于物理信息神经网络严格验证的框架

Kazuaki Tanaka, Kohei Yatabe

机构 * Global Center for Science and Engineering(全球科学与工程中心) Waseda University(早稻田大学) Faculty of Engineering(工学院) Tokyo University of Agriculture and Technology(东京农业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 该研究提出“学习与验证”框架,通过结合DSM损失和区间算术,为微分方程的解提供可计算的严格误差界,提升科学机器学习的可信度。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 57%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19197 2026-01-28 cs.IR cs.AI 57%

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

HELM:一种面向LLM推荐系统的以人为本的评估框架

Sushant Mehta

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 HELM框架通过五个以人为本的维度评估LLM推荐系统,揭示传统指标无法捕捉的关键质量维度,并展示GPT-4在解释质量与交互自然性上的优势及流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19106 2026-01-28 cs.SE cs.AI 57%

Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis

通过确定性AST分析检测和纠正LLM生成的代码中的幻觉

Dipin Khati, Daniel Rodriguez-Cardenas, Paul Pantzer, Denys Poshyvanyk

机构 * William & Mary(威廉玛丽大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过确定性AST分析检测并纠正LLM生成代码中的知识冲突幻觉,实现高精度和召回率的自动修复。

Comments Accepted to FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18998 2026-01-28 cs.CL 57%

Malicious Repurposing of Open Science Artefacts by Using Large Language Models

利用大语言模型恶意重用开放科学制品

Zahra Hashemi, Zhiqiang Zhong, Jun Pang, Wei Zhao

机构 * University of Luxemburg(卢森堡大学) University of Aberdeen(阿伯丁大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文研究了利用大语言模型恶意重用开放科学制品生成有害研究的可能性,通过端到端流程揭示LLMs在恶意评估中的局限性,强调人类评估在双用途风险评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10246 2026-01-28 cs.CL 57%

coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts

coTherapist:一种行为对齐的小语言模型,用于支持心理健康专家

Prottay Kumar Adhikary, Reena Rawat, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 coTherapist通过小语言模型和领域微调等技术,为心理健康专家提供支持,展现出高同理心和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11254 2026-01-28 cs.CL 57%

Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality

心理测试在大语言模型中是否有效?对性别歧视、种族主义和道德的测试评估

Jana Jung, Marlene Lutz, Indira Sen, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究评估了心理测试在大语言模型上的有效性,发现其在性别歧视、种族主义和道德方面的测试分数与模型行为不一致,表明需进一步调整以适应LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12344 2026-01-28 cs.CL 57%

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

宣传AI:大型语言模型中语义分歧的分析

Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出RAVEN方法,用于检测大型语言模型中因概念提示引发的语义分歧,通过结合语义熵与跨模型分歧,揭示模型在特定主题上的异常响应,以提高对宣传影响的防范能力。

Comments Accepted at ICLR 2026, 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18900 2026-01-28 cs.CV cs.LG stat.ML 57%

RealStats: A Rigorous Real-Only Statistical Framework for Fake Image Detection

RealStats: 一种用于伪造图像检测的严谨实数统计框架

Haim Zisman, Uri Shaham

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 RealStats提出了一种基于统计学的无训练框架,通过整合多种检测器的无训练统计量,生成可解释的实图像概率评分,以提高伪造图像检测的鲁棒性。

Comments 22 pages, 14 figures. Accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18630 2026-01-27 cs.AI cs.HC 57%

Assessing the Quality of Mental Health Support in LLM Responses through Multi-Attribute Human Evaluation

通过多属性人类评估评估LLM响应中的心理健康支持质量

Abeer Badawi, Md Tahmid Rahman Laskar, Elahe Rahimi, Sheri Grach, Lindsay Bertrand, Lames Danok, Frank Rudzicz, Jimmy Huang, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过多属性人类评估方法,评估LLM在心理健康对话中的响应质量,揭示LLMs在认知可靠性与情感一致性方面的差异,并倡导以治疗敏感性为核心的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18085 2026-01-27 cs.HC cs.AI stat.AP 57%

"Crash Test Dummies" for AI-Enabled Clinical Assessment: Validating Virtual Patient Scenarios with Virtual Learners

为AI赋能的临床评估设计'碰撞测试假人':通过虚拟学习者验证虚拟患者场景

Brian Gin, Ahreum Lim, Flávia Silva e Oliveira, Kuan Xing, Xiaomei Song, Gayana Amiyangoda, Thilanka Seneviratne, Alison F. Doubleday, Ananya Gangopadhyaya, Bob Kiser, Lukas Shum-Tim, Dhruva Patel, Kosala Marambe, Lauren Maggio, Ara Tekian, Yoon Soo Park

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种开源AI虚拟患者平台和测量模型,通过虚拟学习者验证评估流程,实现稳健的能力评估和AI辅助评估的验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16516 2026-01-27 cs.LG 57%

Rethinking Large Language Models For Irregular Time Series Classification In Critical Care

重新思考用于危重监护中不规则时间序列分类的大型语言模型

Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Cambridge, UK(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了LLMs在不规则ICU时间序列分类中的有效性,发现编码器设计比对齐策略更重要,但LLMs在训练时间和少样本学习中表现欠佳。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11020 2026-01-27 cs.CV cs.AI 57%

GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation

GeoVLMath: 通过跨模态奖励增强视觉-语言模型中的几何推理以辅助线创建

Shasha Guo, Liang Pang, Xi Wang, Yanling Wang, Huawei Shen, Jing Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 GeoVLMath通过跨模态奖励模型提升视觉-语言模型在复杂立体几何问题中的几何推理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17920 2026-01-27 cs.AI 57%

Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges

代理AI在软物质中的自主实验室:分类、基准和开放挑战

Xuanzhou Chen, Audrey Wang, Stanley Yin, Hanyang Jiang, Dong Zhang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 57%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17728 2026-01-27 cs.CL 57%

Unsupervised Elicitation of Moral Values from Language Models

无监督从语言模型中提取道德价值观

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

机构 * University of Zurich(苏黎世大学) IPM(伊朗高等教育科学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 57%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25975 2026-01-27 cs.CL cs.PL 57%

SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation

SymCode:通过可验证代码生成实现数学推理的神经符号方法

Sina Bagheri Nezhad, Yao Li, Ameeta Agrawal

机构 * Portland State University(波特兰州立大学) ElastixAI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。

Comments camera-ready EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05840 2026-01-27 cs.LG 57%

Multimodal Trajectory Representation Learning for Travel Time Estimation

多模态轨迹表示学习用于旅行时间估计

Zhi Liu, Xuyuan Hu, Xiao Han, Zhehao Dai, Zhaolin Deng, Guojiang Shen, Xiangjie Kong

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University of Technology College of Computer Science(浙江工业大学计算机科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出多模态动态轨迹整合框架,通过整合GPS、网格轨迹和道路网络约束,提升旅行时间估计的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏