arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-30 至 2026-01-30 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2601.21517 2026-01-30 cs.CV 75%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21360 2026-01-30 cs.CL cs.AI cs.ET cs.LG cs.SE 75%

The Compliance Paradox: Semantic-Instruction Decoupling in Automated Academic Code Evaluation

合规悖论:自动学术代码评估中的语义指令解耦

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Vinay Chamola, Dhruv Kumar

机构 * KIIT University(KIIT大学)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了自动学术代码评估中模型因优先考虑隐藏格式约束而无法正确评估代码的问题,提出SPACI和AST-ASIP框架以检测和对抗此类解耦现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21365 2026-01-30 cs.CY 74%

Small models, big threats: Characterizing safety challenges from low-compute AI models

小模型,大威胁:从低计算量AI模型中characterizing安全挑战

Prateek Puri

专题命中 安全评测 :safety(title);分类 cs.CY

AI总结 本文指出低计算量AI模型因性能提升而变得危险,需加强安全防护以应对新兴威胁。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21505 2026-01-30 cs.AI cs.CL cs.HC 73%

The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation

风格向量对大型语言模型的控制效果:一项人类评估

Diaoulé Diallo, Katharina Dworatzyk, Sophie Jentzsch, Peer Schütt, Sabine Theis, Tobias Hecking

机构 * German Aerospace Center (DLR), Institute of Software Technology(德国航空航天中心(DLR)软件技术研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过人类评估验证了激活引导在控制大型语言模型情绪输出中的有效性,发现中等强度引导能显著增强目标情绪并保持文本可理解性,且模型升级后效果更稳定。

Journal ref IEEE Access 13 (2025) 191443-191457

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09101 2026-01-30 cs.HC 71%

A Survey of LLM Alignment: Instruction Understanding, Intention Reasoning, and Reliable Generation

大型语言模型对齐综述:指令理解、意图推理和可靠生成

Zongyu Chang, Feihong Lu, Ziqin Zhu, Qian Li, Cheng Ji, Tao Yang, Zhuo Chen, Hao Peng, Yang Liu, Ruifeng Xu, Yangqiu Song, Jianxin Li, Shangguang Wang

专题命中 安全评测 :alignment(title)

AI总结 本文综述了大型语言模型在指令理解、意图推理和可靠生成方面的挑战与解决方案,旨在提升模型在现实应用中的可靠性与适应性。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14038 2026-01-30 cs.AI cs.CL cs.IR 62%

OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM:用于理解本体匹配中大语言模型幻觉的基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University, School of Computing(澳大利亚国立大学,计算机学院) Monash University, Faculty of Information Technology(墨尔本大学,信息技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 OAEI-LLM数据集旨在通过评估本体匹配任务中大语言模型的幻觉现象,为理解LLM幻觉提供基准支持。

Comments 5 pages, 1 figure, 1 table, 1 code snippet

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21742 2026-01-30 cs.AI cs.CL cs.MA 62%

Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems

知识上下文学习:在基于大语言模型的多智能体系统中以正确方式建立信任

Ruiwen Zhou, Maojia Song, Xiaobao Wu, Sitao Cheng, Xunjian Yin, Yuxi Xie, Zhuoqun Hao, Wenyue Hua, Liangming Pan, Soujanya Poria, Min-Yen Kan

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology(新加坡科技学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Waterloo(滑铁卢大学) Microsoft(微软公司) Peking University(北京大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Epistemic Context Learning(ECL),通过历史交互构建同伴资料以提升多智能体系统中信任建模的准确性,使小型模型在性能上超越大模型,并在多种配置中表现出良好的泛化能力。

Comments Codes and data are available at https://github.com/skyriver-2000/epistemic-context-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21192 2026-01-30 cs.AI cs.CL 62%

Do Reasoning Models Enhance Embedding Models?

推理模型能增强嵌入模型吗?

Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

机构 * CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理模型是否能提升嵌入模型的性能,发现其初始化对对比学习效果无显著影响,并提出HRSA框架揭示流形重新对齐现象。

Comments 10 main pages, 18 appendix pages, 13 figures, 11 tables, 4 prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21157 2026-01-30 cs.AI cs.CL 62%

Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning

弥合算术鸿沟:认知复杂性基准与金融-PoT用于稳健的金融推理

Boxiang Zhao, Qince Li, Zhonghao Wang, Yi Wang, Peng Cheng, Bo Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知复杂性基准和金融-PoT框架,通过架构解耦提升金融推理的鲁棒性,使Qwen3-235B模型在复杂任务中的准确率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21000 2026-01-30 cs.CL cs.AI 62%

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试

Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20913 2026-01-30 cs.LG cs.AI cs.CV 62%

Noisy but Valid: Robust Statistical Evaluation of LLMs with Imperfect Judges

噪声但有效:通过不完美的裁判者对LLM进行稳健的统计评估

Chen Feng, Minghe Shen, Ananth Balashankar, Carsten Gerner-Beuerle, Miguel R. D. Rodrigues

机构 * Queen’s University Belfast(女王大学贝尔法斯特分校) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种稳健的LLM统计评估框架,通过建模不完美裁判行为,理论保证有限样本的一类错误控制,并验证了在不完美裁判设定下的评估有效性。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24906 2026-01-30 cs.AI cs.CL 62%

Neural network embeddings recover value dimensions from psychometric survey items on par with human data

神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当

Max Pellert, Clemens M. Lechner, Indira Sen, Markus Strohmaier

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Jam Technologies GmbH University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SQuID通过神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当,具有成本低、可扩展性强的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03147 2026-01-30 cs.HC cs.CL cs.LG cs.SD eess.AS 62%

A conversational gesture synthesis system based on emotions and semantics

基于情感和语义的对话手势合成系统

Thanh Hoang-Minh

机构 * Department of Information Technology, VNUHCM -- University of Science(越南科学大学信息科技系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DeepGesture,一种基于扩散的 gesture 合成系统,通过多模态信号生成具有情感和语义条件的手势,提升数字人类的自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21947 2026-01-30 cs.AI 57%

ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models

ToolWeaver: 为大语言模型中的可扩展工具使用编织协作语义

Bowen Fang, Wen Ye, Yunyue Su, Jinghao Zhang, Qiang Liu, Yesheng Liu, Xin Sun, Shu Wu, Jiabing Yang, Baole Wei, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ToolWeaver通过编码工具为层次序列,解决大语言模型中工具使用中的语义和可扩展性问题,提升工具协作学习的效率与效果。

Comments 10pages, 12 figures, Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21802 2026-01-30 cs.AI 57%

A Unified XAI-LLM Approach for EndotrachealSuctioning Activity Recognition

面向气管吸引活动识别的统一XAI-LLM方法

Hoang Khang Phan, Quang Vinh Dang, Noriyo Colley, Christina Garcia, Nhat Tan Le

机构 * Dept. of Biomedical Engineering(生物医学工程系) Manning College of Information(信息与计算机科学学院) Faculty of Health Science(健康科学学院) Kyushu Institute of Technology(九州工业大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种统一的XAI-LLM框架,用于气管吸引活动识别,通过LLM实现时空活动识别和可解释反馈,提升培训效率和患者安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21786 2026-01-30 cs.CV cs.AI cs.GR 57%

Synthetic-to-Real Domain Bridging for Single-View 3D Reconstruction of Ships for Maritime Monitoring

单视图3D船舶重建用于海上监控的合成到现实领域桥梁

Borja Carrillo-Perez, Felix Sattler, Angel Bueno Rodriguez, Maurice Stephan, Sarah Barnes

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于合成数据的单视图3D船舶重建方法,通过高效网络和领域迁移技术,实现海上监控的实时3D可视化。

Journal ref Applications of Machine Learning 2025, Proc. of SPIE Vol. 13606, 136061G 2025 Published by SPIE 0277-786X

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19236 2026-01-30 cs.CL 57%

Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator

在不同领域评估文本创造力:一个数据集和大语言模型评估器

Qian Cao, Xiting Wang, Yuzhuo Yuan, Yahui Liu, Fang Luo, Ruihua Song

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学) Kuaishou Technology(快手科技)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种基于CreataSet数据集的CrEval评估器,通过结合人类和合成数据提升大语言模型的创造力评估效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 57%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21189 2026-01-30 cs.CR cs.AI 57%

Adaptive and Robust Cost-Aware Proof of Quality for Decentralized LLM Inference Networks

自适应和稳健的成本感知质量证明用于去中心化大语言模型推理网络

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种自适应和稳健的成本感知质量证明机制,通过鲁棒聚合规则和动态信任权重提升共识一致性,减少对抗攻击影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21128 2026-01-30 cs.AI 57%

Beyond a Single Reference: Training and Evaluation with Paraphrases in Sign Language Translation

超越单一参考:在手语翻译中使用同义词进行训练和评估

Václav Javorek, Tomáš Železný, Alessa Carbo, Marek Hrúz, Ivan Gruber

机构 * University of West Bohemia(西波希米亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出通过生成同义词参考提升手语翻译评估的准确性,引入BLEUpara度量标准并验证其与人类判断的一致性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16740 2026-01-30 cs.HC 50%

Evaluating Generative AI in the Lab: Methodological Challenges and Guidelines

在实验室中评估生成式AI:方法学挑战与指南

Hyerim Park, Khanh Huynh, Malin Eiband, Jeremy Dillmann, Sven Mayer, Michael Sedlmair

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了在实验室环境中评估生成式AI的方法学挑战,提出了五个指南和十八项建议,以帮助研究人员设计更透明和稳健的评估研究。

Comments 18 pages, 3 figures, IUI '26 (the 31st International Conference on Intelligent User Interfaces)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12448 2026-01-30 cs.SE 50%

Evaluating Large Language Models for Time Series Anomaly Detection in Aerospace Software

评估大型语言模型在航空航天软件时间序列异常检测中的应用

Yang Liu, Yixing Luo, Xiaofeng Li, Xiaogang Dong, Bin Gu, Zhi Jin

专题命中 安全评测 :safety(abstract)

AI总结 本文提出ATSADBench基准,评估大型语言模型在航空航天软件时间序列异常检测中的性能,发现其在单变量任务表现良好,但多变量任务效果欠佳,且RAG策略可能加剧假警报问题。

Comments This paper has been accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14570 2026-01-30 cs.SD eess.AS 50%

AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation

AudioEval: 文本到音频生成的自动双视角和多维度评估

Hui Wang, Jinghua Zhao, Junyang Cheng, Cheng Liu, Yuhang Jia, Haoqin Sun, Jiaming Zhou, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院)

专题命中 安全评测 :alignment(abstract)

AI总结 AudioEval通过大规模数据集和Qwen-DisQA基线,提供文本到音频生成的多维度自动评估方法,支持模型性能比较与评估体系优化。

详情

展开后加载摘要…

URL PDF HTML 收藏