arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-30 至 2026-01-30 共收录 55 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2510.23596 2026-01-30 cs.CL 70%

Think Twice: Branch-and-Rethink Reasoning Reward Model

再思两次:分支与再思考推理奖励模型

Yizhu Jiao, Jiaqi Zeng, Julien Veron Vialard, Oleksii Kuchaiev, Jiawei Han, Olivier Delalleau

机构 * NVIDIA(NVIDIA公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL

AI总结 BR-RM通过两轮次的分支与再思考机制,改进奖励模型的判断准确性与敏感性,实现更精确的推理能力。

Comments Source Code: https://github.com/yzjiao/BR-RM. Model Checkpoints: https://huggingface.co/nvidia/Qwen3-Nemotron-14B-BRRM and https://huggingface.co/nvidia/Qwen3-Nemotron-8B-BRRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21611 2026-01-30 cs.IR cs.AI cs.CL 62%

Thinking Broad, Acting Fast: Latent Reasoning Distillation from Multi-Perspective Chain-of-Thought for E-Commerce Relevance

深度思考,快速行动:多视角链式推理的潜在推理蒸馏用于电子商务相关性

Baopu Qiu, Hao Chen, Yuanrong Wu, Changtong Zan, Chao Wei, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Zhejiang University(浙江大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多视角链式推理蒸馏方法,通过改进的教师模型和轻量级学生模型提升电子商务搜索相关性建模的准确性和效率。

Comments 12 pages, 6 figures, Accepted by WWW2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11311 2026-01-30 cs.AI cs.CY 62%

Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble

通过紧凑的LLM集合模拟人类偏好:提示到代理

Bingchen Wang, Zi-Yu Khoo, Jingtan Wang

机构 * Independent Researcher, China(中国独立研究者) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 通过紧凑的LLM集合模拟人类偏好,P2P方法在无需微调和敏感数据的情况下,有效重建目标人群偏好并实现高质量预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21740 2026-01-30 cs.MM cs.SD 50%

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

MIDI-LLaMA:一种用于符号音乐理解的指令遵循多模态大语言模型

Meng Yang, Jon McCormack, Maria Teresa Llano, Wanchao Su, Chao Lei

机构 * SensiLab, Monash University, Australia(Monash大学) University of Sussex, Brighton, United Kingdom(Sussex大学) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院)

专题命中 偏好对齐 :alignment(abstract)

AI总结 MIDI-LLaMA通过结合MusicBERT和Llama-3-8B,实现了对符号音乐的指令遵循理解,显著提升了音乐描述和语义对齐能力。

Comments Accepted for publication at International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2601.22118 2026-01-30 cs.AI 79%

Defining Operational Conditions for Safety-Critical AI-Based Systems from Data

从数据定义安全关键AI系统的操作条件

Johann Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多维核表示的方法,从已有数据后验定义安全关键AI系统的操作条件领域,以实现更有效的认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21985 2026-01-30 cs.LG 74%

Elign: Equivariant Diffusion Model Alignment from Foundational Machine Learning Force Fields

Elign:从基础机器学习力场中等效扩散模型对齐

Yunyang Li, Lin Huang, Luojia Xia, Wenhe Zhang, Mark Gerstein

机构 * Department of Computer Science, Yale University, New Haven, USA(计算机科学系,耶鲁大学,新 Haven,USA) Program in Computational Biology and Biomedical Informatics, Yale University, New Haven, USA(计算生物学与生物医学信息学项目,耶鲁大学,新 Haven,USA) IQuestLab

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 Elign通过结合基础机器学习力场和强化学习优化,实现了等效扩散模型的对齐,提升分子构象生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21510 2026-01-30 nlin.CD 50%

From Basins to safe sets: a machine learning perspective on chaotic dynamics

从盆地到安全集:从机器学习视角看混沌动力学

David Valle, Alexandre Wagemakers, Miguel A. F. Sanjuán

专题命中 安全训练 :safety(abstract)

AI总结 本文从机器学习视角探讨混沌动力学,展示数据驱动方法在加速经典任务和实现可扩展干预方面的潜力。

Comments Chaos control, machine learning, neural networks, basins of attraction, transient chaos

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2601.20903 2026-01-30 cs.CR cs.AI 83%

ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack

ICON:意图-上下文耦合用于高效的多轮 jailbreak 攻击

Xingwei Lin, Wenhao Lin, Sicong Cao, Jiahao Yu, Renke Huang, Lei Xue, Chunming Wu

机构 * Zhejiang University(浙江大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Northwestern University(西北大学) Sun Yat-sen University(中山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 ICON 提出了一种高效的多轮 jailbreak 攻击框架,通过意图-上下文耦合和分层优化策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21380 2026-01-30 cs.CR 50%

RerouteGuard: Understanding and Mitigating Adversarial Risks for LLM Routing

RerouteGuard: 理解并缓解LLM路由中的对抗风险

Wenhui Zhang, Huiyu Xu, Zhibo Wang, Zhichao Li, Zeqing He, Xuelin Wei, Kui Ren

专题命中 越狱攻击 :safety(abstract)

AI总结 RerouteGuard通过动态嵌入检测和自适应阈值,有效检测并缓解LLM路由中的对抗风险,提升多模型AI系统的安全性。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2601.21051 2026-01-30 cs.AI cs.CR cs.LG 62%

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 技术报告

Zhuoran Yang, Ed Li, Jianliang He, Aman Priyanshu, Baturay Saglam, Paul Kassianik, Sajana Weerawardhena, Anu Vellore, Blaine Nelson, Neusha Javidnia, Arthur Goldblatt, Fraser Burch, Avi Zohary, Assaf Eisenman, Mahdi Sabbaghi, Supriti Vijay, Rahim Dharssi, Dhruv Kedia, Kojin Oshiba, Yaron Singer, Amin Karbasi

机构 * Foundation AI–Cisco Systems Inc.(Foundation AI–Cisco系统公司) Yale University(耶鲁大学) University of California, San Diego(加州大学圣地亚哥分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 提示注入 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 是首个开源的网络安全专用推理模型,通过结合监督微调和强化学习训练,实现了在网络安全任务上的高性能表现。

Comments 31 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 6 篇

2506.09277 2026-01-30 cs.CL 79%

NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment

NeuroFaith:通过内部表示对齐评估LLM自解释的忠实性

Milan Bhan, Jean-Noel Vittaut, Nicolas Chesneau, Sarath Chandar, Marie-Jeanne Lesot

机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) Mila - Quebec AI Institute, Université de Montréal(魁北克人工智能研究院、蒙特利尔大学)

专题命中 幻觉与事实性 :alignment(title);trustworthy(abstract);分类 cs.CL

AI总结 NeuroFaith通过内部表示对齐评估LLM自解释的忠实性,提出了一种灵活的框架和线性探针以提高模型的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04418 2026-01-30 cs.LG cs.CL 62%

The Illusion of Certainty: Uncertainty Quantification for LLMs Fails under Ambiguity

确定性的幻觉:在歧义下LLM的不确定性量化失效

Tim Tomov, Dominik Fuchsgruber, Tom Wollschläger, Stephan Günnemann

机构 * School of Computation, Information Technology \& Munich Data Science Institute - Technical University of Munich

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究揭示了在歧义环境下LLM的不确定性量化方法存在缺陷,提出了MAQA*和AmbigQA*数据集以评估模型在歧义数据上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21113 2026-01-30 cs.AI cs.MA 57%

Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement

计划-审核双胞胎:基于FHIR的LLM计划、指南回忆、可选缓存和自我改进的代理出院计划

Kaiyuan Wu, Aditya Nagori, Rishikesan Kamaleswaran

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 基于FHIR的LLM计划与审核框架,通过自我改进和缓存优化,提升临床出院计划的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17865 2026-01-30 cs.CL 57%

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

D模型和E模型:大语言模型采样行为中的多样性-稳定性权衡

Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中D模型与E模型在采样行为上的多样性-稳定性权衡,为任务应用中的模型选择提供了指导。

Comments 12 pages, 10 figures. Accepted by WWW'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22099 2026-01-30 physics.soc-ph 50%

Towards Universal Urban Patterns-of-Life Simulation

迈向通用的城市生活方式模拟

Sandro M. Reia, Henrique F. de Arruda, Shiyang Ruan, Taylor Anderson, Hamdi Kavak, Dieter Pfoser

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出了一种可扩展且通用的城市生活方式模拟框架,通过模拟日常活动生成模式,并验证了其在不同城市中的有效性,适用于城市系统中的多种场景分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21126 2026-01-30 cs.MA cs.RO 50%

AI-Augmented Density-Driven Optimal Control (D2OC) for Decentralized Environmental Mapping

AI增强的密度驱动最优控制(D2OC)用于去中心化环境映射

Kooktae Lee, Julian Martinez

机构 * Department of Mechanical Engineering, New Mexico Institute of Mining and Technology(机械工程系,新墨西哥矿业与技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出AI增强的密度驱动最优控制方法,用于在传感和通信受限条件下实现多智能体环境映射,通过自适应机制提升密度估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2601.22028 2026-01-30 cs.LG 57%

From Logits to Latents: Contrastive Representation Shaping for LLM Unlearning

从 logits 到 latents:用于大语言模型遗忘的对比表示塑造

Haoran Tang, Rajiv Khanna

机构 * Purdue University(普渡大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 CLReg 通过对比表示正则化减少大语言模型中遗忘与保留知识的纠缠,提升遗忘效果并降低隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 23 篇

2601.21517 2026-01-30 cs.CV 75%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21360 2026-01-30 cs.CL cs.AI cs.ET cs.LG cs.SE 75%

The Compliance Paradox: Semantic-Instruction Decoupling in Automated Academic Code Evaluation

合规悖论:自动学术代码评估中的语义指令解耦

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Vinay Chamola, Dhruv Kumar

机构 * KIIT University(KIIT大学)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了自动学术代码评估中模型因优先考虑隐藏格式约束而无法正确评估代码的问题,提出SPACI和AST-ASIP框架以检测和对抗此类解耦现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21365 2026-01-30 cs.CY 74%

Small models, big threats: Characterizing safety challenges from low-compute AI models

小模型,大威胁:从低计算量AI模型中characterizing安全挑战

Prateek Puri

专题命中 安全评测 :safety(title);分类 cs.CY

AI总结 本文指出低计算量AI模型因性能提升而变得危险,需加强安全防护以应对新兴威胁。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21505 2026-01-30 cs.AI cs.CL cs.HC 73%

The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation

风格向量对大型语言模型的控制效果:一项人类评估

Diaoulé Diallo, Katharina Dworatzyk, Sophie Jentzsch, Peer Schütt, Sabine Theis, Tobias Hecking

机构 * German Aerospace Center (DLR), Institute of Software Technology(德国航空航天中心(DLR)软件技术研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过人类评估验证了激活引导在控制大型语言模型情绪输出中的有效性,发现中等强度引导能显著增强目标情绪并保持文本可理解性,且模型升级后效果更稳定。

Journal ref IEEE Access 13 (2025) 191443-191457

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09101 2026-01-30 cs.HC 71%

A Survey of LLM Alignment: Instruction Understanding, Intention Reasoning, and Reliable Generation

大型语言模型对齐综述:指令理解、意图推理和可靠生成

Zongyu Chang, Feihong Lu, Ziqin Zhu, Qian Li, Cheng Ji, Tao Yang, Zhuo Chen, Hao Peng, Yang Liu, Ruifeng Xu, Yangqiu Song, Jianxin Li, Shangguang Wang

专题命中 安全评测 :alignment(title)

AI总结 本文综述了大型语言模型在指令理解、意图推理和可靠生成方面的挑战与解决方案,旨在提升模型在现实应用中的可靠性与适应性。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14038 2026-01-30 cs.AI cs.CL cs.IR 62%

OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM:用于理解本体匹配中大语言模型幻觉的基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University, School of Computing(澳大利亚国立大学,计算机学院) Monash University, Faculty of Information Technology(墨尔本大学,信息技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 OAEI-LLM数据集旨在通过评估本体匹配任务中大语言模型的幻觉现象,为理解LLM幻觉提供基准支持。

Comments 5 pages, 1 figure, 1 table, 1 code snippet

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21742 2026-01-30 cs.AI cs.CL cs.MA 62%

Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems

知识上下文学习:在基于大语言模型的多智能体系统中以正确方式建立信任

Ruiwen Zhou, Maojia Song, Xiaobao Wu, Sitao Cheng, Xunjian Yin, Yuxi Xie, Zhuoqun Hao, Wenyue Hua, Liangming Pan, Soujanya Poria, Min-Yen Kan

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology(新加坡科技学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Waterloo(滑铁卢大学) Microsoft(微软公司) Peking University(北京大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Epistemic Context Learning(ECL),通过历史交互构建同伴资料以提升多智能体系统中信任建模的准确性,使小型模型在性能上超越大模型,并在多种配置中表现出良好的泛化能力。

Comments Codes and data are available at https://github.com/skyriver-2000/epistemic-context-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21192 2026-01-30 cs.AI cs.CL 62%

Do Reasoning Models Enhance Embedding Models?

推理模型能增强嵌入模型吗?

Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

机构 * CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理模型是否能提升嵌入模型的性能,发现其初始化对对比学习效果无显著影响,并提出HRSA框架揭示流形重新对齐现象。

Comments 10 main pages, 18 appendix pages, 13 figures, 11 tables, 4 prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21157 2026-01-30 cs.AI cs.CL 62%

Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning

弥合算术鸿沟:认知复杂性基准与金融-PoT用于稳健的金融推理

Boxiang Zhao, Qince Li, Zhonghao Wang, Yi Wang, Peng Cheng, Bo Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知复杂性基准和金融-PoT框架,通过架构解耦提升金融推理的鲁棒性,使Qwen3-235B模型在复杂任务中的准确率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21000 2026-01-30 cs.CL cs.AI 62%

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试

Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20913 2026-01-30 cs.LG cs.AI cs.CV 62%

Noisy but Valid: Robust Statistical Evaluation of LLMs with Imperfect Judges

噪声但有效:通过不完美的裁判者对LLM进行稳健的统计评估

Chen Feng, Minghe Shen, Ananth Balashankar, Carsten Gerner-Beuerle, Miguel R. D. Rodrigues

机构 * Queen’s University Belfast(女王大学贝尔法斯特分校) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种稳健的LLM统计评估框架,通过建模不完美裁判行为,理论保证有限样本的一类错误控制,并验证了在不完美裁判设定下的评估有效性。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24906 2026-01-30 cs.AI cs.CL 62%

Neural network embeddings recover value dimensions from psychometric survey items on par with human data

神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当

Max Pellert, Clemens M. Lechner, Indira Sen, Markus Strohmaier

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Jam Technologies GmbH University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SQuID通过神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当,具有成本低、可扩展性强的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03147 2026-01-30 cs.HC cs.CL cs.LG cs.SD eess.AS 62%

A conversational gesture synthesis system based on emotions and semantics

基于情感和语义的对话手势合成系统

Thanh Hoang-Minh

机构 * Department of Information Technology, VNUHCM -- University of Science(越南科学大学信息科技系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DeepGesture,一种基于扩散的 gesture 合成系统,通过多模态信号生成具有情感和语义条件的手势,提升数字人类的自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏