arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-05 至 2026-01-05 共收录 33 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2601.00647 2026-01-05 cs.CL cs.CE q-bio.QM 83%

Physio-DPO: Aligning Large Language Models with the Protein Energy Landscape to Eliminate Structural Hallucinations

Physio-DPO:将大型语言模型与蛋白质能量景观对齐以消除结构幻觉

QiWei Meng

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL

AI总结 Physio-DPO通过引入物理感知的目标,将蛋白质语言模型与热力学稳定性对齐,有效减少结构幻觉并提升折叠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11518 2026-01-05 cs.CL 83%

W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search

W2S-AlignTree: 通过蒙特卡洛树搜索实现大语言模型的弱到强推理时对齐

Zhenyu Ding, Yuhao Wang, Tengyue Xiao, Haoying Wang, Caigui Jiang, Ning Ding

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 W2S-AlignTree通过结合MCTS与弱到强泛化范式,实现大语言模型在推理时的高效对齐,提升摘要任务性能15.9%。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00623 2026-01-05 cs.AI 79%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00747 2026-01-05 cs.LG 57%

The Reasoning-Creativity Trade-off: Toward Creativity-Driven Problem Solving

推理与创造力的权衡:迈向以创造力为导向的问题解决

Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出DCR框架,通过统一变分目标解决LLM在正确性与创造性之间的权衡问题,提供稳定且多样化的训练方法。

Comments 56 pages, 9 figures, submitted to Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24818 2026-01-05 cs.LG 57%

Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback

零和博弈中的无正则化线性收敛性:从偏好反馈出发

Shulun Chen, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) HKUST(香港科技大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种无正则化的OMWU算法,证明其在零和博弈中实现线性收敛,无需假设纳什均衡的唯一性,提升了对实例依赖常数的依赖性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2601.00454 2026-01-05 cs.CL cs.AI 73%

Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations

防御性M2S:在压缩的多轮对话上训练防护模型

Hyunjun Kim

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 Defensive M2S通过压缩多轮对话训练防护模型,显著降低训练和推理成本,提升攻击检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00321 2026-01-05 cs.MA 50%

Offline Multi-Agent Reinforcement Learning for 6G Communications: Fundamentals, Applications and Future Directions

离线多智能体强化学习用于6G通信:基础、应用与未来方向

Eslam Eldeeb, Hirley Alves

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于保守Q学习的离线多智能体强化学习算法,用于6G通信中的无线资源管理和无人机网络,旨在解决多智能体环境下的安全高效训练问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2511.13788 2026-01-05 cs.LG cs.AI cs.CL cs.CR cs.MA 90%

Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments

对抗对齐中的扩展模式:来自多LLM jailbreak实验的证据

Samuel Nathanson, Rebecca Williams, Cynthia Matuszek

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过多LLM jailbreak实验揭示了模型大小不对称对对抗鲁棒性的影响,发现攻击者规模与有害输出严重性呈正相关,且攻击者对齐性可缓解有害响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 89%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07167 2026-01-05 cs.CR cs.CL 85%

One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models

一个触发标记就足够:一种在大型语言模型中平衡安全性和可用性的防御策略

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究提出D-STT算法,通过识别和解码安全触发标记,有效提升大型语言模型的安全性,同时保持其可用性与响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2502.20034 2026-01-05 cs.CV cs.CL 57%

Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore

视觉编码器真的能解释物体幻觉吗?:通过简单细粒度CLIPScore缓解物体幻觉

Hongseok Oh, Wonseok Hwang

机构 * Department of Artificial intelligence University of Seoul(人工智能系首尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出F-CLIPScore,通过细粒度文本嵌入缓解LVLM中的物体幻觉问题,显著提升评估准确性。

Comments Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2508.01140 2026-01-05 q-bio.OT 50%

Open Data Sharing in Clinical Research and Participants Privacy: Challenges and Opportunities in the Era of Artificial Intelligence

临床研究中的开放数据共享与参与者隐私:人工智能时代的挑战与机遇

Shahin Hallaj, Anna Heinke, Fritz Gerald P. Kalaw, Nayoon Gim, Marian Blazes, Julia Owen, Eamon Dysinger, Erik S. Benton, Benjamin A. Cordier, Nicholas G. Evans, Jennifer Li-Pook-Than, Michael P. Snyder, Camille Nebeker, Linda M. Zangwill, Sally L. Baxter, Shannon McWeeney, Cecilia S. Lee, Aaron Y. Lee, Bhavesh Patel

专题命中 隐私与版权 :safety(abstract)

AI总结 本文探讨了人工智能时代临床研究中开放数据共享与参与者隐私保护的挑战与机遇,提出伪重新识别概念并介绍了新型开放数据共享方法。

Journal ref eClinicalMedicine. 2026;91:103729

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 9 篇

2601.00590 2026-01-05 cs.CV 85%

SafeMo: Linguistically Grounded Unlearning for Trustworthy Text-to-Motion Generation

SafeMo: 语言引导的去学习用于可信的文本到运动生成

Yiling Wang, Zeyu Zhang, Yiran Wang, Hao Tang

机构 * The Australian National University(澳大利亚国立大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 SafeMo通过整合MMU策略,实现安全的人类运动生成,提升安全性和实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00513 2026-01-05 cs.LG 79%

When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents

当小模型适用于错误的原因:信任代理的过程验证

Laksh Advani

机构 * Laksh Advani

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。

Comments Accepted to Trustagent workshop AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21842 2026-01-05 cs.CL 79%

AlignAR: Generative Sentence Alignment for Arabic-English Parallel Corpora of Legal and Literary Texts

AlignAR: 生成式句子对齐用于法律和文学文本的阿拉伯-英语平行语料库

Baorong Huang, Ali Asiri

机构 * School of Foreign Languages, Huaihua University(怀化大学外国语言学院) Al-lith University College, Umm al-Qura University(乌姆·盖拉大学阿尔利思学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 AlignAR通过生成式句子对齐方法,提升阿拉伯-英语法律和文学文本的平行语料库质量,验证了大语言模型在对齐任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20144 2026-01-05 cs.CL 79%

Multi-hop Reasoning via Early Knowledge Alignment

通过早期知识对齐实现多跳推理

Yuxin Wang, Shicheng Fang, Bo Wang, Qi Luo, Xuanjing Huang, Yining Zheng, Xipeng Qiu

机构 * Computer Science, Fudan University(复旦大学计算机科学系) Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究所) Shanghai SII(上海SII)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 EKA通过早期知识对齐提升多跳推理效率,增强检索精度和系统性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00355 2026-01-05 eess.IV cs.CV 67%

The Impact of Lesion Focus on the Performance of AI-Based Melanoma Classification

病变聚焦对基于AI的黑色素瘤分类性能的影响

Tanay Donde

机构 * Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本研究探讨了病变聚焦对AI黑色素瘤分类性能的影响,通过分析模型对病变区域的关注程度,揭示了可解释AI在医疗诊断中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00559 2026-01-05 cs.CR cs.AI 57%

Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools?

破解物联网安全:大语言模型能否超越静态分析工具?

Jason Quantrill, Noura Khajehnouri, Zihan Guo, Manar H. Alalfi

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文评估大语言模型在物联网交互威胁检测中的性能,发现其在语义理解上有潜力,但在结构推理方面表现不佳,需结合符号分析提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00506 2026-01-05 cs.CL 57%

Rule-Based Approaches to Atomic Sentence Extraction

基于规则的方法用于原子句子提取

Lineesha Kamana, Akshita Ananda Subramanian, Mehuli Ghosh, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究通过分析复杂句子结构对基于规则的原子句子提取性能的影响,提出了依赖关系提取规则,并在WikiSplit数据集上实现了较高的提取准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00535 2026-01-05 cs.CV 50%

FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection

FreeText: 通过注意力定位和频谱字形注入实现免训练的文本渲染

Ruiqiang Zhang, Hengyi Wang, Chang Liu, Guanjie Wang, Zehua Ma, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学)

专题命中 安全评测 :alignment(abstract)

AI总结 FreeText通过注意力定位和频谱字形注入技术,无需训练即可提升文本渲染的准确性和美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24260 2026-01-05 cs.CV 50%

Physically-Grounded Manifold Projection Model for Generalizable Metal Artifact Reduction in Dental CBCT

基于物理的流形投影模型用于通用金属伪影减少在牙科CBCT

Zhi Li, Yaqi Wang, Bingtao Ma, Yifan Zhang, Huiyu Zhou, Shuai Wang

机构 * School of Cyberspace, Hangzhou Dianzi University(电子科技大学信息学院) Innovation Center for Electronic Design Automation Technology, Hangzhou Dianzi University(电子科技大学电子设计自动化创新中心) Hangzhou Geriatric Stomatology Hospital, Hangzhou Dental Hospital Group(杭州老年口腔医院,杭州口腔医院集团) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出基于物理的流形投影模型,通过合成数据和临床数据实验,实现了更高效且可靠的牙科CBCT中金属伪影减少。

Comments This manuscript has been submitted to Medical Image Analysis for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

7. AI治理与伦理 3 篇

2506.01495 2026-01-05 cs.CL 79%

C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models

C-VARC:一个大规模的中文价值观规则语料库用于大语言模型的价值对齐

Ping Wu, Guobin Shen, Dongcheng Zhao, Yuwei Wang, Yiting Dong, Yu Shi, Enmeng Lu, Feifei Zhao, Yi Zeng

机构 * BrainCog Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所脑认知实验室,北京,中国) Beijing Key Laboratory of Safe AI and Superalignment, Beijing, China(北京安全人工智能与超对齐关键实验室,北京,中国) Beijing Institute of AI Safety and Governance, Beijing, China(北京人工智能安全与治理研究所,北京,中国) The School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) Long-term AI, Beijing, China(长期人工智能,北京,中国)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 C-VARC通过构建大规模中文价值观规则语料库,提供了一种基于中国核心价值观的价值对齐方法,有效提升了大语言模型在不同文化背景下的伦理评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24513 2026-01-05 cs.CY 57%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00762 2026-01-05 cs.SE cs.HC 50%

AI Where It Matters: Where, Why, and How Developers Want AI Support in Daily Work

AI 何时重要:开发者在日常工作中需要 AI 支持的地点、原因和方式

Rudrajit Choudhuri, Carmen Badea, Christian Bird, Jenna Butler, Rob DeLine, Brian Houck

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文通过研究开发者在日常工作中对AI支持的需求,揭示了AI在不同任务中的应用模式及负责任AI的优先事项。

Comments ICSE-SEIP'26

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他安全 9 篇

2412.11167 2026-01-05 cs.CL 79%

Cultural Palette: Pluralising Culture Alignment via Multi-agent Palette

文化调色板:通过多智能体调色板实现文化对齐的多元化

Jiahao Yuan, Zixiang Di, Shangzixin Zhao, Zhiqing Cui, Hanqing Wang, Guisong Yang, Usman Naseem

机构 * ECNU(华东师范大学) USST(上海理工大学) BNU(北京师范大学) HKUST–GZ(香港理工大学-广州)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 Cultural Palette通过多智能体框架实现文化对齐的多元化,利用文化地理和颜色混合机制提升跨文化响应的适应性与准确性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00516 2026-01-05 cs.LG cs.AI 73%

Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI

轨迹守护 -- 一种轻量级、序列感知的模型,用于代理AI中的实时异常检测

Laksh Advani

机构 * Laksh Advani

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 轨迹守护通过对比学习和重建学习,实现对代理AI中任务轨迹对齐和序列有效性的联合检测,提升实时异常检测性能。

Comments Accepted to AAAI Trustagent 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04481 2026-01-05 cs.GR cs.AI cs.CL cs.MM 62%

Narrative-to-Scene Generation: An LLM-Driven Pipeline for 2D Game Environments

叙事到场景生成:一种由大语言模型驱动的2D游戏环境生成管道

Yi-Chun Chen, Arnav Jhala

机构 * Yale University(耶鲁大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种由大语言模型驱动的2D游戏环境生成方法,通过时间框架分析和空间谓词提取,实现从叙述到可玩场景的自动化生成。

Comments Camera-ready version of a paper accepted at the AIIDE 2025 Workshop on Experimental AI in Games (EXAG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02941 2026-01-05 cs.CV cs.AI cs.CL cs.MM 62%

GameTileNet: A Semantic Dataset for Low-Resolution Game Art in Procedural Content Generation

GameTileNet:用于程序化内容生成的低分辨率游戏艺术语义数据集

Yi-Chun Chen, Arnav Jhala

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 GameTileNet通过视觉-语言对齐任务,为低分辨率游戏艺术提供语义标注,以支持基于叙事的程序化内容生成。

Comments Camera-ready version of a paper accepted for oral presentation at AIIDE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00421 2026-01-05 cs.AI 57%

Can Semantic Methods Enhance Team Sports Tactics? A Methodology for Football with Broader Applications

语义方法能否提升团队体育战术?一种适用于足球的通用方法

Alessio Di Rubbo, Mattia Neri, Remo Pareschi, Marco Pedroni, Roberto Valtancoli, Paolino Zica

机构 * Stake Lab, University of Molise, Italy(斯泰克实验室,莫利塞大学,意大利) Bioretics, Bologna, Italy(生物反应公司,博洛尼亚,意大利) Institute for Generative Strategy, Ferrara, Italy(生成战略研究所,费拉拉,意大利) Cesena Femminile Football Club, Cesena, Italy(塞斯纳女子足球俱乐部,塞斯纳,意大利) Zica Sport, Benevento, Italy(齐卡体育,贝内文托,意大利)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于语义空间推理的团队体育战术决策方法,通过多维向量表示球员属性并评估战术契合度,为足球及其他团队领域提供通用决策框架。

Comments Submitted to Sci (MDPI) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00555 2026-01-05 cs.RO 50%

LLM-Based Agentic Exploration for Robot Navigation & Manipulation with Skill Orchestration

基于大语言模型的代理探索用于机器人导航与操作的技能编排

Abu Hanif Muhammad Syarubany, Farhan Zaki Rahmani, Trio Widianto

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于大语言模型的代理探索系统,用于机器人导航与操作,通过技能编排实现端到端任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏