arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-02 至 2025-12-02 共收录 79 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2512.00709 2025-12-02 cs.AI 85%

When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF

当人类偏好翻转时:面向RLHF的实例依赖性鲁棒损失

Yifan Xu, Xichen Ye, Yifan Chen, Qiaosheng Zhang

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出了一种面向RLHF的实例依赖性鲁棒损失算法,通过建模偏好翻转机制和引入实例依赖的翻转概率,提升对齐算法的鲁棒性。

Comments Accepted by AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00042 2025-12-02 cs.CV cs.AI cs.CL cs.CY 67%

Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions

弥合差距:面向标准化考试题目的视觉语言模型数据驱动微调

Egemen Sert, Şeyda Ertekin

机构 * organization= Department of Computer Engineering, Middle East Technical University (METU) , city= Ankara , country= Türkiye organization= METU-DTX Digital Transformation \& Innovation Centre, METU , city= Ankara , country= Türkiye

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过高质量数据和优化语法提升视觉语言模型在标准化考试题目的多模态推理性能,达到接近SOTA的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01010 2025-12-02 cs.MA cs.AI cs.LG cs.SE physics.comp-ph physics.flu-dyn 62%

Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis

单元物理链:一种以基础原理为中心的科学代码合成方法

Vansh Sharma, Venkat Raman

机构 * University of Michigan(密歇根大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出单元物理链框架,通过以基础原理为中心的多代理系统,有效解决科学代码生成中的可靠性问题,实现高精度和高效能的代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20358 2025-12-02 cs.CL 57%

Dialogue Is Not Enough to Make a Communicative BabyLM (But Neither Is Developmentally Inspired Reinforcement Learning)

对话不足以造就一个交际性的婴儿语言模型(但也不如发展启发式强化学习)

Francesca Padovani, Bastian Bunzeck, Manar Ali, Omar Momen, Arianna Bisazza, Hendrik Buschmeier, Sina Zarrieß

机构 * Center for Language and Cognition (CLCG), University of Groningen(语言与认知中心(CLCG)、格罗宁根大学) CRC 1646 – Linguistic Creativity in Communication, Bielefeld University(语言交流创造性研究(CRC 1646)、比尔特诺夫大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文探讨了仅通过对话数据预训练是否能生成有效的小型语言模型,并通过多种微调策略提升模型的交际能力,发现DPO微调在自定义对话基准测试中表现更优。

Journal ref Proceedings of the First BabyLM Workshop (2025), pp. 421-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL 57%

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2512.01247 2025-12-02 cs.CR cs.CY cs.HC 79%

Benchmarking and Understanding Safety Risks in AI Character Platforms

在AI人物平台中进行基准测试与安全风险理解

Yiluo Wei, Peixian Zhang, Gareth Tyson

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 该研究首次对AI人物平台进行大规模安全评估,发现其平均不安全响应率高达65.1%,并提出基于机器学习模型的预测方法以提升平台安全性和交互质量。

Comments Accepted to NDSS '26: The Network and Distributed System Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01848 2025-12-02 cs.CL 70%

Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability

超越SFT:通过强化学习构建更安全且推理能力更强的大推理模型

Jinghan Jia, Nathalie Baracaldo, Sijia Liu

机构 * Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出通过强化学习提升大推理模型的安全性和推理能力,克服了传统监督微调的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 70%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06981 2025-12-02 cs.AI cs.LG 62%

Deep RL Needs Deep Behavior Analysis: Exploring Implicit Planning by Model-Free Agents in Open-Ended Environments

深度强化学习需要深度行为分析:通过无模型智能体在开放性环境中探索隐式规划

Riley Simmons-Edler, Ryan P. Badman, Felix Baastad Berg, Raymond Chua, John J. Vastola, Joshua Lunger, William Qian, Kanaka Rajan

机构 * Department of Neurobiology, Harvard Medical School(哈佛医学院神经生物学系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Department of Mathematics, NTNU(NTNU数学系) School of Computer Science, McGill University & Mila(麦吉尔大学计算机科学学院及Mila) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Biophysics Graduate Program, Harvard University(哈佛大学生物物理学研究生项目)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过ForageWorld环境研究DRL智能体的行为,发现无模型智能体可通过涌现动态展现规划行为,提出通用分析框架用于研究复杂智能体的学习动态。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20804 2025-12-02 cs.CR cs.AI cs.LG 62%

AED: Automatic Discovery of Effective and Diverse Vulnerabilities for Autonomous Driving Policy with Large Language Models

AED: 利用大语言模型自动发现自主驾驶策略的有效且多样的漏洞

Le Qiu, Zelai Xu, Qixin Tan, Wenhao Tang, Chao Yu, Yu Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 AED 利用大语言模型自动发现自动驾驶策略的有效且多样的漏洞,提升漏洞发现的多样性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00611 2025-12-02 cs.CL 57%

Prism: A Minimal Compositional Metalanguage for Specifying Agent Behavior

Prism:一种最小的组合金属言用于指定代理行为

Franck Binard, Vanja Kljajevic

机构 * Deloitte AI(德勤人工智能) University of Oslo(奥斯陆大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Prism通过组合性金属言为代理行为提供最小化规格,结合领域特定词汇与工具,实现可检查和可执行的策略定义。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2405.20015 2025-12-02 cs.AI cs.CL 81%

Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak

通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking

Haoxuan Ji, Zheng Lin, Zhenxing Niu, Xinbo Gao, Gang Hua

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2512.01326 2025-12-02 cs.CR cs.CL cs.LG 81%

Securing Large Language Models (LLMs) from Prompt Injection Attacks

保护大型语言模型(LLMs)免受提示注入攻击

Omar Farooq Khan Suri, John McCrae

机构 * University of Galway, Ireland(Galway大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究评估了JATMO方法对提示注入攻击的鲁棒性,发现其在减少攻击成功率的同时仍存在漏洞,提示需要更复杂的防御策略。

Comments 10 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00966 2025-12-02 cs.CR cs.LG 79%

Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis

通过指令遵循意图分析缓解间接提示注入

Mintong Kang, Chong Xiang, Sanjay Kariyappa, Chaowei Xiao, Bo Li, Edward Suh

机构 * NVIDIA University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 IntentGuard通过分析指令遵循意图,有效缓解间接提示注入攻击,保持模型性能并降低攻击成功率

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2512.01659 2025-12-02 cs.LG cs.AI cs.CL 82%

HalluGraph: Auditable Hallucination Detection for Legal RAG Systems via Knowledge Graph Alignment

HalluGraph: 通过知识图谱对齐实现法律RAG系统的可审计性幻觉检测

Valentin Noël, Elimane Yassine Seidou, Charly Ken Capo-Chichi, Ghanem Amari

机构 * Devoteam

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HalluGraph通过知识图谱对齐技术,为法律RAG系统提供可审计的幻觉检测,实现高精度的实体定位和关系验证,提升法律应用场景的可靠性。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14776 2025-12-02 cs.CL 70%

COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation

COMPASS:基于上下文调节的PID注意力转向系统用于减少幻觉

Kenji Sahay, Snigdha Pandya, Rohan Nagale, Anna Lin, Shikhar Shiromani, Kevin Zhu, Dev Sunishchal

机构 * Algoverse Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 COMPASS通过上下文调节PID注意力转向系统减少大型语言模型的幻觉,通过可解释的反馈回路提升生成的准确性与可解释性。

Comments 9 pages, 6 figures including algorithmns, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 62%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25686 2025-12-02 cs.LG 57%

EXP-CAM: Explanation Generation and Circuit Discovery Using Classifier Activation Matching

EXP-CAM:基于分类器激活匹配的解释生成与电路发现

Pirzada Suhail, Aditya Anand, Amit Sethi

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 EXP-CAM通过分类器激活匹配生成最小且忠实的图像解释,揭示模型内部计算机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22171 2025-12-02 cs.CV 50%

HARMONY: Hidden Activation Representations and Model Output-Aware Uncertainty Estimation for Vision-Language Models

HARMONY:隐藏的激活表示和模型输出感知的不确定性估计用于视觉-语言模型

Erum Mushtaq, Zalan Fabian, Yavuz Faruk Bakman, Anil Ramakrishna, Mahdi Soltanolkotabi, Salman Avestimehr

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 HARMONY通过整合生成token、模型输出不确定性分数和隐藏表示,提升视觉-语言模型的不确定性估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2512.00621 2025-12-02 cs.SD cs.AI cs.CL 62%

Melody or Machine: Detecting Synthetic Music with Dual-Stream Contrastive Learning

旋律或机器:基于双流对比学习的合成音乐检测

Arnesh Batra, Dev Sharma, Krish Thukral, Ruhani Bhatia, Naman Batra, Aditya Gautam

机构 * Indraprastha Institute of Information Technology Delhi (IIIT-Delhi)(印度理工学院德里分校) Manipal University Jaipur(曼海姆大学斋普尔) Netaji Subhas University of Technology (NSUT)(尼赫鲁大学技术学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MoM基准和CLAM架构,通过双流对比学习检测合成音乐,实现高精度的合成音乐识别

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07338 2025-12-02 cs.AI cs.LG 62%

DeepPersona: A Generative Engine for Scaling Deep Synthetic Personas

DeepPersona: 一个用于扩展深度合成人设的生成引擎

Zhen Wang, Yufan Zhou, Zhongyan Luo, Lyumanshan Ye, Adam Wood, Man Yao, Saab Mansour, Luoshang Pan

机构 * UCSD(加州大学圣地亚哥分校) KU Leuven(鲁汶大学) SJTU(上海交通大学) University of Michigan(密歇根大学) Denison University(德尼森大学) Amazon(亚马逊) Meta

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DeepPersona通过双阶段分类学引导方法生成深度合成人设,提升LLM个性化和人类模拟的准确性与多样性。

Comments add an author[Update], 12 pages, 5 figures, accepted at LAW 2025 Workshop (NeurIPS 2025) Project page: https://deeppersona-ai.github.io/

Journal ref LAW 2025 Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 30 篇

2512.01786 2025-12-02 cs.AI cs.LG 81%

Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems

谁评判法官?LLM陪审团即需:构建可信的LLM评估系统

Xiaochuan Li, Ke Wang, Girija Gouda, Shubham Choudhary, Yaqun Wang, Linwei Hu, Joel Vaughan, Freddy Lecue

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM陪审团即需,通过动态学习框架提升LLM评估的可靠性和可扩展性,实验表明其在关键决策中的相关性优于传统方法。

Comments 66 pages, 22 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14469 2025-12-02 cs.CL cs.AI 81%

Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations

大语言模型在混合语言扰动下的归因安全故障

Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar, Sayan Layek, Parag Agrawal, Rima Hazra, Animesh Mukherjee

机构 * Microsoft Corporation(微软公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18008 2025-12-02 cs.CY cs.CL 81%

GermanPartiesQA: Benchmarking Commercial Large Language Models and AI Companions for Political Alignment and Sycophancy

GermanPartiesQA: 对商业大语言模型和AI伴侣在政治倾向和趋炎附势方面的基准测试

Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

机构 * TUM(慕尼黑大学) TUB(慕尼黑大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 GermanPartiesQA研究了六个商业LLMs在政治倾向和趋炎附势方面的表现,揭示了LLMs在生成事实性政党立场上的局限性以及模型特定的意识形态倾向模式。

Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop on LLM Evaluation and the International Monetary Fund's 12th Statistical Forum. GermanPartiesQA Benchmark under https://github.com/janbatzner/germanpartiesqa

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, pp. 330-342

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01080 2025-12-02 cond-mat.mtrl-sci cs.LG 79%

Building Trustworthy AI for Materials Discovery: From Autonomous Laboratories to Z-scores

构建可信的人工智能用于材料发现:从自主实验室到Z分数

Benhour Amirian, Ashley S. Dale, Sergei Kalinin, Jason Hattrick-Simpers

机构 * University of Toronto(多伦多大学) University of Tennessee(田纳西大学) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Schwartz Reisman Institute for Technology and Society(技术与社会斯瓦茨-雷曼研究所)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出GIFTERS框架,用于评估材料发现中AI方法的信任度,强调信任原则和改进方法,以确保AI加速发现的同时符合科学规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01373 2025-12-02 cs.CV 78%

SRAM: Shape-Realism Alignment Metric for No Reference 3D Shape Evaluation

SRAM:无参考3D形状评估的形状现实对齐度量

Sheng Liu, Tianyu Luan, Phani Nuney, Xuelu Feng, Junsong Yuan

专题命中 安全评测 :alignment(title,abstract)

AI总结 SRAM提出了一种基于大型语言模型的无参考3D形状评估度量,通过网格编码和现实感解码器实现与人类感知的对齐,优于现有方法并具有良好的泛化能力。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00142 2025-12-02 cs.CR cs.AI q-fin.CP q-fin.GN 74%

DeFi TrustBoost: Blockchain and AI for Trustworthy Decentralized Financial Decisions

去中心化金融信任提升:区块链与人工智能用于可信的去中心化金融决策

Swati Sachan, Dale S. Fickett

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 该研究提出一种结合区块链与可解释人工智能的去中心化金融信任提升框架,旨在解决贷款审批中的信任问题,并通过防篡改审计和数据存储策略提升监管合规性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01191 2025-12-02 cs.CL 70%

Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks

通用大语言模型在医疗基准测试中优于临床工具

Krithik Vishwanath, Mrigayu Ghosh, Anton Alyakin, Daniel Alexander Alber, Yindalon Aphinyanaphongs, Eric Karl Oermann

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 通用大语言模型在医疗基准测试中表现优于临床工具,揭示了临床AI系统在某些关键能力上的不足。

Comments 17 pages, 4 figures (2 regular, 2 supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00019 2025-12-02 cs.RO cs.AI cs.CV 70%

A Comprehensive Survey on Surgical Digital Twin

外科数字孪生的全面综述

Afsah Sharaf Khan, Falong Fan, Doohwan DH Kim, Abdurrahman Alshareef, Dong Chen, Justin Kim, Ernest Carter, Bo Liu, Jerzy W. Rozenblit, Bernard Zeigler

机构 * IEEE

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文综述了外科数字孪生的技术现状与挑战,提出分类方法并识别了验证、安全性和数据治理等开放问题,旨在推动其在临床中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00656 2025-12-02 cs.CL cs.CY 66%

Sycophancy Claims about Language Models: The Missing Human-in-the-Loop

语言模型中的趋炎附势主张:缺失的人工智能循环

Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

机构 * Weizenbaum Institute(韦岑鲍姆研究所) Technical University Berlin(柏林技术大学) Technical University Munich(慕尼黑技术大学)

专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.CY

AI总结 本文探讨了大型语言模型中趋炎附势现象的测量挑战,提出五个核心操作化定义,并指出当前研究缺乏对人类感知的评估,为未来研究提供建议。

Comments NeurIPS 2025 Workshop on LLM Evaluation and ICLR 2025 Workshop on Bi-Directional Human-AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏