arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-15 至 2025-12-15 共收录 32 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2512.04752 2025-12-15 cs.LG 79%

RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting

RLHFSpec: 通过自适应草稿打破RLHF训练的效率瓶颈

Siqi Wang, Hailong Yang, Junjie Zhu, Xuezhu Wang, Yufan Xu, Depei Qian

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 RLHFSpec通过自适应草稿策略和高效样本再分配,提升RLHF训练效率,缓解生成瓶颈,提高整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06682 2025-12-15 cs.CL cs.AI 62%

Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention

文本自注意力网络:通过基于文本的梯度注意力进行测试时偏好优化

Shibing Mo, Haoyang Ruan, Kai Wu, Jing Liu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TSAN,一种无需参数更新的测试时偏好优化方法,通过文本梯度空间实现多候选响应的系统分析与综合,提升输出质量。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11755 2025-12-15 cs.CL 57%

SUMFORU: An LLM-Based Review Summarization Framework for Personalized Purchase Decision Support

SUMFORU: 一种基于LLM的个性化购买决策支持的评论摘要框架

Yuming Feng, Xinrui Jiang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 SUMFORU通过可调节的多元对齐方法,实现个性化购买决策支持,结合高质量数据管道和两阶段对齐流程,提升摘要的一致性、基础性和偏好对齐性能。

Comments Code available at https://github.com/Harry20030331/SumForU

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2508.15066 2025-12-15 cs.MA cs.IR 78%

Osprey: Production-Ready Agentic AI for Safety-Critical Control Systems

Osprey:面向安全关键控制系统的生产级代理AI

Thorsten Hellert, João Montenegro, Antonin Sulc

专题命中 安全训练 :safety(title,abstract)

AI总结 Osprey通过四种机制解决安全关键控制系统的协调与安全问题,展示在先进光源中的生产应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07462 2025-12-15 cs.MA cs.AI cs.GT cs.LG math.DS 73%

Understanding LLM Agent Behaviours via Game Theory: Strategy Recognition, Biases and Multi-Agent Dynamics

通过博弈论理解LLM代理行为:策略识别、偏差与多代理动态

Trung-Kiet Huynh, Duy-Minh Dao-Sy, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information and Technology, Ho Chi Minh City University of Science (HCMUS), Vietnam(信息科技学院,胡志明市科学大学(HCMUS)) Vietnam National University - Ho Chi Minh City (VNU-HCM), Vietnam(越南国家大学-胡志明市(VNU-HCM)) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT))

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过扩展FAIRGAME框架,系统评估LLM在重复社会困境中的行为,揭示其策略识别、偏差及多代理动态,为AI治理和安全多代理系统设计提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11270 2025-12-15 cs.AI 57%

A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation

A-LAMP:基于代理的大型语言模型框架用于自动马尔可夫决策过程建模与策略生成

Hong Je-Gal, Chan-Bin Yi, Hyun-Suk Lee

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 A-LAMP通过基于代理的大型语言模型自动将自然语言任务描述转换为马尔可夫决策过程并生成策略,提升了自动化建模和策略生成的效率与准确性。

Comments NeurIPS 2025 Workshop: Multi-Turn Interactions in Large Language Models. 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2512.11783 2025-12-15 cs.CR cs.AI 79%

Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously

超后缀:同时绕过文本生成对齐和防护模型

Andrew Adiletta, Kathryn Adiletta, Kemal Derya, Berk Sunar

机构 * MITRE(MITRE公司) Worcester Polytechnic Institute(沃斯顿理工学院)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出超后缀技术,通过联合优化绕过Llama Prompt Guard 2,同时提出DeltaGuard检测方法提升对抗性提示防御效果。

Comments 13 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2512.09772 2025-12-15 cs.CL 79%

DeepSeek's WEIRD Behavior: The cultural alignment of Large Language Models and the effects of prompt language and cultural prompting

DeepSeek的WEIRD行为:大型语言模型的文化契合与提示语言和文化提示的影响

James Luther, Donald Brown

机构 * School of Data Science University of Virginia(数据科学学院 芝加哥大学)

专题命中 提示注入 :alignment(title,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在不同文化提示下的对齐行为,发现DeepSeek-V3和GPT-5在美文化下表现突出,而GPT-4在英文化下更接近中国,文化提示可调整这种对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2502.11028 2025-12-15 cs.CL cs.AI 73%

Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models

注意置信差距:大型语言模型中的过度自信、校准与干扰效应

Prateek Chhikara

机构 * University of Southern California(美国南加州大学)

专题命中 幻觉与事实性 :RLHF(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了大型语言模型中的过度自信问题,通过引入干扰项显著改善校准,提出针对性的改进策略以提升模型可靠性。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11750 2025-12-15 eess.SY cs.LG cs.SY 57%

LUCID: Learning-Enabled Uncertainty-Aware Certification of Stochastic Dynamical Systems

LUCID:基于学习的不确定性感知随机动力系统认证

Ernesto Casablanca, Oliver Schön, Paolo Zuliani, Sadegh Soudjani

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 LUCID通过学习控制障碍证书和傅里叶核展开,为随机动态系统提供鲁棒且高效的认证框架,实现形式安全保证。

Comments The manuscript has been accepted for publication in the main track of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11096 2025-12-15 cs.HC 50%

Your plan may succeed, but what about failure? Investigating how people use ChatGPT for long-term life task planning

你的计划可能成功,但失败呢?探究人们如何利用ChatGPT进行长期生活任务规划

Ben Wang, Jiqun Liu

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 研究探讨人们如何利用ChatGPT进行长期生活任务规划,发现AI在结构化目标和生成想法方面有帮助,但输出缺乏个性化和适应性,需用户主动调整。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 13 篇

2512.11421 2025-12-15 cs.AI 79%

Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance

通过行为指导实现可信的多轮大语言模型代理

Gonca Gürsun

机构 * Gonca Gürsun(独立研究者)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种框架,通过行为指导使大语言模型代理在多轮任务中实现可靠和可验证的行为。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10470 2025-12-15 cs.CL 79%

Statistical Analysis of Sentence Structures through ASCII, Lexical Alignment and PCA

通过ASCII、词性对齐和PCA进行句子结构的统计分析

Abhijeet Sahdev

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本研究通过ASCII、词性对齐和PCA分析句子结构的平衡,提出一种资源高效的统计方法,用于评估文本平衡并补充传统语法工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11412 2025-12-15 cs.CE cs.AI cs.CL cs.LG q-bio.BM 67%

Task-Specific Sparse Feature Masks for Molecular Toxicity Prediction with Chemical Language Models

针对分子毒性预测的特定任务稀疏特征掩码与化学语言模型

Kwun Sy Lee, Jiawei Chen, Fuk Sheng Ford Chung, Tianyu Zhao, Zhenyuan Chen, Debby D. Wang

机构 * School of Science and Technology(科学与技术学院) Hong Kong Metropolitan University(香港 Metropolitan 大学) Faculty of Engineering(工程学院) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多任务学习框架,通过稀疏注意力机制提升化学分子毒性预测的准确性和可解释性。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 67%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10313 2025-12-15 cs.AI cs.CY 62%

EpiPlanAgent: Agentic Automated Epidemic Response Planning

EpiPlanAgent:基于代理的自动化疫情响应规划

Kangkun Mao, Fang Xu, Jinru Ding, Yidong Jiang, Yujun Yao, Yirong Chen, Junming Liu, Xiaoqin Wu, Qian Wu, Xiaoyan Huang, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Center For Disease Control and Prevention(上海市疾病预防控制中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 EpiPlanAgent利用大语言模型和多代理框架,实现自动化疫情响应规划,显著提升计划完整性并减少开发时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11544 2025-12-15 cs.AI 57%

AI-MASLD Metabolic Dysfunction and Information Steatosis of Large Language Models in Unstructured Clinical Narratives

AI-MASLD 大语言模型在无结构临床叙述中的代谢功能障碍与信息脂肪变

Yuan Shen, Xiaojun Wu, Linghua Yu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究首次实证表明大语言模型在处理临床信息时表现出类似代谢功能障碍的特征,提出AI-MASLD概念,强调需在人类监督下使用LLMs作为辅助工具。

Comments 47 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11437 2025-12-15 cs.CL 57%

CLINIC: Evaluating Multilingual Trustworthiness in Language Models for Healthcare

CLINIC:评估语言模型在医疗领域的多语言可信度

Akash Ghosh, Srivarshinee Sridhar, Raghav Kaushik Ravi, Muhsin Muhsin, Sriparna Saha, Chirag Agarwal

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) IGIMS, Patna(帕纳布IGIMS) University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 CLINIC提出一个多语言基准,评估语言模型在医疗领域的可信度,揭示其在事实准确性、公平性和隐私保护方面的不足。

Comments 49 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11323 2025-12-15 cs.AI 57%

CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving

CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估

Jianyi Zhang, Ziyin Zhou, Xu Ji, Shizhao Liu, Zhangchi Zhao

机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16979 2025-12-15 cs.CV cs.AI 57%

The Finer the Better: Towards Granular-aware Open-set Domain Generalization

更细的更好:面向粒度感知的开集域泛化

Yunyun Wang, Zheng Duan, Xinyue Liao, Ke-Jia Chen, Songcan Chen

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 SeeCLIP通过细粒度语义增强解决开集域泛化中的结构风险与开放空间风险困境,提升模型对难区分未知类别的判别能力。

Comments 9 pages,3 figures,aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26898 2025-12-15 cs.LG 57%

Integrating Ontologies with Large Language Models for Enhanced Control Systems in Chemical Engineering

将本体与大语言模型结合以增强化工工程中的控制系统

Crystal Su, Kuai Yu, Jingrui Zhang, Mingyuan Shao, Daniel Bauer

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出结合本体的LLM框架,用于增强化工工程控制系统,通过结构化知识与生成推理结合,提升过程控制和安全分析的可解释性和可靠性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10968 2025-12-15 cs.CL cs.SD eess.AS 57%

Benchmarking Automatic Speech Recognition Models for African Languages

对非洲语言自动语音识别模型的基准测试

Alvin Nahabwe, Sulaiman Kagumire, Denis Musinguzi, Bruno Beijuka, Jonah Mubuuke Kyagaba, Peter Nabende, Andrew Katumba, Joyce Nakatumba-Nabende

机构 * Makerere University Centre for Artificial Intelligence(Makerere大学人工智能中心) Marconi Lab(Marconi实验室) Department of Information Systems(信息系统系) Department of Electrical Engineering(电气工程系) Department of Computer Science(计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究对四种最先进的ASR模型在13种非洲语言上进行基准测试,揭示不同模型在不同资源条件下的表现差异及优化策略。

Comments 19 pages, 8 figures, Deep Learning Indiba, Proceedings of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11680 2025-12-15 cs.CV 50%

Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing

跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解

Xu Zhang, Jiabin Fang, Zhuoming Ding, Jin Yuan, Xuan Liu, Qianjun Zhang, Zhiyong Li

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11215 2025-12-15 cs.CV 50%

SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection

SmokeBench: 评估多模态大语言模型用于野火烟雾检测

Tianye Qi, Weihao Li, Nick Barnes

机构 * Australian National University(澳大利亚国立大学)

专题命中 安全评测 :safety(abstract)

AI总结 SmokeBench评估多模态大语言模型在野火烟雾检测中的性能,发现模型在烟雾定位方面存在显著局限,尤其在早期阶段。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 8 篇

2512.11251 2025-12-15 cs.LG 79%

Insight Miner: A Time Series Analysis Dataset for Cross-Domain Alignment with Natural Language

Insight Miner: 一个用于跨领域对齐的时间序列分析数据集与自然语言

Yunkai Zhang, Yawen Zhang, Ming Zheng, Kezhen Chen, Chongyang Gao, Ruian Ge, Siyuan Teng, Amine Jelloul, Jinmeng Rao, Xiaoyuan Guo, Chiang-Wei Fang, Zeyu Zheng, Jie Yang

机构 * UC Berkeley(加州大学伯克利分校) Mineral(矿石) Northwestern University(西北大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 Insight Miner 是一个大规模多模态模型,通过代理工作流生成高质量时间序列描述,提升跨领域时间序列分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV 78%

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

专题命中 其他安全 :alignment(title,abstract)

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 67%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11661 2025-12-15 cs.HC cs.AI 57%

From Verification Burden to Trusted Collaboration: Design Goals for LLM-Assisted Literature Reviews

从验证负担到可信协作:LLM辅助文献综述的设计目标

Brenda Nogueira, Werner Geyer, Andrew Anderson, Toby Jia-Jun Li, Dongwhi Kim, Nuno Moniz, Nitesh V. Chawla

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文针对LLM辅助文献综述中的信任和协作问题,提出六个设计目标和框架,通过可视化、验证和反馈对齐提升可信度与协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11296 2025-12-15 cs.CV cs.AI cs.HC 57%

Few-Shot VLM-Based G-Code and HMI Verification in CNC Machining

少样本基于视觉语言模型的CNC加工G代码和人机界面验证

Yasaman Hashem Pour, Nazanin Mahjourian, Vinh Nguyen

机构 * Department of Mechanical and Aerospace Engineering, Michigan Technological University(机械与航空航天工程系,密歇根技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于视觉语言模型的少样本方法,用于验证CNC加工中G代码与人机界面的错误和安全状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11264 2025-12-15 physics.app-ph cond-mat.mtrl-sci 50%

Electrical Stability of Cr2O3/\b{eta}-Ga2O3 and NiOx/\b{eta}-Ga2O3 Heterojunction Diodes

Cr2O3/η-Ga2O3和NiOx/η-Ga2O3异质结二极管的电气稳定性

Yizheng Liu, Haochen Wang, Carl Peterson, Chinmoy Nath Saha, Chris G. Van de Walle, Sriram Krishnamoorthy

专题命中 其他安全 :alignment(abstract)

AI总结 Cr2O3基异质结二极管在高温和环境暴露下表现出更高的稳定性和性能,优于NiOx基异质结二极管。

详情

展开后加载摘要…

URL PDF HTML 收藏