arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-06 至 2026-01-06 共收录 25 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 25 篇

2601.01816 2026-01-06 cs.AI 80%

Admissibility Alignment

可接受性对齐

Chris Duffey

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出MAP-AI架构,通过蒙特卡洛方法评估决策策略的可接受性,实现AI对齐的动态决策理论属性。

Comments 24 pages, 2 figures, 2 tables.. Decision-theoretic alignment under uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02215 2026-01-06 cs.SE cs.AI 79%

LLM-Empowered Functional Safety and Security by Design in Automotive Systems

基于大语言模型的汽车系统功能安全与安全设计

Nenad Petrovic, Vahid Zolfaghari, Fengjunjie Pan, Alois Knoll

机构 * European Chips Joint Undertaking(欧洲芯片联合计划) Federal Ministry of Research, Technology and Space of Germany(德国联邦科研、技术和空间 ministry)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型提升汽车系统功能安全与安全设计的方法,通过事件链模型和MDE方法实现安全拓扑设计和代码分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01024 2026-01-06 cs.CV cs.AI cs.IR 79%

ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval

ITSELF: 基于注意力引导的细粒度对齐用于视觉-语言检索

Tien-Huy Nguyen, Huu-Loc Tran, Thanh Duc Ngo

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 ITSELF通过基于注意力引导的细粒度对齐框架,在视觉-语言检索任务中实现最先进的性能和跨数据集泛化能力。

Comments Accepted at WACV Main Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00926 2026-01-06 cs.IR cs.AI 79%

MACA: A Framework for Distilling Trustworthy LLMs into Efficient Retrievers

MACA:一种将可信大语言模型提炼为高效检索器的框架

Satya Swaroop Gudipudi, Sahil Girhepuje, Ponnurangam Kumaraguru, Kristine Ma

机构 * JP Morgan Chase(摩根大通公司) IIIT Hyderabad(海得拉巴印度理工学院)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI

AI总结 MACA通过提炼可信LLM为高效检索器,提升检索准确率并减少LLM调用成本

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00588 2026-01-06 cs.CL 79%

CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns

CSSBench: 评估轻量级大语言模型对中文特定对抗模式的安全性

Zhenhong Zhou, Shilinlu Yan, Chuanpu Liu, Qiankun Li, Kun Wang, Zhigang Zeng

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 CSSBench通过评估中文特定对抗模式,揭示轻量级大语言模型在中文环境下的安全挑战,为实际应用提供安全评估框架。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19991 2026-01-06 cs.SD cs.LG 79%

SAMUeL: Efficient Vocal-Conditioned Music Generation via Soft Alignment Attention and Latent Diffusion

SAMUeL:通过软对齐注意力和潜在扩散实现高效的语音条件音乐生成

Hei Shing Cheung, Boya Zhang, Jonathan H. Chan

机构 * Division of Engineering Science University of Toronto(工程科学系 马尼托瓦大学) Innovative Cognitive Computing Center King Mongkut's University of Technology Thonburi(创新认知计算中心 王后大学技术吞武里)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 SAMUeL通过软对齐注意力和潜在扩散技术,实现高效的语音条件音乐生成,参数减少220倍,推理速度提升52倍,性能优于OpenAI Jukebox。

Comments 7 pages, 3 figures, accepted to IEEE/WIC WI-IAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06142 2026-01-06 cs.CV 78%

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

专题命中 安全评测 :safety(title,abstract)

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 70%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01532 2026-01-06 cs.AI cs.CL cs.LG 67%

Aletheia: Quantifying Cognitive Conviction in Reasoning Models via Regularized Inverse Confusion Matrix

Aletheia: 通过正则化逆混淆矩阵量化推理模型中的认知信念

Fanzhe Fu

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Aletheia通过正则化逆混淆矩阵量化推理模型中的认知信念,探索AI科学诚信的测量方法。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02147 2026-01-06 cs.CV cs.AI cs.LG 62%

BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models

BiPrompt:面向视觉与文本去偏的双重视觉语言模型双向提示优化

Sunny Gupta, Shounak Das, Amit Sethi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 BiPrompt通过双重视觉语言模型双向提示优化,同时减轻视觉和文本中的非因果特征依赖,提升模型在分布偏移下的鲁棒性和因果推理能力。

Comments Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01966 2026-01-06 cs.LG cs.AI 62%

Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior

细化溯源推断:从模型行为检测LLM细化训练提示

Bo Yin, Qi Li, Runpeng Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RePro框架,通过教师强制的似然特征与logit排名信号融合,实现对LLM细化训练提示的溯源推断,具有跨模型和训练设置的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06478 2026-01-06 cs.LG cs.AI 62%

Anytime-Valid Answer Sufficiency Certificates for LLM Generation via Sequential Information Lift

通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书,利用经验动态形式提升方法,在减少生成长度的同时保持delta级误差控制,并通过轻量级正确性门提升端任务正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL 62%

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14772 2026-01-06 cs.CL cs.LG stat.ML 62%

Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions

大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向

Luyang Fang, Xiaowei Yu, Jiazhang Cai, Yongkai Chen, Shushan Wu, Zhengliang Liu, Zhenyuan Yang, Haoran Lu, Xilin Gong, Yufang Liu, Terry Ma, Wei Ruan, Ali Abbasi, Jing Zhang, Tao Wang, Ehsan Latif, Weihang You, Hanqi Jiang, Wei Liu, Wei Zhang, Soheil Kolouri, Xiaoming Zhai, Dajiang Zhu, Wenxuan Zhong, Tianming Liu, Ping Ma

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大型语言模型的知识蒸馏与数据集蒸馏技术,探讨了其在压缩模型、保持推理能力及语言多样性方面的挑战与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18499 2026-01-06 stat.ML cs.LG 57%

Training More Robust Classification Model via Discriminative Loss and Gaussian Noise Injection

通过判别损失和高斯噪声注入训练更鲁棒的分类模型

Hai-Vy Nguyen, Fabrice Gamboa, Sixin Zhang, Reda Chhaibi, Serge Gratton, Thierry Giaccone

机构 * Ampere Software Technology(Ampere软件技术公司) Institut de mathématiques de Toulouse(图卢兹数学研究所) Institut de Recherche en Informatique de Toulouse(图卢兹计算机研究所) Laboratoire Jean Alexandre Dieudonné, Université Côte d’Azur(坎特伯雷大学Dieudonné实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过判别损失和高斯噪声注入提升模型鲁棒性,增强特征判别性和类别分离性,同时减少损失曲率以提升鲁棒性。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01743 2026-01-06 cs.AI 57%

AI Agent Systems: Architectures, Applications, and Evaluation

AI代理系统:架构、应用与评估

Bin Xu

机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01341 2026-01-06 cs.CL 57%

Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems

基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性

Md Abdullah Al Kafi, Raka Moni, Sumit Kumar Banshal

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01118 2026-01-06 cs.IR cs.AI cs.DL 57%

ScienceDB AI: An LLM-Driven Agentic Recommender System for Large-Scale Scientific Data Sharing Services

ScienceDB AI: 基于大语言模型的代理推荐系统用于大规模科学数据共享服务

Qingqing Long, Haotian Chen, Chenyang Zhao, Xiaolei Du, Xuezhi Wang, Pengyao Wang, Chengzan Li, Yuanchun Zhou, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 ScienceDB AI 是首个基于大语言模型的对话推荐系统,专为大规模科学数据共享服务设计,通过自然语言对话和深度推理实现精准的数据集推荐。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00930 2026-01-06 cs.IR cs.AI 57%

AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation

AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统

Nicolas Bougie, Gian Maria Marconi, Tony Yip, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24712 2026-01-06 cs.RO cs.AI 57%

LSRE: Latent Semantic Rule Encoding for Real-Time Semantic Risk Detection in Autonomous Driving

LSRE: 隐式语义规则编码用于自动驾驶中的实时语义风险检测

Qian Cheng, Weitao Zhou, Cheng Jing, Nanshan Deng, Junze Wen, Zhaoyang Liu, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 LSRE通过隐式语义规则编码实现自动驾驶中的实时语义风险检测,以10 Hz速度提供高效准确的危险预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00845 2026-01-06 cs.AI 57%

Enhancing Temporal Awareness in LLMs for Temporal Point Processes

增强大语言模型在时序点过程中的时间感知能力

Lili Chen, Wensheng Gan, Shuang Liang, Philip S. Yu

机构 * School of Computer Science and Technology, Tongji University, Shanghai 201804, China(计算机科学与技术学院,同济大学) College of Cyber Security, Jinan University, Guangzhou 510632, China(网络安全学院,暨南大学) Department of Computer Science, University of Illinois Chicago, Chicago, USA(计算机科学系,伊利诺伊大学芝加哥分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 TPP-TAL通过增强LLMs的时间感知能力,改进了时序点过程中的时间似然估计和事件预测准确性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02304 2026-01-06 cs.DB 50%

Octopus: A Lightweight Entity-Aware System for Multi-Table Data Discovery and Cell-Level Retrieval

Octopus: 一种轻量级的实体感知多表数据发现与单元格级检索系统

Wen-Zhi Li, Sainyam Galhotra

专题命中 安全评测 :alignment(abstract)

AI总结 Octopus是一种无需训练的轻量级系统,通过细粒度实体识别和直接扫描表内容,实现多表数据发现和单元格级值检索,提高准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09592 2026-01-06 cs.SE 50%

What Does Explainable AI Mean in Practice? Evaluative Requirements from a Longitudinal Clinical Case Study

在实践中可解释人工智能意味着什么?来自长期临床案例研究的评估要求

Tor Sporsem, Stine Rasdal Finserås, Lars Adde, Inga Strümke

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文通过长期临床案例研究,探讨了在专家领域中构建可信AI系统所需的评估需求,发现医生更信任能与自身评估对比的简单预测图。

Comments Accepted to ICSE SEIP 2026 in Rio de Janeiro, 12-18 April

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10048 2026-01-06 cs.HC 50%

Between Knowledge and Care: Evaluating Generative AI-Based IUI in Type 2 Diabetes Management Through Patient and Physician Perspectives

在知识与关怀之间:通过患者和医师视角评估生成式AI在2型糖尿病管理中的IUI

Yibo Meng, Ruiqi Chen, Bingyi Liu, Yan Guan, Xiaolan Ding

专题命中 安全评测 :safety(abstract)

AI总结 本文通过患者和医师视角评估生成式AI在2型糖尿病管理中的应用,揭示其在安全性、情境判断和责任边界方面的不足,提出需智能界面调解AI输出以支持长期护理中的信任与责任。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00839 2026-01-06 cs.CV 50%

Unified Review and Benchmark of Deep Segmentation Architectures for Cardiac Ultrasound on CAMUS

针对心脏超声的深度分割架构的统一回顾与基准测试:CAMUS

Zahid Ullah, Muhammad Hilal, Eunsoo Lee, Dragan Pamucar, Jihie Kim

机构 * Department of Computer Science Artificial Intelligence, Dongguk University, Seoul 04620, Republic of Korea Department of Semiconductor System Engineering, Sejong University, Seoul, 05006, Republic of Korea Department of Operations Research Statistics, Faculty of Organizational Sciences, University of Belgrade, Belgrade, Serbia Department of Industrial Engineering \& Management, Yuan Ze University, Taoyuan City 320315, Taiwan Department of Applied Mathematical Science, College of Science Technology, Korea University, Sejong 30019, Republic of Korea

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过统一基准测试评估了三种心脏超声分割架构的性能,提出标准化预处理方法,并展望了自监督和多模态标注技术的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏