arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-14 至 2026-01-14 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 14 篇

2505.16237 2026-01-14 cs.CL 79%

Align-GRAG: Anchor and Rationale Guided Dual Alignment for Graph Retrieval-Augmented Generation

Align-GRAG: 基于锚点和推理引导的双 Alignment 图检索增强生成

Derong Xu, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Maolin Wang, Qidong Liu, Xiangyu Zhao, Yichao Wang, Huifeng Guo, Ruiming Tang, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 Align-GRAG通过锚点和推理引导的双 Alignment 框架,提升图检索增强生成的准确性与语义对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-01-14 cs.CV cs.AI 74%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04563 2026-01-14 cs.LG cs.AI cs.CL cs.CV 67%

A Vision for Multisensory Intelligence: Sensing, Science, and Synergy

多感官智能的愿景:感知、科学与协同

Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出未来十年多感官人工智能的研究愿景,强调通过感知、科学和协同三大主题推动多感官技术发展,提升人与AI的交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08634 2026-01-14 cs.CL cs.AI 62%

Moral Lenses, Political Coordinates: Towards Ideological Positioning of Morally Conditioned LLMs

道德透镜,政治坐标:迈向道德条件化大语言模型的意识形态定位

Chenchen Yuan, Bolei Ma, Zheyu Zhang, Bardh Prenkaj, Frauke Kreuter, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过道德条件化大语言模型,探索道德价值观与政治倾向之间的因果关系,揭示道德取向对政治坐标的影响,并提出更社会化的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08169 2026-01-14 cs.CL cs.LG 62%

Relational Knowledge Distillation Using Fine-tuned Function Vectors

基于微调函数向量的关系知识蒸馏

Andrea Kang, Yingnian Wu, Hongjing Lu

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 通过微调函数向量提升关系知识表示,增强语言模型的类比推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08079 2026-01-14 cs.AI cs.CL cs.IR 62%

MemoBrain: Executive Memory as an Agentic Brain for Reasoning

MemoBrain: 作为推理代理的执行记忆脑

Hongjin Qian, Zhao Cao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MemoBrain通过构建依赖感知的记忆模型,实现对长周期推理轨迹的显式认知控制,提升工具增强代理的推理连贯性和任务对齐性。

Comments Our codes are in https://github.com/qhjqhj00/MemoBrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07892 2026-01-14 cs.LG cs.AI 62%

Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification

Sherry:通过细粒度稀疏化实现高效的1.25位三元量化

Hong Huang, Decheng Wu, Qiangqiang Hu, Guanghua Yu, Jinhai Yang, Jianchen Zhu, Xue Liu, Dapeng Wu

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯) McGill University(麦吉尔大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Sherry通过细粒度稀疏化实现高效的1.25位三元量化,显著减少模型大小并提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04954 2026-01-14 cs.LG cs.AI 62%

Precision over Diversity: High-Precision Reward Generalizes to Robust Instruction Following

精确性胜过多样性:高精度奖励能泛化到稳健的指令跟随

Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Haonan Song, Wu Ning, Dandan Tu, Qixun Zhang, Bibo Cai, Yuxiang He, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨工业大学,SCIR) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现高精度奖励优于多样化的约束混合,提出数据导向的优化策略,提升指令跟随性能并减少训练时间。

Comments Under review, 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04948 2026-01-14 cs.CL cs.AI 62%

KaLM: Knowledge-aligned Autoregressive Language Modeling via Dual-view Knowledge Graph Contrastive Learning

KaLM: 通过双视角知识图谱对比学习实现知识对齐的自回归语言模型

Peng Yu, Cheng Deng, Beiya Dai, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 KaLM通过双视角知识图谱对比学习和三元组完成语言模型,实现LLMs与知识图谱的对齐,提升知识驱动任务的性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-50906-6}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08401 2026-01-14 cs.CV cs.AI 57%

An Explainable Two Stage Deep Learning Framework for Pericoronitis Assessment in Panoramic Radiographs Using YOLOv8 and ResNet-50

可解释的两阶段深度学习框架用于全景X光片中牙周炎评估:使用YOLOv8和ResNet-50

Ajo Babu George, Pranav S, Kunal Agarwal

机构 * DiceMed College of Engineering Trivandrum(工程学院) S.C.B Dental College and Hospital(S.C.B牙科学院和医院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种结合YOLOv8和ResNet-50的两阶段深度学习框架,用于可解释性地评估全景X光片中的牙周炎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08017 2026-01-14 cs.CV cs.AI 57%

Representations of Text and Images Align From Layer One

文本和图像的表示从第一层对齐

Evžen Wybitul, Javier Rando, Florian Tramèr, Stanislav Fort

机构 * D-INFK, ETH Zurich, Switzerland(苏黎世联邦理工学院信息与知识系统研究所) Aisle Research(Aisle研究)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究通过合成方法证明,视觉-语言模型中图像和文本表示在第一层即可实现对齐,为模型可解释性提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07939 2026-01-14 cs.SE cs.AI 57%

SECite: Analyzing and Summarizing Citations in Software Engineering Literature

SECite: 分析和总结软件工程文献中的引用

Shireesh Reddy Pyreddy, Khaja Valli Pathan, Hasan Masum, Tarannum Shaila Zaman

机构 * Dept. of Computer Science SUNY Polytechnic Institute(计算机科学系圣尼古拉学院) Dept. of Information Systems University of Maryland Baltimore County(信息系统系马里兰大学巴尔的摩县)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SECite通过分析文献引用中的情感倾向,结合生成式AI生成摘要,提供了一种评估学术贡献的综合框架。

Comments Accepted at IEEE CCWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07976 2026-01-14 eess.IV cs.CV eess.SP physics.med-ph 50%

Application of Ideal Observer for Thresholded Data in Search Task

理想观察者在阈值化数据中的应用:搜索任务中的图像质量评估

Hongwei Lin, Howard C. Gifford

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种基于阈值化数据的类人视觉搜索模型观察者,通过选择性处理高显著性特征提升图像质量评估性能,适用于临床真实任务和资源受限的模型训练。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03486 2026-01-14 eess.SY cs.SY 50%

Adaptive Model-Based Reinforcement Learning for Orbit Feedback Control in NSLS-II Storage Ring

自适应模型驱动强化学习用于NSLS-II存储环轨道反馈控制

Zeyu Dong, Yuke Tian, Yu Sun

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于模型驱动强化学习的自适应框架,用于NSLS-II存储环轨道反馈控制,通过轨迹优化和在线模型优化实现束流稳定与对准误差最小化。

Comments Accepted by the 20th International Conference on Accelerator and Large Experimental Physics Control Systems (ICALEPCS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏