arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-03 至 2026-03-03 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 9 篇

2603.02128 2026-03-03 cs.CL cs.AI cs.CY 82%

LLMs as Strategic Actors: Behavioral Alignment, Risk Calibration, and Argumentation Framing in Geopolitical Simulations

大语言模型作为战略行为体:地缘政治模拟中的行为对齐、风险校准与论证框架

Veronika Solopova, Viktoria Skorik, Maksym Tereshchenko, Alina Haidun, Ostap Vykhopen

机构 * Mantisanalytics

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究了大语言模型在地缘政治模拟中的行为表现,发现其在初期能模拟人类决策,但随时间推移表现出不同的策略特征,且在论证框架上偏向规范性与合作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01981 2026-03-03 stat.AP 78%

Quantifying Uncertainty in Void Swelling Prediction: A Conformal Prediction Framework for Reactor Safety Margins

量化空洞膨胀预测中的不确定性:一种用于反应堆安全余量的符合预测框架

Minhee Kim, Yong Yang

专题命中 幻觉与事实性 :safety(title,abstract)

AI总结 本文提出一种结合集成机器学习与符合预测框架,用于量化空洞膨胀预测中的不确定性,以提升反应堆安全余量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01907 2026-03-03 cs.LG cs.CL 62%

Efficient RLVR Training via Weighted Mutual Information Data Selection

通过加权互信息数据选择实现高效的RLVR训练

Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 InSight通过加权互信息数据选择方法提升RLVR训练效率,实现性能和加速的显著提升。

Comments 15 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20095 2026-03-03 cs.CV cs.CL cs.LG 62%

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

BioCAP: 利用合成描述性注释超越标签在生物基础模型中的应用

Ziheng Zhang, Xinyue Ma, Arpita Chowdhury, Elizabeth G. Campolongo, Matthew J. Thompson, Net Zhang, Samuel Stevens, Hilmar Lapp, Tanya Berger-Wolf, Yu Su, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Duke University(杜克大学) Boston University(波士顿大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 BioCAP通过生成合成描述性注释提升生物基础模型的性能,实现物种分类和文本-图像检索的高准确率。

Comments ICLR 2026; Project page: https://imageomics.github.io/biocap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25532 2026-03-03 cs.CL cs.AI 62%

Calibrating Verbalized Confidence with Self-Generated Distractors

校准带有自生成干扰项的置信度

Victor Wang, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DINCO方法,通过自生成干扰项和归一化置信度校准,提升大型语言模型的置信度估计准确性。

Comments ICLR 2026. Code: https://github.com/victorwang37/dinco

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15888 2026-03-03 cs.CL cs.AI 62%

Distribution-Aligned Decoding for Efficient LLM Task Adaptation

面向高效大语言模型任务适应的分布对齐解码

Senkang Hu, Xudong Han, Jinqi Jiang, Yihang Tao, Zihan Fang, Yong Dai, Sam Tak Wu Kwong, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) City University of Hong Kong(香港城市大学) University of Sussex(苏塞克斯大学) Huazhong University of Science and Technology(华中科技大学) Fudan University(复旦大学) Lingnan University(岭大大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SVDecode通过引导输出分布对齐提升大语言模型任务适应性能,理论证明其与全微调等价,实验显示在多个任务上准确率提升显著。

Comments Accepted by NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01502 2026-03-03 cs.CL eess.AS 57%

Anatomy of the Modality Gap: Dissecting the Internal States of End-to-End Speech LLMs

模态差距的解剖:剖析端到端语音大语言模型的内部状态

Ming-Hao Hsu, Xueyao Zhang, Xiaohai Tian, Jun Zhang, Zhizheng Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文研究了端到端语音大语言模型中语音与文本表示的跨层对齐特性,揭示了语音冗余性导致的模态差距问题,并提出未来需在标记或时间粒度上进行优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01426 2026-03-03 cs.CL 57%

Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics

通过注意力动态理解LLMs中键值缓存压缩的物理原理

Samhruth Ananthanarayanan, Ayan Sengupta, Tanmoy Chakraborty

机构 * IIT Delhi, India(德里印度理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 通过分析LLMs中键值缓存压缩的物理机制,揭示了压缩对内部表示和语义可达性的影响,以及不同架构在路由动态上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01205 2026-03-03 cs.CV 50%

CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling

CoSMo3D:通过LLM引导的规范空间建模实现开放世界可提示的3D语义部分分割

Li Jin, Weikai Chen, Yujie Wang, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Shengju Qian, Xin Wang, Xueying Qin

机构 * SDU(山东大学) LIGHTSPEED(LIGHTSPEED公司) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 CoSMo3D通过LLM引导的规范空间建模实现开放世界可提示的3D语义部分分割,提升语义稳定性和可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏