arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2601.18306 2026-01-27 cs.CL cs.AI 62%

Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM

超越英语的校准:为更好的量化多语言大语言模型的语言多样性

Everlyn Asiko Chimoto, Mostafa Elhoushi, Bruce A. Bassett

机构 * Lelapa AI Cerebras Systems, Inc University of the Witwatersrand(乌得勒支大学) University of Cape Town(开普敦大学) South African Astronomical Observatory(南非天文台)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多语言校准集提升多语言大语言模型的量化性能,发现非英语和多语言混合校准显著降低困惑度,强调语言对齐的重要性。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12869 2026-01-27 cs.LG cs.AI cs.DC cs.IT cs.MA math.IT 62%

On the Fundamental Limits of LLMs at Scale

在大规模下的大语言模型根本限制

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zeeshan Memon, Muhammad Ibtsaam Qadir, Sagnik Bhattacharya, Hassan Rizwan, Abhiram R. Gorle, Maahe Zehra Kazmi, Nukhba Amir, Ali Subhan, Muhammad Usman Rafique, Zihao He, Pulkit Mehta, Muhammad Ali Jamshed, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学) Emory University(埃默里大学) Purdue University(普渡大学) UC Riverside(加州大学河滨分校) UC Berkeley(加州大学伯克利分校) Khyber Medical University(克希伯医学大学) Universtat Pompeu Fabra(庞培法华大学) Zoox(Zoox公司) Meta Google DeepMind(谷歌DeepMind) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Glasgow(格拉斯哥大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大规模大语言模型的根本限制,提出统一框架分析计算、信息和学习的基础限制,并提供缓解方法。

Comments Submitted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12442 2026-01-21 cs.LG cs.AI cs.CV 62%

Constraint-Aware Neurosymbolic Uncertainty Quantification with Bayesian Deep Learning for Scientific Discovery

具有贝叶斯深度学习的约束感知神经符号不确定性量化框架用于科学发现

Shahnawaz Alam, Mohammed Mudassir Uddin, Mohammed Kaif Pasha

机构 * Department of Computer Science and Engineering Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系穆法卡姆·贾赫工程与技术学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 CANUF通过结合贝叶斯深度学习与可微符号推理,首次实现科学预测中的不确定性量化、约束满足和可解释性解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10337 2026-01-15 cs.AI cs.LG 62%

A Curriculum Learning Approach to Reinforcement Learning: Leveraging RAG for Multimodal Question Answering

一种基于RAG的强化学习课程学习方法:用于多模态问答

Chenliang Zhang, Lin Wang, Yuanyuan Lu, Yusheng Qi, Kexin Wang, Peixu Hou, Wenshi Chen

机构 * Meituan(美团)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合课程学习与强化学习的方法,用于多模态问答任务,通过检索增强生成系统在挑战中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-01-12 cs.CL cs.AI 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12278 2026-01-12 cs.CV cs.AI cs.CL 62%

Controlled Automatic Task-Specific Synthetic Data Generation for Hallucination Detection

受控的自动任务特定合成数据生成用于幻觉检测

Yong Xie, Karan Aggarwal, Aitzaz Ahmad, Stephen Lau

机构 * Amazon(亚马逊)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种受控的自动任务特定合成数据生成方法,通过两步流程和数据混合策略提升幻觉检测的泛化能力和鲁棒性,实验表明其在幻觉检测任务中优于基于上下文学习的检测器。

Comments 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (ACM KDD 2024). Accepted by Workshop on Evaluation and Trustworthiness of Generative AI Models

Journal ref 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05376 2026-01-12 cs.AI cs.CL 62%

The Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language Models

医疗人设悖论:临床语言模型中的行为先验

Tassallah Abdullahi, Shrestha Ghosh, Hamish S Fraser, Daniel León Tramontini, Adeel Abbasi, Ghada Bourjeily, Carsten Eickhoff, Ritambhara Singh

机构 * Brown University(布朗大学) University of Tuebingen(图宾根大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示医疗人设在临床语言模型中产生上下文依赖的性能权衡,显示其在重症护理任务中提升表现,但在初级护理中降低性能,且互动风格影响风险倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04728 2026-01-09 cs.LG cs.AI 62%

Excess Description Length of Learning Generalizable Predictors

学习可泛化的预测器的超额描述长度

Elizabeth Donoway, Hailey Joren, Fabien Roger, Jan Leike

机构 * ucb(加州大学伯克利分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDL框架,用于量化微调提取的预测结构并评估模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-01-01 cs.CL cs.AI 62%

Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23547 2025-12-30 cs.CL cs.AI 62%

Lie to Me: Knowledge Graphs for Robust Hallucination Self-Detection in LLMs

对谎言说谎:知识图谱在大语言模型鲁棒性幻觉自检测中的应用

Sahil Kale, Antonio Luca Alfeo

机构 * eCampus University(eCampus大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出利用知识图谱提升大语言模型幻觉自检的鲁棒性,通过转换响应为图谱并估算幻觉可能性,实现准确率和F1分数的显著提升。

Comments Accepted to ICPRAM 2026 in Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22245 2025-12-30 cs.LG cs.AI 62%

Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation

校准大语言模型法官:用于快速可靠不确定性估计的线性探针

Bhaktipriya Radharapu, Eshika Saxena, Kenneth Li, Chenxi Whitehouse, Adina Williams, Nicola Cancedda

机构 * FAIR at Meta(Meta 的 FAIR 研究所) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于线性探针的校准方法,通过Brier分数损失训练,实现快速可靠的LLM法官不确定性估计,相比现有方法在计算效率和泛化能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01939 2025-12-22 astro-ph.IM astro-ph.SR cs.AI cs.LG 62%

SpecCLIP: Aligning and Translating Spectroscopic Measurements for Stars

SpecCLIP:对齐和翻译恒星光谱测量

Xiaosheng Zhao, Yang Huang, Guirong Xue, Xiao Kong, Jifeng Liu, Xiaoyu Tang, Timothy C. Beers, Yuan-Sen Ting, A-Li Luo

机构 * School of Astronomy Space Science, University of Chinese Academy of Sciences, Beijing 100049, People's Republic of China National Astronomical Observatories, Chinese Academy of Sciences, Beijing 100012, People's Republic of China Department of Physics \& Astronomy, The Johns Hopkins University, Baltimore, MD 21218, USA Zhejiang Laboratory, Hangzhou 311121, People's Republic of China Research Center for Astronomical Computing, Zhejiang Laboratory, Hangzhou 311121, People's Republic of China Department of Physics Astronomy, University of Notre Dame, Notre Dame, IN 46556, USA Joint Institute for Nuclear Astrophysics -- Center for the Evolution of the Elements (JINA-CEE), USA Department of Astronomy, The Ohio State University, 140 West 18th Avenue, Columbus, OH 43210, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 SpecCLIP通过对比学习和光谱意识解码器提升恒星光谱分析的精度和应用灵活性。

Comments 29 pages, 8 figures, 6 tables. Accepted for publication in ApJ. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15663 2025-12-18 cs.AI cs.CL 62%

Explaining the Reasoning of Large Language Models Using Attribution Graphs

通过归因图解释大语言模型的推理过程

Chase Walker, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14220 2025-12-17 cs.LG cs.AI 62%

Estimating problem difficulty without ground truth using Large Language Model comparisons

无需真实数据即可利用大语言模型比较估计问题难度

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM compare方法,通过大语言模型的成对比较估计问题难度,克服传统方法在分布外问题上的局限性,具有高一致性与鲁棒性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09340 2025-12-11 cs.AI cs.CV cs.LG 62%

Visual Categorization Across Minds and Models: Cognitive Analysis of Human Labeling and Neuro-Symbolic Integration

跨心灵与模型的视觉分类:人类标注与神经符号整合的认知分析

Chethana Prasad Kabgere

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过对比人类与AI在低分辨率图像标注中的表现,探讨了认知策略与神经符号整合方法的异同,旨在推动更可解释和认知对齐的AI系统发展。

Comments 12 pages, 3 figures. Research manuscript based on the final project for CS6795 (Introduction to Cognitive Science), Georgia Tech

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12992 2025-12-10 cs.CL cs.AI 62%

B-cos LM: Efficiently Transforming Pre-trained Language Models for Improved Explainability

B-cos LM:高效地将预训练语言模型转换以提高可解释性

Yifan Wang, Sukrut Rao, Ji-Ung Lee, Mayank Jobanputra, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔兰计算机科学校区)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出B-cos LM,通过结合B-cos转换和任务微调,提高预训练语言模型的可解释性与效率。

Comments TMLR 12/2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06406 2025-12-09 cs.AI cs.LG 62%

UncertaintyZoo: A Unified Toolkit for Quantifying Predictive Uncertainty in Deep Learning Systems

UncertaintyZoo: 一个统一的工具包,用于量化深度学习系统中的预测不确定性

Xianzong Wu, Xiaohong Li, Lili Quan, Qiang Hu

机构 * Tianjin University(天津大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 UncertaintyZoo是一个统一的工具包,整合了29种不确定性量化方法,用于量化深度学习系统中的预测不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02324 2025-12-09 cs.CL cs.AI 62%

Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning

通过CASAL减少幻觉:对比激活引导用于近似学习

Wannan, Yang, Xinchi Qiu, Lei Yu, Yuchen Zhang, Aobo Yang, Narine Kokhlikyan, Nicola Cancedda, Diego Garcia-Olano

机构 * Meta Superintelligence Labs(Meta超级智能实验室) New York University(纽约大学)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 CASAL通过对比激活引导减少LLM幻觉,提升模型可解释性和实用性,适用于多种模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 62%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21762 2025-12-01 cs.CL cs.AI 62%

Factors That Support Grounded Responses in LLM Conversations: A Rapid Review

支持LLM对话中基础响应的因素:一项快速回顾

Gabriele Cesar Iwashima, Claudia Susie Rodrigues, Claudio Dipolitto, Geraldo Xexéo

机构 * (June 2025)((2025年6月))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过快速回顾识别了支持LLM对话中基础响应的因素,重点分析了推理时间、训练后及强化学习方法,旨在提升LLM响应的准确性和可靠性。

Comments 28 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18847 2025-11-26 cs.CL cs.AI 62%

ConfTuner: Training Large Language Models to Express Their Confidence Verbally

ConfTuner: 训练大型语言模型以口头表达其置信度

Yibo Li, Miao Xiong, Jiaying Wu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 ConfTuner通过引入标记化布里尔分数损失函数,有效提升大型语言模型的置信度校准能力,适用于多种推理任务并泛化至黑盒模型。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16690 2025-11-26 cs.LG cs.AI 62%

Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator

你的预训练大语言模型实际上是一个未监督的置信度校准器

Beier Luo, Shuoyuan Wang, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DACA方法,通过无监督方式优化后训练模型的置信度校准,减少不一致预测带来的过度自信问题,提升模型可靠性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18874 2025-11-25 cs.AI cs.CV cs.LG cs.MA cs.RO cs.SI 62%

GContextFormer: A global context-aware hybrid multi-head attention approach with scaled additive aggregation for multimodal trajectory prediction

GContextFormer: 一种基于全局上下文的混合多头注意力方法,通过缩放加法聚合实现多模态轨迹预测

Yuzhi Chen, Yuanchang Xie, Lei Zhao, Pan Liu, Yajie Zou, Chen Wang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GContextFormer通过全局上下文感知的混合多头注意力和缩放加法聚合,实现无地图依赖的多模态轨迹预测,提升鲁棒性和预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13246 2025-11-21 cs.CL cs.AI 62%

Atomic Calibration of LLMs in Long-Form Generations

大语言模型在长文本生成中的原子校准

Caiqi Zhang, Ruihan Yang, Zhisong Zhang, Xinting Huang, Sen Yang, Dong Yu, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出原子校准方法,用于改进大语言模型在长文本生成中的校准能力,揭示置信度方法与生成过程中置信度变化的关联。

Comments ACL 2025 KnowFM Oral / AACL-IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15511 2025-11-20 cs.HC cs.CY cs.LG 62%

The Trust Calibration Maturity Model for Characterizing and Communicating Trustworthiness of AI Systems

Scott T Steinmetz, Asmeret Naugle, Paul Schutte, Matt Sweitzer, Alex Washburne, Lisa Linville, Daniel Krofcheck, Michal Kucer, Samuel Myren

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY、cs.LG

Comments 19 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15005 2025-11-20 cs.CL cs.AI 62%

Mathematical Analysis of Hallucination Dynamics in Large Language Models: Uncertainty Quantification, Advanced Decoding, and Principled Mitigation

Moses Kiprono

机构 * Catholic University of America(美国天主教大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments 10 pages, theoretical/mathematical LLM research, no figures, intended for peer-reviewed journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01956 2025-11-18 cs.LG cs.CY stat.ML 62%

EXAGREE: Mitigating Explanation Disagreement with Stakeholder-Aligned Models

Sichao Li, Tommy Liu, Quanling Deng, Amanda S. Barnard

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15901 2025-11-17 cs.CL cs.AI 62%

Re-FRAME the Meeting Summarization SCOPE: Fact-Based Summarization and Personalization via Questions

Frederic Kirstein, Sonu Kumar, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12767 2025-11-11 cs.CL cs.AI 62%

R2-KG: General-Purpose Dual-Agent Framework for Reliable Reasoning on Knowledge Graphs

Sumin Jo, Junseong Choi, Jiho Kim, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04847 2025-11-07 cs.CL cs.AI 62%

Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards

Manveer Singh Tamber, Forrest Sheng Bao, Chenyu Xu, Ge Luo, Suleman Kazi, Minseok Bae, Miaoran Li, Ofer Mendelevitch, Renyi Qu, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Vectara(Vectara公司) Iowa State University(爱荷华州立大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments EMNLP Industry Track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏