arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 14 篇

2608.29492 2026-09-01 cs.CL 新提交 83%

CoCoA: Context-Conditional Cultural Alignment for Large Language Models

CoCoA:面向大语言模型的上下文条件文化对齐

Kyungdon Lee, Wei Xu, Alan Ritter, Dong-Ho Lee, JinYeong Bak

机构 * Sungkyunkwan University(成均馆大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 CoCoA是面向大语言模型的上下文条件文化对齐框架,通过双上下文训练等方法,可降低实体文化偏见评分且对通用性能影响小,为缓解LLMs实体文化偏见提供新方向。

Comments Accepted to Findings of EMNLP 2026. 22 pages, 4 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-09-01 cs.CL cs.AI cs.LG 版本更新 82%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30676 2026-09-01 cs.AI 新提交 81%

MedAgent-R1: Faithfulness-Aware Reinforcement Learning for Evidence-Grounded Medical Reasoning

MedAgent-R1:面向证据 grounded 医疗推理的忠实性感知强化学习

Jiangwang Chen, Chenghao Zhang, Hengxing Cai

机构 * Tsinghua University(清华大学) DP Technology(第四范式)

专题命中 幻觉与事实性 :safety(summary_cn,abstract);分类 cs.AI

AI总结 MedAgent-R1 针对医疗推理智能体的自信幻觉问题,采用忠实性门控奖励设计,大幅降低引用编造率、提升证据完整性,在 HealthBench Safety 上表现优于 GPT-4o,实现了证据 grounded 的医疗推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03136 2026-09-01 cs.CL 版本更新 70%

Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models

超越最终层:大型语言模型中用于更好多语言校准的中间表征

Ej Zhou, Caiqi Zhang, Tiancheng Hu, Chengzu Li, Nigel Collier, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本研究针对多语言校准问题,发现LLMs的后期中间层比最终层更适合提供可靠的多语言置信信号,提出无训练方法LACE以提升多语言校准,助力构建更公平可信的LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30987 2026-09-01 cs.CL cs.AI cs.LG 新提交 67%

Stick to What You Know: A Study of Knowledge-Aligned Supervised Fine-Tuning

坚持你所知:知识对齐的监督微调研究

Arthur Becker, Jakob Kemmler, David Thulke, Christine Schäfer, Christian Dugast, Hermann Ney

机构 * AppTek GmbH(AppTek有限公司) RWTH Aachen University(亚琛工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出知识对齐的监督微调方法,引入证据重写、回忆重写两个变体,实验显示其可减少事实幻觉、保留通用能力,回忆重写效果最优且改善弃权行为,证实超知识SFT目标会引发幻觉。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30646 2026-09-01 cs.CL cs.AI cs.LG 新提交 67%

BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs

BiG-SURE - 用于大语言模型语义不确定性与可靠性估计的二分图

Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BiG-SURE是一种基于跨温度语义一致性的二分图方法,用于黑盒LLMs/VLMs的语义不确定性与可靠性估计,在多类问答任务上提升了弃权AUROC性能。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02182 2026-09-01 cs.LG cs.CL 版本更新 62%

Bayesian Sparse Low-Rank Adaptation for Large Language Model Uncertainty Estimation

贝叶斯稀疏低秩自适应用于大语言模型不确定性估计

Jijie Zhang, Zhe Ren, Quan Zhang, Dandan Guo

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Michigan State University(密歇根州立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出DALorRA,一种变分贝叶斯稀疏框架,通过随机掩码低秩适应中的秩维度实现模型容量正则化和校准,在不牺牲推理精度下提升LLM校准性能。

Comments To appear in EMNLP 2026. 17 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-09-01 cs.CL cs.AI 版本更新 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-09-01 cs.CL cs.AI 版本更新 62%

Entropy-Aware Token Rejection for Improving Speculative Decoding

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29956 2026-09-01 cs.CL 新提交 57%

Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

基于语言、行为和机制指标检测大语言模型中的隐藏思维链

Armaan Singh, Ryan Trinh Le, Jasmine Kaur, Abdullah Sultan, Edward Lue Chee Lip, Kiran Nijjer, Adnan Ahmed, Vasu Sharma

机构 * Stanford University(斯坦福大学) York University(约克大学) Facebook(脸书)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究提出HCDS指标,通过语言、行为和机制信号检测大语言模型的隐藏思维链,在GSM8K上验证了Qwen3-4B变体存在类潜在推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30946 2026-09-01 cs.LG nlin.AO 新提交 57%

Reproducible macroscopic dynamics in a closed-loop human-AI learning system

闭环人机学习系统中可复现的宏观动力学

Minlin Wu (1), Xu Fang (1), Yicheng Zhang (2), Chenyu Zhou (1), Zhiyi Liu (1) ((1) Tianli Qiming AI Research Institute, Sichuan Qiming Daren Technology Co., Ltd., Chengdu, China, (2) Swiss AI Laboratories, Blonay, Switzerland)

机构 * Tianli Qiming AI Research Institute(天立启明人工智能研究院) Sichuan Qiming Daren Technology Co., Ltd.(四川启铭达人科技有限公司) Swiss AI Laboratories(瑞士人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 该研究基于297915名学习者的自适应辅导历史,构建人机学习系统的动力学模型,揭示可复现的宏观动力学规律,为理解人机协同学习的行为机制提供了可解释的有效场框架。

Comments 8 figures, 11 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06933 2026-09-01 cs.CE cs.CL cs.HC 版本更新 57%

TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding

TxSum: 基于微粒语义锚定的用户导向以太坊交易理解

Zifan Peng, Jingyi Zheng, Yule Liu, Huaiyu Jia, Qiming Ye, Jingyu Liu, Xufeng Yang, Mingchen Li, Qingyuan Gong, Xuechao Wang, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) University of North Texas(北卡罗来纳州立大学) Fudan University(复旦大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06631 2026-09-01 cs.CL 版本更新 57%

Labels have Human Values: Value Calibration of Subjective Tasks

标签具有人类价值观:主观任务的价值校准

Mohammed Fayiz Parappan, Ricardo Henao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Duke University(杜克大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出MC-STL框架,通过价值集群校准提升主观任务NLP系统的对齐性与性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-09-01 cs.CV 版本更新 50%

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir, Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏