arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-01 至 2025-12-01 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 8 篇

2511.23031 2025-12-01 cs.CV cs.AI 70%

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22351 2025-12-01 cs.CV 67%

INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts

INSIGHT: 一种可解释的神经视觉-语言框架,用于生成性艺术作品的推理

Anshul Bagaria

机构 * Indian Institute of Technology, Madras, Tamil Nadu, India(印度理工学院Madras分校,泰米尔纳德州,印度)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract)

AI总结 INSIGHT提出了一种可解释的神经视觉-语言框架,通过多尺度定位、语义对齐和结构化提示协议,实现对生成性艺术作品的鲁棒检测与透明解释。

Comments 36 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21762 2025-12-01 cs.CL cs.AI 62%

Factors That Support Grounded Responses in LLM Conversations: A Rapid Review

支持LLM对话中基础响应的因素:一项快速回顾

Gabriele Cesar Iwashima, Claudia Susie Rodrigues, Claudio Dipolitto, Geraldo Xexéo

机构 * (June 2025)((2025年6月))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过快速回顾识别了支持LLM对话中基础响应的因素,重点分析了推理时间、训练后及强化学习方法,旨在提升LLM响应的准确性和可靠性。

Comments 28 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23440 2025-12-01 cs.LG cs.AR cs.DC stat.ML 57%

Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation

利用单次概率前向传递和代码生成加速贝叶斯神经网络

Bernhard Klein, Falk Selker, Hendrik Borras, Sophie Steger, Franz Pernkopf, Holger Fröning

机构 * Heidelberg University(海德堡大学) Graz University of Technology(格拉茨技术大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于概率前向传递和代码生成的方法,显著提升贝叶斯神经网络在嵌入式系统中的计算效率和部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22004 2025-12-01 stat.ML cs.LG 57%

On the Effect of Regularization on Nonparametric Mean-Variance Regression

关于正则化对非参数均方回归的影响

Eliot Wong-Toi, Alex Boyd, Vincent Fortuin, Stephan Mandt

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文研究了正则化对非参数均方回归模型的影响,通过统计场理论框架揭示了正则化驱动的相变现象,并展示了在UCI和ClimSim数据集上的鲁棒校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21705 2025-12-01 cs.CL cs.CV 57%

Insight-A: Attribution-aware for Multimodal Misinformation Detection

Insight-A: 多模态虚假信息检测中的归因意识

Junjie Wu, Yumeng Fu, Chen Gong, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Insight-A通过归因意识和分层推理提升多模态虚假信息检测效果,有效识别伪造来源并增强跨模态一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00259 2025-12-01 cs.CL 57%

AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models

AutoHall: 自动化生成大语言模型的事实性幻觉数据集

Zouying Cao, Yifei Yang, XiaoJing Li, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海可信数据流通与治理Web3重点实验室) School of Media & Communication, Shanghai Jiao Tong University(媒体与传播学院,上海交通大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 AutoHall通过自动化生成模型特定的幻觉数据集,提升大语言模型的事实性内容检测能力。

Comments Accepted by IEEE Transactions on Audio, Speech, and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22746 2025-12-01 cs.HC 50%

Epistemic Fragility in Large Language Models: Prompt Framing Systematically Modulates Misinformation Correction

大型语言模型中的知识脆弱性:提示框架系统性地调节 misinformation 的纠正

Sekoul Krastev, Hilary Sweatman, Anni Sternisko, Steve Rathje

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究发现提示框架对大型语言模型纠正虚假信息的能力有显著影响,揭示了模型在知识准确性上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏