arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2510.16359 2025-10-21 cs.CL 57%

Utilising Large Language Models for Generating Effective Counter Arguments to Anti-Vaccine Tweets

Utsav Dhanuka, Soham Poddar, Saptarshi Ghosh

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments 14 pages, 1 figure, work done as a part of B.Tech project at IIT Kharagpur

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13750 2025-10-17 cs.CL 57%

Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation

Zhiqi Huang, Vivek Datla, Chenyang Zhu, Alfy Samuel, Daben Liu, Anoop Kumar, Ritesh Soni

机构 * Capital One

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments UncertaiNLP at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25373 2025-10-17 cs.AI 57%

From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models

Chenyue Zhou, Mingxuan Wang, Yanbiao Ma, Chenxu Wu, Wanyi Chen, Zhe Qian, Xinyu Liu, Yiwei Zhang, Junhao Wang, Hengbo Xu, Fei Luo, Xiaohua Chen, Xiaoshuai Hao, Hehan Li, Andi Zhang, Wenxuan Wang, Kaiyan Zhang, Guoli Jia, Lingling Li, Zhiwu Lu, Yang Lu, Yike Guo

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12470 2025-10-16 cs.CL 57%

Reasoning on a Spectrum: Aligning LLMs to System 1 and System 2 Thinking

Alireza S. Ziabari, Nona Ghazizadeh, Zhivar Sourati, Farzan Karimi-Malekabadi, Payam Piray, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13183 2025-10-16 cs.CL 57%

DSCD: Large Language Model Detoxification with Self-Constrained Decoding

Ming Dong, Jinkui Zhang, Bolong Zheng, Xinhui Tu, Po Hu, Tingting He

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北人工智能与智能学习省级重点实验室) National Language Resources Monitoring and Research Center for Network Media(网络媒体语言资源监测与研究国家中心) Central China Normal University(中央财经大学) Wuhan University of Technology(武汉理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00378 2025-10-15 cs.AI cs.CV 57%

CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding

Shixin Yi, Lin Shang

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

Comments The paper is not yet mature and needs further improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11457 2025-10-14 cs.AI 57%

From <Answer> to <Think>: Multidimensional Supervision of Reasoning Process for LLM Optimization

Beining Wang, Weihang Su, Hongtao Tian, Tao Yang, Yujia Zhou, Ting Yao, Qingyao Ai, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent Inc(腾讯公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11242 2025-10-14 astro-ph.EP astro-ph.IM cs.LG 57%

Analyzing Data Quality and Decay in Mega-Constellations: A Physics-Informed Machine Learning Approach

Katarina Dyreby, Francisco Caldas, Cláudia Soares

机构 * FCT-UNL, Portugal(葡萄牙FCT-UNL)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 76th International Astronautical Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10462 2025-10-14 cs.CV cs.AI 57%

Learning from Disagreement: A Group Decision Simulation Framework for Robust Medical Image Segmentation

Chen Zhong, Yuxuan Yang, Xinyue Zhang, Ruohan Ma, Yong Guo, Gang Li, Jupeng Li

机构 * School of Electronics and Information Engineering, Beijing Jiaotong University, China(电子信息工程学院,北京交通大学) Peking University School and Hospital of Stomatology, China(北京大学口腔医院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17178 2025-10-14 cs.CL 57%

Attention Consistency for LLMs Explanation

Tian Lan, Jinyuan Xu, Xue He, Jenq-Neng Hwang, Lei Li

机构 * Milkuya Studio(Milkuya工作室) ERTIM, INALCO(ERTIM与INALCO) Sorbonne University(索邦大学) IRD(国家农业与食品研究所) University of Washington(华盛顿大学) VitaSight

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10290 2025-10-14 cs.SE cs.LG 57%

Grounded AI for Code Review: Resource-Efficient Large-Model Serving in Enterprise Pipelines

Sayan Mandal, Hua Jiang

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Submitted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09913 2025-10-14 cs.CL 57%

Don't Throw Away Your Pretrained Model

Shangbin Feng, Wenhao Yu, Yike Wang, Hongming Zhang, Yulia Tsvetkov, Dong Yu

机构 * University of Washington(华盛顿大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21641 2025-10-13 cs.LG cs.CR stat.ME 57%

PrivATE: Differentially Private Confidence Intervals for Average Treatment Effects

Maresa Schröder, Justin Hartenstein, Stefan Feuerriegel

机构 * LMU Munich(慕尼黑莱茵河大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12444 2025-10-13 cs.CL 57%

Augmenting Compliance-Guaranteed Customer Service Chatbots: Context-Aware Knowledge Expansion with Large Language Models

Mengze Hong, Chen Jason Zhang, Di Jiang, Yuanqin He

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank金融科技部)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08389 2025-10-10 cs.AI 57%

Revisiting Hallucination Detection with Effective Rank-based Uncertainty

Rui Wang, Zeming Wei, Guanzhang Yue, Meng Sun

机构 * Peking University(北京大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16922 2025-10-10 cs.CL 57%

UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation

Ruihan Yang, Caiqi Zhang, Zhisong Zhang, Xinting Huang, Dong Yu, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学) Tencent AI Lab(腾讯AI实验室) City University of Hong Kong(香港城市大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06541 2025-10-09 cs.CV cs.LG 57%

Cluster Paths: Navigating Interpretability in Neural Networks

Nicholas M. Kroeger, Vincent Bindschaedler

机构 * Department of Computer Science University of Florida(计算机科学系佛罗里达大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06125 2025-10-08 cs.LG 57%

Downsized and Compromised?: Assessing the Faithfulness of Model Compression

Moumita Kamal, Douglas A. Talbert

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

Comments Submitted to and under review at Springer Machine Learning Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04439 2025-10-07 cs.CL 57%

On the Role of Unobserved Sequences on Sample-based Uncertainty Quantification for LLMs

Lucie Kunitomo-Jacquin, Edison Marrese-Taylor, Ken Fukuda

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

Comments Accepted to UncertaiNLP workshop of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04357 2025-10-07 cs.LG q-fin.CP 57%

From News to Returns: A Granger-Causal Hypergraph Transformer on the Sphere

Anoushka Harit, Zhongtian Sun, Jongmin Yu

机构 * University of Cambridge(剑桥大学) University of Kent(肯特大学) Department of Computer Science, University of Cambridge(剑桥大学计算机科学系)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

Comments 6th ACM International Conference on AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10246 2025-10-07 cs.LG 57%

Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Ambiguous Prompts and Unanswerable Questions

Hazel Kim, Tom A. Lamb, Adel Bibi, Philip Torr, Yarin Gal

机构 * University of Oxford(牛津大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Accepted to EMNLP(main)2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00015 2025-10-03 cs.CL 57%

Design and Application of Multimodal Large Language Model Based System for End to End Automation of Accident Dataset Generation

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

Comments This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01069 2025-10-02 cs.AI 57%

Typed Chain-of-Thought: A Curry-Howard Framework for Verifying LLM Reasoning

Elija Perrier

机构 * Centre for Quantum Software and Information(量子软件与信息中心) University of Technology Sydney(悉尼技术大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12838 2025-10-02 cs.CL 57%

Are Knowledge and Reference in Multilingual Language Models Cross-Lingually Consistent?

Xi Ai, Mahardika Krisna Ihsani, Min-Yen Kan

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments EMNLP'25 Findings Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26610 2025-10-01 cs.LG 57%

Uncertainty Quantification for Regression using Proper Scoring Rules

Alexander Fishkov, Kajetan Schweighofer, Mykyta Ielanskyi, Nikita Kotelevskii, Mohsen Guizani, Maxim Panov

机构 * Department of Machine Learning, MBZUAI(机器学习部门,MBZUAI) ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz(林兹ELLIS单元和LIT AI实验室,机器学习研究所,林兹约翰内斯·开普勒大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25669 2025-10-01 cs.AI 57%

GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination

Xinxi Chen, Tianyang Chen, Lijia Hong

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04943 2025-10-01 cs.CV cs.CL 57%

ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding

Jianjiang Yang, Yanshu li, Ziyan Huang

机构 * University of Bristol(布里斯托大学) Brown University(布朗大学) South China University of Technology(华南理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted by conference EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23088 2025-09-30 cs.CL 57%

The Geometry of Creative Variability: How Credal Sets Expose Calibration Gaps in Language Models

Esteban Garces Arias, Julian Rodemann, Christian Heumann

机构 * Department of Statistics, LMU Munich(统计系,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹研究中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted at the 2nd UncertaiNLP Workshop @ EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21593 2025-09-29 cs.AI physics.soc-ph 57%

GeoEvolve: Automating Geospatial Model Discovery via Multi-Agent Large Language Models

Peng Luo, Xiayin Lou, Yu Zheng, Zhuo Zheng, Stefano Ermon

机构 * Massachusetts Institute of Technology(麻省理工学院) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21336 2025-09-29 cs.IR cs.CL 57%

HetaRAG: Hybrid Deep Retrieval-Augmented Generation across Heterogeneous Data Stores

Guohang Yan, Yue Zhang, Pinlong Cai, Ding Wang, Song Mao, Hongwei Zhang, Yaoze Zhang, Hairong Zhang, Xinyu Cai, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏