arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2001.00496 2020-04-17 cs.LG cs.AI stat.ML 62%

Uncertainty-Based Out-of-Distribution Classification in Deep Reinforcement Learning

Andreas Sedlmeier, Thomas Gabor, Thomy Phan, Lenz Belzner, Claudia Linnhoff-Popien

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:1901.02219

Journal ref Proceedings of the 12th International Conference on Agents and Artificial Intelligence - Volume 2: ICAART, 2020, ISBN 978-989-758-395-7, pages 522-529

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09005 2019-11-21 cs.AI cs.CY cs.SY eess.SY 62%

Hard Choices in Artificial Intelligence: Addressing Normative Uncertainty through Sociotechnical Commitments

Roel Dobbe, Thomas Krendl Gilbert, Yonatan Mintz

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

Comments To be presented at the AI for Social Good workshop at NeurIPS 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11538 2019-09-26 cs.RO cs.AI cs.LG cs.SY eess.SY stat.ML 62%

Automated Lane Change Decision Making using Deep Reinforcement Learning in Dynamic and Uncertain Highway Environment

Ali Alizadeh, Majid Moghadam, Yunus Bicer, Nazim Kemal Ure, Ugur Yavas, Can Kurtulus

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to IEEE Intelligent Transportation Systems Conference - ITSC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.10134 2018-08-31 cs.RO cs.AI cs.LG 62%

Baidu Apollo Auto-Calibration System - An Industry-Level Data-Driven and Learning based Vehicle Longitude Dynamic Calibrating Algorithm

Fan Zhu, Lin Ma, Xin Xu, Dingfeng Guo, Xiao Cui, Qi Kong

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18985 2025-07-30 cs.CV cs.AI 61%

GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models

Guanxi Shen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :alignment(abstract,comments);分类 cs.AI

Comments Keywords: Explainable Computer Vision, Large Vision-Language Models, AI Interpretability, Explainable AI, Visual Saliency, Attribution Maps, Cross-Modal Attribution, Human Attention Alignment, AI Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.03438 2019-03-11 cs.AI cs.RO 61%

Towards a Framework to Manage Perceptual Uncertainty for Safe Automated Driving

Krzysztof Czarnecki, Rick Salay

专题命中 幻觉与事实性 :safety(abstract,journal_ref);分类 cs.AI

Journal ref In: Gallina B., Skavhaug A., Schoitsch E., Bitsch F. (eds) Computer Safety, Reliability, and Security. SAFECOMP 2018. Lecture Notes in Computer Science, vol 11094. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03854 2026-08-25 cs.LG 版本更新 57%

When Calibration Depends on the Scoring Rule: Quantized Biomedical LLM Classification

量化对生物医学大语言模型可靠性的影响

Anton Rasmussen, Hong Qin

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21142 2026-08-24 cs.LG 新提交 57%

COEC: Calibrated Orthogonal-Equivalence Compensation for Structured Pruning of Large Language Models

COEC:面向大语言模型结构化剪枝的校准正交等价补偿

Peiqi Yu, Nam Ling, Wei Wang, Wei Jiang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究提出无训练补偿框架COEC,将其应用于Llama-3等模型的结构化剪枝,可提升剪枝后模型的困惑度与零样本准确率,在高稀疏度下增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19973 2026-08-21 cs.CV cs.AI 新提交 57%

Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training

基于协同蒸馏发现与双引导鲁棒训练的开放词汇三维目标检测

Shangbo Yuan, Jie Xu, Xiaofeng Zhu, Na Zhao

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Singapore University of Technology and Design(新加坡科技设计大学) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出含协同蒸馏发现与双引导训练的开放词汇3D目标检测框架,在SUN RGB-D等数据集上性能优于现有最优方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19964 2026-08-21 cs.LG 新提交 57%

G-MARK: Grounded Multi-Agent Reasoning for Cooperative Driving via Knowledge Graphs

G-MARK:基于知识图谱的协同驾驶接地多智能体推理

Bhavya Gupta, Onat Gungor, Tajana Rosing

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) West Virginia University(西弗吉尼亚大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出 G-MARK 框架,通过知识图谱实现协同驾驶多智能体推理,提升遮挡推理与控制选择性能,减小通信负载,效果优于现有基线。

Comments Accepted for oral presentation at the 25th IEEE International Conference on Machine Learning and Applications (ICMLA'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 57%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09011 2026-08-20 cs.LG 版本更新 57%

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17084 2026-08-19 cs.CL 新提交 57%

Uncertainty-Aware Decision Making in Multimodal Large Language Models

多模态大语言模型中的不确定性感知决策

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Khalifa University of Science and Technology(哈利法科技大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16428 2026-08-18 cs.HC cs.AI 新提交 57%

Visualizing Uncertainty-to-Action Composition for Human Oversight

可视化面向人工监督的不确定性-行动组合

Chisom Anyabolu, Akshat Dubey, Georges Hattab

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 该研究提出不确定性-行动绑定框架与ActionCue可视化方法,明确AI不确定性条件到人工监督响应的组合逻辑,通过多领域案例验证其有效性。

Comments 5 pages, 2 figures, IEEEVis 2026 UncertaintyVis workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16201 2026-08-18 cs.LG 新提交 57%

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

面向基于大语言模型(LLM)的多模态情感分析的多粒度情感集成

Shanshan Lin, Yuesheng Wu, Chao Chen, Yizhe Yang, Zhihao Chen, Zexian Yang, Xiangwen Liao

机构 * Fuzhou University(福州大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Jiangxia University(江夏大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 该研究提出MGSI多粒度情感集成框架,通过多尺度编码、文本引导对齐等优化,提升基于LLM的多模态情感分析性能,在四个公开基准上效果优于冻结LLM基线。

Comments Accepted to NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 57%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13658 2026-08-14 cs.LG 版本更新 57%

Post-Hoc Uncertainty-Aware Explanations for Deployed Power Quality Disturbance Classifiers via Laplace Approximation

基于不确定性的贝叶斯解释框架用于电力质量问题分类

Yinsong Chen, Samson S. Yu, Kashem M. Muttaqi

机构 * School of Engineering, Deakin University(德肯大学工程学院) ARC Training Centre in Energy Technologies for Future Grids, School of Engineering, University of Wollongong(未来电网能源技术培训中心,沃尔灵宗大学工程学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种贝叶斯解释框架,通过生成相关性归因分布来建模解释不确定性,提升电力质量问题分类器的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11631 2026-08-13 cs.AI 新提交 57%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11175 2026-08-13 cs.AI 版本更新 57%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10964 2026-08-12 cs.CV cs.AI 新提交 57%

CARE: Confidence-Aware Reasoning for Reliable Medical VQA

CARE:用于可靠医学视觉问答的置信感知推理

Yuetian Du, Yucheng Wang, Zhenyuan Chen, Luyuan Chen, Rongyu Zhang, Jinjian Zhang, Wei Zhou, Zhijie Xu, Ming Kong, Zhan Zhou, Jie Liu, Qiang Zhu

机构 * Ant Group(蚂蚁集团) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10903 2026-08-12 cs.CV cs.LG 新提交 57%

VIDS-Seg: Towards Reliable Uncertainty Quantification in Pediatric Cardiac Ultrasound Segmentation

VIDS-Seg:面向儿科心脏超声分割的可靠不确定性量化

Paul Fischer, Ece Ozkan

机构 * University of Basel(巴塞尔大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 该研究提出VIDS-Seg方法,在成人超声数据集训练后零样本应用于儿科心脏超声分割,可可靠检测模型在儿科亚群的隐性失效,兼具分割精度与不确定性匹配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 57%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19735 2026-08-11 stat.ME cs.LG 版本更新 57%

Integrating RCTs, RWD, AI/ML and Statistics: Next-Generation Evidence Synthesis

整合RCTs、RWD、AI/ML和统计学:下一代证据合成

Shu Yang, Margaret Gamalo, Haoda Fu

机构 * Department of Statistics, North Carolina State University(统计学系,北卡罗来纳州立大学) VP and Statistics Head, Inflammation, Immunology & Specialty Care, Pfizer(副总裁及统计学负责人,炎症、免疫与专科医疗,辉瑞) Head of Exploratory Biostatistics, Amgen(探索性生物统计学负责人,安进)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出通过整合RCTs、RWD、AI/ML和统计学,提升证据合成的严谨性和实用性,推动下一代证据生成方法的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07139 2026-08-10 cs.LG 新提交 57%

Online Conformal Prediction Beyond Feedback

超越反馈的在线共形预测

Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对超越反馈的在线共形预测场景,本文提出OCPQ方法,将标签高效预测器适配到该设置,实现了低查询率下的高覆盖率,且在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05993 2026-08-07 cs.CL 新提交 57%

Clinical Communication Processing with Models Trained on LLM-Generated Synthetic Data: A Structured Survey and Novel Application Case Studies

基于大语言模型生成的合成数据训练模型的临床通信处理:结构化综述与新型应用案例研究

Alexander Apartsin, Yehudit Aperstein

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文综述用大语言模型生成的合成数据训练临床NLP系统的研究,结合13项无真实标注数据的案例,发现合成通信可支撑相关系统,微调编码器模型具竞争力,需真实数据迁移等完善。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04029 2026-08-07 cs.CL 版本更新 57%

CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

CrossHallu:大语言模型内部的幻觉信号能否跨语言和领域泛化?

Aisha Alansari, Malak Alkhorasani, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学) Imam Abdulrahman bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究大语言模型内部幻觉检测信号能否跨语言和领域泛化,通过CrossHallu对六个模型的内部表征在生成式问答任务上进行评估,结果揭示了模型内部状态幻觉信号跨语言和领域转移的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04327 2026-08-06 cs.LG 新提交 57%

Real-time probabilistic tsunami forecasting via generative AI

基于生成式AI的实时概率海啸预报

Yusuke Oishi, Takashi Furumura, Fumihiko Imamura

机构 * Fujitsu Research, Fujitsu Limited(富士通研究所,富士通株式会社) Earthquake Research Institute, The University of Tokyo(东京大学地震研究所) International Research Institute of Disaster Science, Tohoku University(东北大学国际灾害科学研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 该研究开发基于条件扩散模型的概率集成模型,利用2011年东北地方太平洋近海地震数据验证,实现实时概率海啸预报,将海啸预报从确定性转向概率性,为下一代预警奠定基础。

Comments 24 pages, 14 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04474 2026-08-06 cs.LG math.OC 新提交 57%

Local Violation Certification for Linear Predict-Then-Optimize Pipelines

线性“先预测后优化”管道的局部违规认证

Ş. İlker Birbil, Wenhao Chi

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对输入不确定性下的线性“先预测后优化”决策管道,提出局部违规认证框架,可通过单次优化求解直接计算局部故障风险,在电力调度系统上验证,成本低且评估精确可审计。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16868 2026-08-06 cs.AI 版本更新 57%

Beyond Semantic Equivalence: Logical Graphs for LLM Uncertainty Quantification

超越语义等价:用于大语言模型不确定性量化的逻辑图

Yanni Dong, Minghua Liu, Meilin Zhu, Xiaowei Huang, Lijun Zhang

机构 * Institute of Intelligent Software(智能软件研究所) Institute of Software, CAS(中国科学院软件研究所) University of Liverpool(利物浦大学) Guangzhou Jiayi Software Technology Co., Ltd.(广州嘉意软件科技有限公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究大语言模型输出不可靠问题,提出逻辑图不确定性(LGU)框架,该框架能明确建模答案间逻辑关系,通过聚合概率质量、计算熵等方式改进不确定性估计,在多个问答基准测试中优于现有方法。

Comments 21 pages, 3 figures, 11 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04140 2026-08-06 eess.AS cs.CL 版本更新 57%

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音

Junwon Moon, Yejin Lee, Seungbeom Kim, Hoseong Ahn, Sewoong Park, Heeseung Kim, Kyuhong Shim

机构 * Sungkyunkwan University(首尔大学) University of Seoul(首尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。

Comments ICML 2026 SPIGM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏