arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1756 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1756 篇

2604.13247 2026-04-16 cs.CE 50%

Cross-Platform Domain Adaptation for Multi-Modal MOOC Learner Satisfaction Prediction

跨平台领域适应用于多模态MOOC学习者满意度预测

Jakub Kowalski, Magdalena Piotrowska

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文研究了在缺乏目标平台标签的情况下,利用跨平台领域适应技术进行多模态MOOC学习者满意度预测,提出ADAPT-MS框架,通过文本编码、跨平台表征对齐、评分偏差校正和缺失行为模态处理,提升了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11671 2026-04-16 eess.SP cs.RO 50%

VLMaterial: Vision-Language Model-Based Camera-Radar Fusion for Physics-Grounded Material Identification

VLMaterial: 基于视觉-语言模型的相机-雷达融合用于物理基础的材料识别

Jiangyou Zhu, He Chen

机构 * Department of Inforation Engineering(信息工程系)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出VLMaterial框架,通过融合视觉语言模型与雷达知识实现物理基础的材料识别,采用双管道架构和上下文增强生成策略,提升跨模态融合性能,实验表明其在120余次真实实验中达到96.08%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04714 2026-04-16 astro-ph.IM 50%

Enhancing astrometric registration of Chinese historical Astronomical Digital Plates with deep learning

利用深度学习增强中国历史天文数字胶片的测光注册

Quanfeng Xu, Zhengjun Shang, Shiyin Shen, Yong Yu, Meiting Yang, Hao Luo, Zhenghong Tang, Jing Yang, Jianhai Zhao

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出基于Transformer的分类模型,通过多尺度特征融合识别可信恒星源,成功完成1353张胶片的测光注册,提升历史胶片档案的处理效率和科学价值。

Comments 15 pages, 5 figures, 3 table; accepted for publication in Research in Astronomy and Astrophysics, see details in https://xuquanfeng.github.io/AI_Plate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10896 2026-04-14 quant-ph 50%

Quantum Measurement Statistics as Bayesian Uncertainty Estimators for Physics-Constrained Learning

量子测量统计作为物理约束学习中的贝叶斯不确定性估计器

Prasad Nimantha Madusanka Ukwatta Hewage, Midhun Chakkravarthy, Ruvan Kumara Abeysekara

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出利用量子测量统计作为贝叶斯不确定性估计器,通过物理约束变分量子电路在PDE残差上训练,展示量子不确定性量化在安全关键系统中的有效性,相比MC Dropout和Deep Ensemble方法,量子方法在覆盖概率和区间宽度上表现更优。

Comments 14 pages, 6 figures, 5 tables. Code available at https://github.com/nimanpra/quantum_state_uq

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09805 2026-04-14 cs.SE 50%

Building an Internal Coding Agent at Zup: Lessons and Open Questions

在Zup构建内部编码代理:经验与开放问题

Gustavo Pinto, Pedro Eduardo de Paula Naves, Ana Paula Camargo, Marselle Silva

专题命中 幻觉与事实性 :safety(abstract)

AI总结 研究探讨了构建内部编码代理时原型性能与生产准备之间的差距,指出工具设计、安全控制等工程决策比模型质量更重要,通过CodeGen案例展示改进方法和人类监督模式对代理可靠性和采用的影响。

Comments 9 Paginas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05504 2026-04-08 eess.SP 50%

Semantic Communication with an LLM-enabled Knowledge Base

基于LLM的知识库的语义通信

Wuxia Hu, Caili Guo, Yang Yang, Chunyan Feng, Kuiyuan Ding, Shiwen Mao

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出SC-LMKB系统,利用LLM生成能力增强知识库,通过提示工程和交叉注意力对齐方法生成源数据和信道数据,结合跨域融合编解码框架降低幻觉影响,实验显示性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 50%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00983 2026-04-02 cs.CV 50%

ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration

现在行动:通过自适应上下文整合预防治愈LVLM幻觉

Bei Yan, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29263 2026-04-01 cs.SD 50%

Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models

音频幻觉攻击:测试大型音频语言模型的可靠性

Ashish Seth, Sonal Kumar, Ramaneswaran Selvakumar, Nishit Anand, Utkarsh Tyagi, Prem Seetharaman, Ramani Duraiswami, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出Audio Hallucination Attacks,通过6500个问答对测试大型音频语言模型是否真实基于音频输入生成响应,发现其可靠性与基准性能存在差距,并提出AHA-Guard数据集降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24765 2026-03-31 cs.IR stat.ML 50%

Enhancing Online Support Group Formation Using Topic Modeling Techniques

利用主题建模技术增强在线支持小组的形成

Pronob Kumar Barman, Tera L. Reynolds, James Foulds

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出两种新模型,通过整合用户生成内容、人口统计数据和网络数据,实现自动化个性化支持小组形成,提升语义连贯性和内部一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26635 2026-03-30 cs.MA 50%

Deception and Communication in Autonomous Multi-Agent Systems: An Experimental Study with Among Us

自主多智能体系统中的欺骗与交流:以Among Us为例的实证研究

Maria Milkowski, Tim Weninger

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文通过Among Us游戏研究自主智能体的欺骗与交流行为,发现智能体主要使用指示性语言,伪装者倾向使用解释和否认等行为,欺骗多表现为 equivocation 而非直接谎言,揭示了自主交流中真理与效用之间的根本矛盾。

Comments 8 pages + references, 9 figures. Accepted at AAMAS 2026

Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), IFAAMAS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 50%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04964 2026-03-26 cs.HC 50%

Scientific judgment drifts over time in AI ideation

人工智能构想中的科学判断随时间漂移

Lingyu Zhang, Mitchell Wang, Boyuan Chen

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究发现专家对科学构想的评估并非稳定,尽管内部结构保持稳定,但随时间变化的评估漂移影响了AI生成构想的评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15253 2026-03-25 cs.CV 50%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。

Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20515 2026-03-25 cs.CV 50%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

机构 * OMRON SINICX The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化VLM生成的描述和人类标注揭示模型差异,发现检测器倾向于认可响应开头的句子,并通过强VLM过滤减少数据噪声。

Comments Previously this version appeared as arXiv:2603.15253 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22170 2026-03-24 cs.MA 50%

Human-Inspired Pavlovian and Instrumental Learning for Autonomous Agent Navigation

受人类启发的经典条件反射与工具性学习用于自主体导航

Jingfeng Shan, Francesco Guidi, Mehrdad Saeidi, Enrico Testi, Elia Favarelli, Andrea Giorgetti, Davide Dardari, Alberto Zanella, Giorgio Li Pira, Francesca Starita, Anna Guerra

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出一种融合经典条件反射、工具性MF和工具性MB组件的混合强化学习架构,通过地理参考环境特征塑造内在价值信号,提升自主体在不确定环境中的导航安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20668 2026-03-24 cs.RO 50%

ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems

以目标区域驱动的视网膜注视用于视觉-语言-动作系统中的统一自体表示

Xinhai Sun, Xiang Shi, Menglin Zou, Wenlong Huang

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出了一种以目标区域驱动的数据表示方法,通过单个外部相机投影末端执行器姿态,实现手眼协调的区域划分,提升跨机器人系统的数据重用性和跨体征对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19596 2026-03-23 cs.IR 50%

CO-EVOLVE: Bidirectional Co-Evolution of Graph Structure and Semantics for Heterophilous Learning

CO-EVOLVE:图结构与语义的双向共演用于异质学习

Jinming Xing, Muhammad Shahzad

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出CO-EVOLVE框架,通过双向共演解决异质学习中的语义-结构不一致、误差传播和盲从问题,引入对比损失、自适应门控和不确定性门控策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08453 2026-03-23 cs.SI 50%

Whose Values? Measuring the (Subjective) Expression of Basic Human Values in Social Media

谁的价值?在社交媒体中测量(主观)基本人类价值观的表达

Ziv Epstein, Farnaz Jahanbakhsh, Tiziano Piccardi, Isabel Gallegos, Dora Zhao, Johan Ugander, Michael Bernstein

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文基于Schwartz价值观体系,提出一种规模化测量社交媒体中价值观表达的框架,通过个性化校准注释提升预测准确性,揭示人类价值观测量的新方法。

Comments Proceedings of the International AAAI Conference on Web and Social Media. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17634 2026-03-19 eess.SY cs.SY 50%

Hierarchical Decision-Making under Uncertainty: A Hybrid MDP and Chance-Constrained MPC Approach

在不确定性下的分层决策:一种混合MDP和机会约束MPC方法

Siyuan Li, Chengyuan Liu, Wen-Hua Chen

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出一种混合MDP和机会约束MPC的分层决策框架,用于自动驾驶中处理不确定性,通过多模态预测与安全约束实现 maneuver 选择与动态可行性的统一,验证了其在高速公路和城市环境中的安全性和效率。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01525 2026-03-19 eess.IV cs.CV 50%

Towards Clinical Practice in CT-Based Pulmonary Disease Screening: An Efficient and Reliable Framework

迈向基于CT的肺部疾病筛查的临床实践:一种高效且可靠的框架

Qian Shao, Bang Du, Yixuan Wu, Zepeng Li, Qiyuan Chen, Qianqian Tang, Jian Wu, Jintai Chen, Hongxia Xu

机构 * Zhejiang University(浙江大学) Shaoxing Tangtang Technology Co., Ltd.(绍兴唐唐科技有限公司) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出一种高效可靠的框架,通过簇基于采样和模糊性感知不确定性量化方法,在减少计算成本的同时保持诊断性能,实现快速准确的肺部疾病筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16558 2026-03-18 cs.CV cs.MM 50%

Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models

基于分割的注意力熵:在大视觉-语言模型中检测和缓解对象幻觉

Jiale Song, Jiaxin Luo, Xue-song Tang, Kuangrong Hao, Mingbo Zhao

机构 * School of Information and Intelligent Science, Donghua University, Shanghai, 201620, China(信息与智能科学学院,东华大学,上海,201620,中国)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出基于分割的注意力熵(SAE),通过语义分割量化视觉注意力不确定性,设计可靠性评分和注意力调整方法,有效缓解大视觉-语言模型中的对象幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15557 2026-03-17 cs.CV 50%

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉

Lexiang Xiong, Qi Li, Jingwen Ye, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 50%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 50%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18463 2026-03-13 cs.CV 50%

Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding

解耦感知与推理以实现抗幻觉的视频理解

Bowei Pu, Chuanbin Liu, Yifan Ge, Peicheng Zhou, Yiwei Sun, Zhiying Lu, Zhangchi Hu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出DPL模型,通过解耦感知与推理以提升视频理解的抗幻觉能力,引入感知奖励和FAE评估器,有效提高训练后性能和数据效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01957 2026-03-12 cs.CV 50%

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

AFTER: 通过自适应事实引导激活编辑缓解LVLM中的对象幻觉

Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 AFTER通过自适应事实引导激活编辑缓解LVLM中的对象幻觉,显著降低幻觉发生率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07071 2026-03-11 cs.CV 50%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08800 2026-03-11 cs.CV 50%

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22975 2026-03-10 eess.SY cs.SY 50%

An LLM-Assisted Multi-Agent Control Framework for Roll-to-Roll Manufacturing Systems

用于卷对卷制造系统的基于LLM的多智能体控制框架

Jiachen Li, Shihao Li, Christopher Martin, Zijun Chen, Dongmei Chen, Wei Li

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出一种基于LLM的多智能体框架,用于自动化卷对卷制造系统的控制设计与适应,通过五个阶段实现安全、高效的控制性能

详情

展开后加载摘要…

URL PDF HTML 收藏