arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1756 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1756 篇

2603.05725 2026-03-09 cs.CR 50%

Challenges and Design Considerations for Finding CUDA Bugs Through GPU-Native Fuzzing

通过GPU原生模糊测试寻找CUDA漏洞的挑战与设计考虑

Mingkai Li, Joseph Devietti, Suman Jana, Tanvir Ahmed Khan

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文研究了通过GPU原生模糊测试寻找CUDA漏洞的挑战与设计考虑,强调程序行为的忠实性对异构系统安全的重要性。

Comments Accepted to appear in HotEthics 2026; 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25034 2026-03-09 cs.MA cs.SY eess.SY 50%

MARLIN: Multi-Agent Reinforcement Learning with Murmuration Intelligence and LLM Guidance for Reservoir Management

MARLIN: 基于星群智能与大语言模型引导的多智能体强化学习在水库管理中的应用

Heming Fu, Shan Lin, Guojun Xiong

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 MARLIN通过结合生物启发规则与大语言模型,实现多智能体强化学习在水库管理中的去中心化协调,提升不确定性处理能力并加快洪水响应。

Comments AAMAS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05465 2026-03-06 cs.CV 50%

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

在不生成单个标记的情况下检测视觉-语言模型中的幻觉

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 通过探测模型内部表示在生成前检测视觉-语言模型的幻觉风险,展示不同架构中信息丰富的层和模态差异,并验证轻量级探测器在提升安全性和效率方面的潜力。

Journal ref The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01205 2026-03-03 cs.CV 50%

CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling

CoSMo3D:通过LLM引导的规范空间建模实现开放世界可提示的3D语义部分分割

Li Jin, Weikai Chen, Yujie Wang, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Shengju Qian, Xin Wang, Xueying Qin

机构 * SDU(山东大学) LIGHTSPEED(LIGHTSPEED公司) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 CoSMo3D通过LLM引导的规范空间建模实现开放世界可提示的3D语义部分分割,提升语义稳定性和可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24041 2026-03-02 cs.CV 50%

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

仔细观察:多模态大语言模型中的自适应视觉增强以缓解幻觉

Xingyu Zhu, Kesen Zhao, Liang Yi, Shuo Wang, Zhicai Wang, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(信息与电子技术联合实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本研究提出自适应视觉增强框架AIR,通过减少冗余标记和选择性整合补丁来缓解多模态大语言模型中的幻觉问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23109 2026-03-02 cs.RO 50%

Towards Intelligible Human-Robot Interaction: An Active Inference Approach to Occluded Pedestrian Scenarios

迈向可解释的人机交互:一种主动推断方法用于遮挡行人场景

Kai Chen, Yuyao Huang, Guang Chen

机构 * Tongji University(同济大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出基于主动推断的方法,用于解决遮挡行人场景中的安全挑战,通过结合 RBPF 和 CEM 增强的 MPPI 控制器,实现可解释的人机交互。

Comments 14 pages, 6 figures, Proceedings of the 2026 ACM/IEEE International Conference on Human-Robot Interaction (HRI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23005 2026-02-27 cs.SE 50%

Managing Uncertainty in LLM-based Multi-Agent System Operation

在基于大语言模型的多智能体系统操作中管理不确定性

Man Zhang, Tao Yue, Yihua He

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种基于生命周期的不确定性管理框架,用于提升基于大语言模型的多智能体系统在安全关键领域的可靠性和可诊断性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22727 2026-02-27 cs.CV 50%

HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models

HulluEdit: 单次通过证据一致子空间编辑用于缓解大视觉-语言模型中的幻觉

Yangguang Lin, Quan Fang, Yufei Li, Jiachen Sun, Junyu Gao, Jitao Sang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 HulluEdit通过单次通过的正交子空间编辑方法,有效缓解大视觉-语言模型中的幻觉问题,实现了最先进的幻觉减少效果。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19968 2026-02-24 physics.app-ph 50%

Probabilistic Photonic Computing

概率光子计算

Frank Brückerhoff-Plückelmann, Anna P. Ovvyan, Akhil Varri, Hendrik Borras, Bernhard Klein, C. David Wright, Harish Bhaskaran, Ghazi Sarwat Syed, Abu Sebastian, Holger Fröning, Wolfram Pernice

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出利用光子计算实现低延迟、低能耗的概率计算架构,以解决传统确定性硬件在概率建模中的不足,并探讨其在人工智能系统中的应用与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19507 2026-02-24 cs.HC 50%

Conversational AI for Automated Patient Questionnaire Completion: Development Insights and Design Principles

用于自动患者问卷完成的对话式AI:开发见解与设计原则

David Fraile Navarro, Mor Peleg

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种基于生成式AI的对话代理,用于自动完成患者问卷,通过主题对话提高数据收集效率,并总结了设计原则和开发经验。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15554 2026-02-18 cs.CE 50%

Efficient Road Renovation Scheduling under Uncertainty using Lower Bound Pruning

在不确定性下使用下界剪枝进行高效的道路翻新调度

Robbert Bosch, Patricia Rogetzer, Wouter van Heeswijk, Martijn Mes

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种结合机器学习和遗传算法的混合优化方法,用于在不确定性下高效调度大规模基础设施翻新,通过概率性失效模型和渐进式下界评估方法提高解决方案质量。

Comments 24 pages, 14 figures, submitted to Computer-Aided Civil and Infrastructure Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05578 2026-02-13 cs.CV 50%

LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation

LoGoSeg:整合局部和全局特征以实现开放词汇语义分割

Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 LoGoSeg通过整合局部和全局特征,提升开放词汇语义分割的精度与效率,减少幻觉和漏检问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05508 2026-02-06 cs.CV 50%

VGGT-Motion: Motion-Aware Calibration-Free Monocular SLAM for Long-Range Consistency

VGGT-Motion:具有运动感知的校准自由单目SLAM用于长距离一致性

Zhuang Xiong, Chen Zhang, Qingshan Xu, Wenbing Tao

机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing(科学与技术多光谱信息处理国家重点实验室) Huazhong University of Science and Technology(华中科技大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 VGGT-Motion通过运动感知子地图构造和锚点驱动的直接Sim(3)对齐策略,实现了高效且稳健的校准自由单目SLAM,提升了长距离轨迹的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04992 2026-02-06 cs.HC cs.RO 50%

Applying Ground Robot Fleets in Urban Search: Understanding Professionals' Operational Challenges and Design Opportunities

在城市搜索中应用地面机器人队伍:理解专业人员的操作挑战与设计机会

Puqi Zhou, Charles R. Twardy, Cynthia Lum, Myeong Lee, David J. Porfirio, Michael R. Hieb, Chris Thomas, Xuesu Xiao, Sungsoo Ray Hong

机构 * George Mason University(乔治·马歇尔大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文探讨了在城市搜索中应用地面机器人队伍对公共安全专业人员操作挑战的影响,提出了减轻认知和体力负担的设计机会。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03910 2026-02-05 eess.IV 50%

CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction

CONRep:基于置信预测的不确定性感知视觉-语言报告起草

Danial Elyassirad, Benyamin Gheiji, Mahsa Vatanparast, Amir Mahmoud Ahmadzadeh, Seyed Amir Asef Agah, Mana Moassefi, Meysam Tavakoli, Shahriar Faghani

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。

Comments 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20504 2026-02-05 cs.CV 50%

UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models

UniVRSE: 统一的视觉条件响应语义熵用于医学视觉语言模型中的幻觉检测

Zehui Liao, Shishuai Hu, Ke Zou, Mengyuan Jin, Yanning Zhang, Huazhu Fu, Liangli Zhen, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University(集成航空航天地面海洋大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 UniVRSE通过统一的视觉条件响应语义熵框架,有效检测医学视觉语言模型中的幻觉,提升临床应用的可靠性。

Comments Under Review. 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03158 2026-02-04 cs.IR 50%

PAMAS: Self-Adaptive Multi-Agent System with Perspective Aggregation for Misinformation Detection

PAMAS:基于视角聚合的自适应多智能体系统用于虚假信息检测

Zongwei Wang, Min Gao, Junliang Yu, Tong Chen, Chenghua Lin

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 PAMAS通过自适应多智能体系统和视角聚合技术,有效解决虚假信息检测中的信息淹没问题,提升检测准确性和效率。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10844 2026-02-03 cs.HC 50%

Be Friendly, Not Friends: How LLM Sycophancy Shapes User Trust

友好而非朋友:LLM谄媚如何塑造用户信任

Yuan Sun, Ting Wang

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 研究探讨LLM谄媚如何影响用户信任,通过实验发现适应性对话态度影响用户对LLM真实性和信任度的感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01264 2026-02-03 cs.HC 50%

Shades of Uncertainty: How AI Uncertainty Visualizations Affect Trust in Alzheimer's Predictions

不确定性之影:AI不确定性可视化如何影响阿尔茨海默病预测的可信度

Jonatan Reyes, Mina Massoumi, Anil Ufuk Batmaz, Marta Kersten-Oertel

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本研究探讨了AI不确定性可视化对阿尔茨海默病预测可信度的影响,发现连续编码提升可靠性,而二元编码增强即时信心,揭示了高不确定性下专业背景的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23041 2026-02-02 cs.CV 50%

One-shot Optimized Steering Vector for Hallucination Mitigation for VLMs

单次优化的转向向量用于VLMs的幻觉缓解

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science(科学大学) Nanjing University(南京大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出OSGA框架,通过单次优化生成通用转向向量,有效缓解VLMs的幻觉问题并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22099 2026-01-30 physics.soc-ph 50%

Towards Universal Urban Patterns-of-Life Simulation

迈向通用的城市生活方式模拟

Sandro M. Reia, Henrique F. de Arruda, Shiyang Ruan, Taylor Anderson, Hamdi Kavak, Dieter Pfoser

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出了一种可扩展且通用的城市生活方式模拟框架,通过模拟日常活动生成模式,并验证了其在不同城市中的有效性,适用于城市系统中的多种场景分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21126 2026-01-30 cs.MA cs.RO 50%

AI-Augmented Density-Driven Optimal Control (D2OC) for Decentralized Environmental Mapping

AI增强的密度驱动最优控制(D2OC)用于去中心化环境映射

Kooktae Lee, Julian Martinez

机构 * Department of Mechanical Engineering, New Mexico Institute of Mining and Technology(机械工程系,新墨西哥矿业与技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出AI增强的密度驱动最优控制方法,用于在传感和通信受限条件下实现多智能体环境映射,通过自适应机制提升密度估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26441 2026-01-27 cs.CV 50%

A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models

A-TPT:面向视觉语言模型测试时提示微调的角多样性校准特性

Shihab Aaqil Ahamed, Udaya S. K. P. Miriya Thanthrige, Ranga Rodrigo, Muhammad Haris Khan

机构 * Dept. of Electronic and Telecommunication Engineering, University of Moratuwa(摩图瓦大学电子与电信工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 A-TPT通过引入角度多样性提升视觉语言模型测试时提示微调的校准性能,有效减少校准误差并提升适应能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17406 2026-01-26 cs.CR cs.IR 50%

ProveRAG: Provenance-Driven Vulnerability Analysis with Automated Retrieval-Augmented LLMs

ProveRAG: 基于溯源的漏洞分析与自动化检索增强大语言模型

Reza Fayyazi, Stella Hoyos Trueba, Michael Zuzak, Shanchieh Jay Yang

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 ProveRAG通过自动化检索增强和自我批评机制,提升大语言模型在漏洞分析中的准确性和时效性,提供高精度的漏洞利用和缓解策略。

Journal ref IEEE Access, vol. 13, pp. 212815-212826, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15707 2026-01-23 cs.RO 50%

D-Optimality-Guided Reinforcement Learning for Efficient Open-Loop Calibration of a 3-DOF Ankle Rehabilitation Robot

基于D-最优性的强化学习用于3-自由度踝关节康复机器人高效开环校准

Qifan Hu, Branko Celler, Weidong Mu, Steven W. Su

机构 * Affiliated Provincial Hospital, Shandong First Medical University(山东第一医科大学附属省立医院) Faculty of Engineering, University of New South Wales(新南威尔士大学工程学院) Faculty of Engineering and IT, University of Technology Sydney(悉尼大学技术与信息工程学院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出基于D-最优性的强化学习方法,用于高效校准三自由度踝关节康复机器人,提升校准效率和参数估计的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25856 2026-01-23 cs.CV 50%

PatchEAD: Unifying Industrial Visual Prompting Frameworks for Patch-Exclusive Anomaly Detection

PatchEAD: 统一工业视觉提示框架用于补丁专属异常检测

Po-Han Huang, Jeng-Lin Li, Po-Hsuan Huang, Ming-Ching Chang, Wei-Chao Chen

机构 * Inventec Corporation(Inventec公司) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 PatchEAD提出统一的补丁聚焦框架,实现无需训练的工业异常检测,兼容多种基础模型并提升补丁相似性鲁棒性。

Comments 10 pages, 5 figures. WACV 2026 (Accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06798 2026-01-13 cs.IR 50%

Unleashing the Native Recommendation Potential: LLM-Based Generative Recommendation via Structured Term Identifiers

释放原生推荐潜力:基于结构化术语标识符的LLM生成推荐

Zhiyang Zhang, Junda She, Kuo Cai, Bo Chen, Shiyao Wang, Xinchen Luo, Qiang Luo, Ruiming Tang, Han Li, Kun Gai, Guorui Zhou

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出GRLM框架,通过结构化术语标识符提升生成推荐系统的性能和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05721 2026-01-12 cs.SE 50%

From Issues to Insights: RAG-based Explanation Generation from Software Engineering Artifacts

从问题到洞察:基于RAG的软件工程制品解释生成

Daniel Pöttgen, Mersedeh Sadeghi, Max Unterbusch, Andreas Vogelsang

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文首次应用RAG方法从问题跟踪数据生成解释,实现90%的人工解释一致性,展示了结构化问题数据在提升软件系统可解释性方面的潜力。

Comments Accepted at NLBSE 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24307 2026-01-09 cs.HC 50%

Exploring Similarity between Neural and LLM Trajectories in Language Processing

探索神经与大语言模型在语言处理中的相似性

Xin Xiao, Kaiwen Wei, Jiang Zhong, Xuekai Wei, Mingliang Zhou

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本研究通过比较LLMs与人类大脑在语言处理中的轨迹相似性,揭示了语义整合机制和实时处理动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02766 2026-01-07 cs.RO cs.AR 50%

Advancing Assistive Robotics: Multi-Modal Navigation and Biophysical Monitoring for Next-Generation Wheelchairs

推动辅助机器人:多模态导航与生物物理监测用于下一代轮椅

Md. Anowar Hossain, Mohd. Ehsanul Hoque

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种多模态轮椅控制系统,结合多种输入接口与生物物理监测,提升患者独立性并实现护理人员实时监督。

详情

展开后加载摘要…

URL PDF HTML 收藏