arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2602.07674 2026-02-10 cs.LG 57%

ElliCE: Efficient and Provably Robust Algorithmic Recourse via the Rashomon Sets

ElliCE: 通过Rashomon集实现高效且可证明稳健的算法补救

Bohdan Turbal, Iryna Voitsitska, Lesia Semenova

机构 * Princeton University(普林斯顿大学) Ukrainian Catholic University(乌克兰天主教大学) Rutgers University(罗格斯大学) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基斯林国立大学) Microsoft Research NYC(微软研究院纽约)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 ElliCE通过椭球近似Rashomon集,提供高效且可证明稳健的算法补救方法,提升反事实解释的鲁棒性和灵活性。

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21083 2026-02-10 cs.AI 57%

OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence

OpenSec: 在对抗性证据下评估事件响应代理的校准

Jarrod Barnes

机构 * Jarrod Barnes

专题命中 幻觉与事实性 :prompt injection(abstract);分类 cs.AI

AI总结 OpenSec通过双控制强化学习环境评估事件响应代理在对抗性证据下的校准能力,发现前沿模型存在过度触发问题,校准差距体现在克制而非检测。

Comments 7 pages, 3 figures, 3 tables. Code: https://github.com/jbarnes850/opensec-env. Dataset: https://huggingface.co/datasets/Jarrodbarnes/opensec-seeds

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06570 2026-02-09 cs.CL 57%

Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making

Baichuan-M3:用于可靠医疗决策的临床查询建模

M3 Team, Chengfeng Dou, Fan Yang, Fei Li, Jiyuan Jia, Qiang Ju, Shuai Wang, Tianpeng Li, Xiangrong Zeng, Yijie Zhou, Hongda Zhang, Jinyang Tai, Linzhuang Sun, Peidong Guo, Yichuan Mo, Xiaochuan Wang, Hengfu Cui, Zhishou Zhang

机构 * Baichuan-M3 Team(Baichuan-M3团队)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Baichuan-M3通过建模临床查询流程,实现了医疗决策支持的可靠性和准确性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26829 2026-02-09 cs.LG cs.CR 57%

Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning

真相层:在持续预训练中毒下的信念转变探究

Svetlana Churina, Niranjan Chebrolu, Kokil Jaidka

机构 * Centre for Trusted Internet \& Community, National University of Singapore, Singapore

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究揭示了持续预训练中虚假信息如何取代模型内部事实表示,通过实验发现中毒对模型信念的影响及可逆性,强调了对事实完整性进行监控的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05456 2026-02-06 cs.RO cs.AI cs.SY eess.SY 57%

Ontology-Driven Robotic Specification Synthesis

基于本体的机器人规范综合

Maksym Figat, Ryan M. Mackey, Michel D. Ingham

机构 * Warsaw University of Technology (WUT)(华沙技术大学) NASA Jet Propulsion Laboratory (JPL)(美国国家航空航天局喷气推进实验室) California Institute of Technology(加州理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出基于本体的RSTM2方法,用于安全关键任务中机器人系统规范综合,通过随机时Petri网实现多层级蒙特卡洛模拟,支持架构权衡与资源分配。

Comments 8 pages, 9 figures, 3 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01522 2026-02-03 cs.LG cs.CV 57%

When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning

何时秩-1足够?基于几何的初始化方法用于参数高效微调

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算机与信息系统学院,墨尔本大学,墨尔本,澳大利亚)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出Gap-Init方法,通过几何感知初始化稳定秩-1 LoRA微调,证明初始对齐对训练稳定性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01078 2026-02-03 cs.AI 57%

AutoHealth: An Uncertainty-Aware Multi-Agent System for Autonomous Health Data Modeling

AutoHealth:一种面向自主健康数据建模的不确定性感知多智能体系统

Tong Xia, Weibin Li, Gang Liu, Yong Li

机构 * Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心电子工程系) Tsinghua University, China(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 AutoHealth通过多智能体系统自主建模健康数据,提升预测性能和不确定性估计,有效解决健康数据建模中的泛化和可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00850 2026-02-03 cs.CY 57%

PS$^2$: Parameterized Control for Fine-Grained Student Proficiency Simulation

PS$^2$: 基于参数化控制的细粒度学生能力模拟

Ruochen Liu, Zhiyuan Wen, Hao Yan, Jun Yin, Senzhang Wang, Jiannong Cao

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 PS$^2$提出一种基于参数化控制的细粒度学生能力模拟方法,通过混合比率在强弱模型间插值得到更精确的能力模拟,提升学生行为相似性和题目难度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19145 2026-02-03 stat.ME cs.LG stat.AP 57%

Do Large Language Models (Really) Need Statistical Foundations?

大型语言模型(真的需要统计基础吗?

Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文探讨大型语言模型是否需要统计学基础,指出其统计本质和黑箱特性使统计方法成为必要,并强调统计学界在LLMs研究中的重要性。

Comments Accepted at The Annals of Applied Statistics; Added discussions on more topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 57%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22595 2026-02-02 cs.AI 57%

Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR

学得更多,用得更少:不确定性一致性引导的查询选择用于RLVR

Hao Yi, Yulan Hu, Xin Li, Sheng Ouyang, Lizhong Ding, Yong Liu

机构 * Renmin University of China(中国人民大学) Gaoling School of Artificial Intelligence(北京人工智能学院) Amap, Alibaba Group(阿里集团阿里的地图部门) School of Computer Science & Technology(计算机科学与技术学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于不确定性一致性的查询选择方法,通过改进RLVR的样本选择策略,减少查询预算,提升推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11352 2026-02-02 cs.AI cs.FL 57%

Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces

物流领域的基础模型:迈向可验证、对话式规划界面

Yunhao Yang, Neel P. Bhatt, Christian Ellis, Samuel Li, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

机构 * Neurosymbolic Intelligence(神经符号智能) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于神经符号框架的视觉-语言物流代理,通过自然语言对话和可验证保证实现可信赖的物流规划决策,模型在少量训练样本下实现了高效且准确的物流规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21113 2026-01-30 cs.AI cs.MA 57%

Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement

计划-审核双胞胎:基于FHIR的LLM计划、指南回忆、可选缓存和自我改进的代理出院计划

Kaiyuan Wu, Aditya Nagori, Rishikesan Kamaleswaran

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 基于FHIR的LLM计划与审核框架,通过自我改进和缓存优化,提升临床出院计划的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17865 2026-01-30 cs.CL 57%

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

D模型和E模型:大语言模型采样行为中的多样性-稳定性权衡

Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中D模型与E模型在采样行为上的多样性-稳定性权衡,为任务应用中的模型选择提供了指导。

Comments 12 pages, 10 figures. Accepted by WWW'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16468 2026-01-29 cs.AI 57%

Quantifying Fidelity: A Decisive Feature Approach to Comparing Synthetic and Real Imagery

量化保真度:一种基于决定性特征的方法用于比较合成与真实图像

Danial Safaei, Siddartha Khastgir, Mohsen Alirezaei, Jeroen Ploeg, Son Tong, Chih-Hong Cheng, Xingyu Zhao

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出决定性特征保真度(DFF)方法,用于评估合成与真实图像的保真度差异,通过分析决策证据一致性提升模拟器保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17986 2026-01-27 cs.LG 57%

Federated learning for unpaired multimodal data through a homogeneous transformer model

通过同质Transformer模型实现无配对多模态数据的联邦学习

Anders Eklund

机构 * Department of Biomedical Engineering, Linköping University, Sweden(_linköping大学生物医学工程系) Department of Computer and Information Science, Linköping University, Sweden(_linköping大学计算机与信息科学系) Center for Medical Image Science and Visualization (CMIV), Linköping University, Sweden(_linköping大学医学影像科学与可视化中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过同质Transformer模型实现联邦学习,解决无配对多模态数据的训练问题,通过公共锚点对齐和子空间稳定化微调方法,在不传输私有数据的情况下实现全局模型统一表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15745 2026-01-23 cs.CL 57%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04339 2026-01-22 cs.AI 57%

Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models

辩证推理网络:一种基于不确定性的信念跟踪推理范式,用于预训练语言模型

Anran Xu, Jincheng Wang, Baigen Cai, Tao Wen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 DRN通过不确定性最小化范式提升预训练语言模型的逻辑推理能力,实现高准确率和强泛化性能。

Comments This submission represents an early exploratory draft and was uploaded prematurely. The authors have decided to withdraw it because the current version does not accurately reflect the intended scope and technical formulation of the work, and may be misleading if cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14208 2026-01-21 cs.CV cs.GR cs.LG 57%

Rig-Aware 3D Reconstruction of Vehicle Undercarriages using Gaussian Splatting

基于相机 rig 的车辆底盘 3D 重建使用高斯溅射

Nitin Kulkarni, Akhil Devarashetti, Charlie Cluss, Livio Forte, Dan Buckmaster, Philip Schneider, Chunming Qiao, Alina Vereshchaka

机构 * University at Buffalo(布法罗大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出一种基于相机 rig 的 3D 重建方法,利用高斯溅射生成逼真的车辆底盘模型,提升检查效率和买家信任度。

Comments 8 pages, 9 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11563 2026-01-21 cs.CY 57%

Human-like Social Compliance in Large Language Models: Unifying Sycophancy and Conformity through Signal Competition Dynamics

大语言模型中的类人社会合规:通过信号竞争动态统一讨好与顺从

Long Zhang, Wei-neng Chen

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本研究提出信号竞争机制,揭示大语言模型中讨好与顺从的几何流形机制,并通过整合认知对齐框架提升模型的社会合规性鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06860 2026-01-21 cs.AI 57%

ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration

ET-Agent:通过行为校准激励有效的工具集成推理代理

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 ET-Agent通过自我进化数据飞轮和行为校准训练框架,提升工具集成推理代理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01439 2026-01-19 cs.AI cs.RO 57%

Probabilistic Mission Design for Neuro-Symbolic Unmanned Aircraft Systems

基于概率的方法用于神经符号无人机系统任务设计

Simon Kohaut, Benedict Flade, Daniel Ochs, Devendra Singh Dhami, Julian Eggert, Kristian Kersting

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出概率任务设计(ProMis)方法,结合神经符号技术,用于在法律框架内导航无人驾驶航空器,通过混合概率逻辑程序和机器学习模型提升任务规划的可靠性和适应性。

Comments arXiv admin note: text overlap with arXiv:2406.03454

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14022 2026-01-19 cs.LG 57%

BLIPs: Bayesian Learned Interatomic Potentials

BLIPs: 基于贝叶斯学习的原子间势能

Dario Coscia, Pim de Haan, Max Welling

机构 * mathLab, SISSA University of Amsterdam(mathLab、SISSA大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 BLIPs是一种基于贝叶斯学习的原子间势能方法,通过变分dropout实现可扩展的不确定性估计,提升模拟化学任务中的预测精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09929 2026-01-16 cs.AI 57%

Hallucination Detection and Mitigation in Large Language Models

大语言模型中的幻觉检测与缓解

Ahmad Pesaranghader, Erin Li

机构 * CIBC(加拿大帝国商业银行)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种系统化的框架,通过分层架构和闭环反馈机制,提升大语言模型在金融等高风险领域的可靠性,减少幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08237 2026-01-14 cs.AI 57%

The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination

奖励工程的终结:大型语言模型如何重新定义多智能体协调

Haoran Su, Yandong Sun, Congjia Yu

机构 * New York University(纽约大学) Lerna AI

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型如何通过语义奖励规范和动态适应替代传统奖励工程,重新定义多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12992 2026-01-14 cs.RO cs.CL cs.CV cs.MA 57%

UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles

UNCAP:基于自然语言通信的不确定性引导神经符号规划

Neel P. Bhatt, Po-han Li, Kushagra Gupta, Rohan Siva, Daniel Milan, Alexander T. Hogue, Sandeep P. Chinchali, David Fridovich-Keil, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 UNCAP通过自然语言通信和不确定性引导方法,提升多车辆协同自动驾驶系统的可扩展性和安全性。

Journal ref AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 57%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06631 2026-01-13 cs.CL 57%

Labels have Human Values: Value Calibration of Subjective Tasks

标签具有人类价值观:主观任务的价值校准

Mohammed Fayiz Parappan, Ricardo Henao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Duke University(杜克大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出MC-STL框架,通过价值集群校准提升主观任务NLP系统的对齐性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02973 2026-01-13 cs.CL 57%

Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation

在推断前扩展:通过提前层插值增强大语言模型的事实性

Dingwei Chen, Ziqiang Liu, Feiteng Fang, Chak Tou Leong, Shiwen Ni, Ahmadreza Argha, Hamid Alinejad-Rokny, Min Yang, Chengming Li

机构 * Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) The Hong Kong Polytechnic University(香港理工大学) UNSW, Sydney, NSW 2052, Australia(新南威尔士大学) Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出PLI方法,通过提前层插值提升大语言模型的事实一致性,有效减少幻觉并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05520 2026-01-12 cs.CL 57%

CHisAgent: A Multi-Agent Framework for Event Taxonomy Construction in Ancient Chinese Cultural Systems

CHisAgent:一种用于古代中国文化系统事件分类的多智能体框架

Xuemei Tang, Chengxi Yan, Jinghang Gu, Chu-Ren Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Renmin University of China(中国人民大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 CHisAgent通过多智能体框架实现古代中国历史事件的自动分类,提升历史知识组织与跨文化理解能力。

Comments 22 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏