Constrained Process Maps for Multi-Agent Generative AI Workflows
多代理生成AI工作流的约束过程图
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本研究提出了一种基于有限时间跨度马尔可夫决策过程的多代理系统,用于提升多步骤工作流中处理不确定性和协调的能力,通过案例研究验证了其在提高准确性和减少人工审查方面的显著效果。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
多代理生成AI工作流的约束过程图
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本研究提出了一种基于有限时间跨度马尔可夫决策过程的多代理系统,用于提升多步骤工作流中处理不确定性和协调的能力,通过案例研究验证了其在提高准确性和减少人工审查方面的显著效果。
FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答
机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。
Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data
CARE-RFT:基于置信度的强化微调用于大语言模型中的可靠推理
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CARE-RFT通过引入置信度锚定的正则化方法,在保持大语言模型推理能力的同时提升其可信度和校准性能。
通过知识蒸馏实现大型语言模型的高效信念不确定性估计
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) ; Department of Rural Systems Engineering, Seoul National University(首尔国立大学农村系统工程系) ; Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) ; Department of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学科技研究院电子工程与计算机科学系)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG
AI总结 通过知识蒸馏高效估计大型语言模型的信念不确定性,减少估计误差并提升幻觉检测性能。
RePPL:通过语义传播和语言生成中的不确定性重新校准困惑度以检测可解释问答幻觉
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Tsinghua University(清华大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 RePPL通过校准语义传播和语言生成中的不确定性,提升问答幻觉检测性能,生成token级不确定性评分作为解释。
单轮信任:通过结构信号提升大语言模型的置信度估计
机构 * The University of Sydney(悉尼大学) ; University of Technology Sydney(技术大学悉尼)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG
AI总结 通过分析模型最终层隐藏状态轨迹中的多尺度结构信号,提出结构置信度方法,实现单次通过的高效、稳健置信度估计,适用于高社会影响和资源受限的LLM应用。
Comments Accepted at The ACM Web Conference 2026 (WWW 2026)
在大型语言模型长格式问答中评估不确定性校准的基准测试
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。
Comments Under Review
何时秩-1足够?基于几何的初始化方法用于参数高效微调
机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算机与信息系统学院,墨尔本大学,墨尔本,澳大利亚)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG
AI总结 本文提出Gap-Init方法,通过几何感知初始化稳定秩-1 LoRA微调,证明初始对齐对训练稳定性的重要性。
AutoHealth:一种面向自主健康数据建模的不确定性感知多智能体系统
机构 * Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院) ; Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心电子工程系) ; Tsinghua University, China(清华大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 AutoHealth通过多智能体系统自主建模健康数据,提升预测性能和不确定性估计,有效解决健康数据建模中的泛化和可靠性问题。
PS$^2$: 基于参数化控制的细粒度学生能力模拟
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY
AI总结 PS$^2$提出一种基于参数化控制的细粒度学生能力模拟方法,通过混合比率在强弱模型间插值得到更精确的能力模拟,提升学生行为相似性和题目难度预测性能。
大型语言模型(真的需要统计基础吗?
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG
AI总结 本文探讨大型语言模型是否需要统计学基础,指出其统计本质和黑箱特性使统计方法成为必要,并强调统计学界在LLMs研究中的重要性。
Comments Accepted at The Annals of Applied Statistics; Added discussions on more topics
友好而非朋友:LLM谄媚如何塑造用户信任
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 研究探讨LLM谄媚如何影响用户信任,通过实验发现适应性对话态度影响用户对LLM真实性和信任度的感知。
不确定性之影:AI不确定性可视化如何影响阿尔茨海默病预测的可信度
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 本研究探讨了AI不确定性可视化对阿尔茨海默病预测可信度的影响,发现连续编码提升可靠性,而二元编码增强即时信心,揭示了高不确定性下专业背景的权衡。