arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1753 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1753 篇

2604.10585 2026-04-14 cs.LG cs.AI cs.CL 69%

Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs

在奉承式微调下校准崩溃:奖励黑客如何破坏大语言模型的不确定性量化

Subramanyam Sahoo

机构 * Cambridge AI Safety Hub (CAISH)(剑桥人工智能安全中心)

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

AI总结 研究探讨了在强化学习从人类反馈(RLHF)等方案中,奉承式微调对校准的影响,发现GRPO微调导致校准退化,尽管效果不显著,但经矩阵缩放后仍保留较高校准误差。

Comments Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14233 2025-01-07 cs.CV cs.AI cs.CL cs.LG 69%

Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback

Wenyi Xiao, Ziwei Huang, Leilei Gan, Wanggui He, Haoyuan Li, Zhelun Yu, Fangxun Shu, Hao Jiang, Linchao Zhu

专题命中 幻觉与事实性 :DPO(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments repo: https://github.com/Mr-Loevan/HSA-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 67%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05909 2026-08-07 cs.CR 新提交 67%

MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

MMAligner:通过表示校准保护多模态大语言模型

Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。

Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29527 2026-08-03 cs.LG cs.AI cs.CY econ.EM stat.ML 新提交 67%

TerraNova: A Foundation Model for the Anthropocene

TerraNova:人类世的基础模型

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano(米兰理工大学) RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。

Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08159 2026-07-31 cs.LG cs.AI cs.CL 版本更新 67%

The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models

自信流形:语言模型中正确性表示的几何结构

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 67%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12336 2026-07-15 cs.CL cs.AI cs.CY cs.ET cs.HC 新提交 67%

Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)

评估低资源语言中的健康错误信息:将小语言模型与文化敏感的负责任自然语言处理框架相结合(以孟加拉语为例)

Farnaz Farid, Raihan Alam, Al Al-Areqi, Farhad Ahamed, Muhammad Hassan Khan, Sadia Hossain, Irena Veljanova, Anika Tabassum Binte Hossain

机构 * Western Sydney University(西悉尼大学) Microsoft(微软公司) Excelsia College(埃克塞尔西亚学院) Faulconbridge Health Centre(福尔康布里奇健康中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究针对低资源语言中健康错误信息难检测问题,提出结合小语言模型与文化敏感的负责任自然语言处理框架,以孟加拉语为例进行实验,证明Phi-4表现优,还设计新框架,为评估低资源语言错误信息提供整体视角。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12257 2026-07-15 cs.AI cs.CL cs.IR cs.LG 新提交 67%

On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage

4B 设备上的深度研究:曝光界限忠实度、检索界限覆盖率

Vinay Kumar Chaganti

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究聚焦 4B 设备上深度研究,区分引用主张忠实度与可信覆盖率两个量,通过交叉对比来源字符数和质量,发现曝光决定忠实度,检索决定覆盖率,提出先提高曝光再调控检索召回率的实际方法。

Comments 13 pages, 2 figures, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12446 2026-07-13 cs.CL cs.AI cs.LG 版本更新 67%

Multi-Attribute Steering of Language Models via Targeted Intervention

通过目标干预对语言模型进行多属性引导

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何对语言模型进行多属性引导,提出MAT-Steer框架,通过对齐目标学习引导向量,减少属性间冲突,在问答和生成任务中评估,该框架优于现有方法。

Comments ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02089 2026-07-03 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 67%

ESC: Emotional Self-Correction for Reliable Vision-Language Models

ESC:面向可靠视觉语言模型的情感自我纠正

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。

Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28817 2026-06-30 eess.SY cs.SY 67%

Trust-Calibrated Certified Repair for Physics-Constrained Decisions under Localized Model Misspecification

面向局部模型误设下物理约束决策的信任校准认证修复

Yifan Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract)

AI总结 针对模型信任修复在局部模型误设下导致虚假安全的问题,提出信任校准认证修复(TCR),通过错误发现控制、测试门控收缩、不确定性比例安全裕度和认证修复程序,实现高可行性、低成本且可解释的修复。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25760 2026-06-25 cs.LG cs.AI cs.CL cs.CV 新提交 67%

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12900 2026-06-12 cs.AI cs.CL cs.LG 新提交 67%

Zero-source LLM Hallucination Detection with Human-like Criteria Probing

零源大语言模型幻觉检测:类人类标准探测

Jiahao Yang, Shuhai Zhang, Hailong Kang, Feng Liu, Qi Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) The University of Melbourne(墨尔本大学) Pazhou Laboratory(帕乔实验室) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09856 2026-06-10 cs.CL cs.AI cs.LG stat.ML 新提交 67%

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

使用概率程序训练大型语言模型的归纳推理

Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于程序的后验训练(PPT)方法,利用LLM生成概率程序场景,通过推理产生分布目标,微调模型以提升归纳推理准确性、与人类判断的一致性及校准能力。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12263 2026-06-09 cs.CL cs.AI cs.LG 版本更新 67%

Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers

多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵

Yixuan Du, Chenxiao Yu, Haoyan Xu, Ziyi Wang, Yue Zhao, Xiyang Hu

机构 * Georgetown University(乔治城大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院公园分校) Arizona State University(亚利桑那州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多模态生成式引擎优化(MGEO)方法,通过联合优化图像扰动和文本后缀,利用视觉-语言模型内部跨模态知识耦合,实现对产品排名的有效操纵,揭示了多模态基础模型知识基础的脆弱性。

Comments Proceedings of the 4th Workshop on Towards Knowledgeable Foundation Models (KnowFM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05650 2026-06-02 cs.CL cs.AI cs.LG 67%

Optimizing Diversity and Quality through Base-Aligned Model Collaboration

通过基座对齐模型协作优化多样性与质量

Yichen Wang, Chenghao Yang, Tenghao Huang, Muhao Chen, Jonathan May, Mina Lee

机构 * University of Chicago(芝加哥大学) University of Southern California, Information Sciences Institute(南加州大学信息科学研究所) University of California, Davis(加州大学戴维斯分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基座对齐模型协作框架(BACo),在推理时通过令牌级路由策略动态结合基座LLM与其对齐版本,以单次前向传递同时提升生成多样性和质量。

Comments ICML 2026. (47 pages, 22 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05566 2026-06-02 stat.ML cs.AI cs.CL cs.LG stat.AP 67%

Domain-Shift-Aware Conformal Prediction for Large Language Models

领域偏移感知的共形预测用于大型语言模型

Zhexiao Lin, Yuanyuan Li, Neeraj Sarna, Yuanyuan Gao, Michael von Gablenz

机构 * University of Waterloo(多伦多大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出领域偏移感知共形预测框架,通过重加权校准样本应对分布偏移,在MMLU基准上提升覆盖可靠性。

Comments Accepted to Forty-Third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31445 2026-06-01 cs.GT cs.AI cs.CL cs.LG 67%

Used Car Salesbots? Honesty and Credulity of LLMs as Bargaining Agents under Partial Information

二手车销售机器人?作为讨价还价代理的LLM在部分信息下的诚实与轻信

Antonio Valerio Miceli-Barone, Vaishak Belle, Shay B. Cohen

机构 * University of Edinburgh(爱丁堡大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLM代理在模拟讨价还价场景中的表现,发现它们偏离博弈论均衡,尝试撒谎但无法有效利用信息不对称,且优化财务效用会增强谈判能力但增加不诚实行为。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27288 2026-05-27 cs.CL cs.AI cs.LG 67%

It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty

并非总是谄媚:基于认知不确定性测量LLM的从众行为

Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MUSE框架,通过区分谄媚从众和不确定性驱动的从众,揭示LLM在用户反驳时改变立场的行为机制,并发现两种从众均随用户感知专业性和建议合理性增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23938 2026-05-26 cs.AI cs.CY cs.LG 67%

Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors

LLM介导的普适系统中的权威倒置:当模型信任用户胜过传感器

Long Zhang, Zi-bo Qin, Wei-neng Chen

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computer Science(计算机科学学院) Engineering, South China University of Technology(华南理工大学工程学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本研究揭示了大语言模型在融合传感器与用户冲突信息时,由于格式依赖性导致数值传感器数据被自然语言用户主张支配的权威倒置现象,并提出了几何框架、审计指标(CIR和AAI)以及推理时层干预方法(GAC)来诊断和缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19220 2026-05-20 cs.CL cs.AI cs.LG 67%

Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

位置:在LLM中的不确定性量化仅仅是无监督聚类

Tiejin Chen, Longchao Da, Xiaoou Liu, Hua Wei

机构 * School of Computing(计算学院) Augmented Intelligence, Arizona State University(智能增强与亚利桑那州立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文指出,当前LLM的不确定性量化方法本质上是无监督聚类算法,无法有效评估模型的外部正确性,导致无法检测出自信但错误的回答。文章提出了改进的不确定性量化方法,以确保模型的自信度能可靠地反映现实。

Comments Accepted by ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18648 2026-05-19 cs.LG cs.AI cs.CL 67%

An Assessment of Human vs. Model Uncertainty in Soft-Label Learning and Calibration

对软标签学习和校准中人类与模型不确定性的评估

Maja Pavlovic, Silviu Paun, Massimo Poesio

机构 * Queen Mary University London(伦敦女王玛丽大学) Amazon(亚马逊) University of Utrecht(乌得勒支大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过对比人类和模型标签在软标签学习中的效果,发现人类标签不仅提升了模型准确性,还通过正则化作用改善了模型在困难样本上的校准和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14049 2026-05-15 cs.AI cs.CL cs.CY 67%

Bridging Legal Interpretation and Formal Logic: Faithfulness, Assumption, and the Future of AI Legal Reasoning

弥合法律解释与形式逻辑:忠实性、假设与AI法律推理的未来

Olivia Peiyu Wang, Leilani H. Gilpin

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一种结合大语言模型与形式验证的神经符号方法,旨在提升AI辅助法律推理的可靠性与可信度,减少人工验证负担。

Comments 2 pages abstract accepted by Bloomberg LSLLAI 2026 Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09844 2026-05-12 cs.AI cs.CL cs.LG 67%

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

元认知探测:用于大语言模型的五种行为校准诊断

Rafael C. T. Oliveira

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出元认知探测工具,通过五个维度评估大语言模型的自信行为,揭示模型在特定领域的过度自信问题,展示了Gemini 2.5 Flash在不同任务中的显著差异。

Comments 27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16994 2026-04-27 cs.LG cs.AI cs.CL 67%

FADE: Why Bad Descriptions Happen to Good Features

FADE:为什么好的特征会遇到糟糕的描述

Bruno Puri, Aakriti Jain, Elena Golimblevskaia, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Sebastian Lapuschkin

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FADE提出了一种模型无关的框架,用于自动评估特征与描述的一致性,通过四个指标量化特征与描述之间的不一致原因,揭示了生成特征描述的挑战。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17138-17160, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17651 2026-04-21 cs.CV cs.RO 67%

Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception

以基础设施为中心的世界模型:弥合时间深度与空间广度以实现道路感知

Siyuan Meng, Chengbo Ai

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(土木与环境工程系,马萨诸塞大学阿默斯特分校)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 本文提出以基础设施为中心的世界模型,通过时空互补性提升道路感知能力,提出三阶段框架和双层架构,结合多模态数据引擎和开放源代码基础,推动基础设施理解交通。

Comments 18 pages, 7 tables, 1 figure, vision paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15488 2026-04-20 cs.LG cs.AI cs.CL 67%

FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models

FineSteer: 一种用于大语言模型推理时细粒度引导的统一框架

Zixuan Weng, Jinghuai Zhang, Kunlin Cai, Ying Li, Peiran Wang, Yuan Tian

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FineSteer框架,通过条件引导和细粒度向量合成两个阶段实现高效引导,保留模型效用并提升引导效果,实验显示其在安全性和真实性基准上表现优异。

Comments Accepted by ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11737 2026-04-14 cs.LG cs.AI cs.CL 67%

TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning

TokUR:用于大语言模型推理的令牌级不确定性估计

Tunyu Zhang, Haizhou Shi, Yibin Wang, Hengyi Wang, Xiaoxiao He, Zhuowei Li, Haoxian Chen, Ligong Han, Kai Xu, Huan Zhang, Dimitris Metaxas, Hao Wang

机构 * Rutgers University(罗格斯大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Red Hat AI Innovation(红帽AI创新)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TokUR框架,通过引入低秩随机权重扰动生成令牌级不确定性分布,提升大语言模型在数学推理中的可靠性和可解释性。

Comments Accepted to International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08815 2026-04-13 cs.CV 67%

Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models

通过上下文对齐的视觉-语言模型实现负责任的多模态医疗推理

Sumra Khan, Sagar Chhabriya, Aizan Zafar, Sheeraz Arif, Amgad Muneer, Anas Zafar, Shaina Raza, Rizwan Qureshi

机构 * Salim Habib University(萨利姆·哈比卜大学) Institute of Business Administration Sukkur(苏库尔工商管理学院) University of Central Florida(中佛罗里达大学) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Toronto Metropolitan University(多伦多都会大学) Vector Institute(向量研究所)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 本文提出一种上下文对齐的框架,通过整合多种临床证据提升医疗多模态推理的可靠性与可信度,实验显示其在胸部X光数据集上提升了判别性能并减少幻觉关键词。

详情

展开后加载摘要…

URL PDF HTML 收藏