arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7565 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7565 篇

2605.23099 2026-05-25 cs.MA 67%

SVR-MAD: A Bayesian-Inspired Framework for Posterior-Guided Multi-Agent Debate

SVR-MAD:一种贝叶斯启发的后验引导多智能体辩论框架

Weifan Jiang, Rana Shahout, Minghao Li, Zhenting Qi, Yilun Du, Michael Mitzenmacher, Minlan Yu

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 针对多智能体辩论中上下文快速增长导致可扩展性受限的问题,提出贝叶斯启发的SVR-MAD框架,利用辩论前后信号构建通信图,在降低令牌成本的同时保持或提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22333 2026-05-22 cs.CR 67%

A First Measurement Study on Authentication Security in Real-World Remote MCP Servers

对现实世界远程MCP服务器认证安全性的首次测量研究

Huijun Zhou, Xiaohan Zhang, Haozhe Zhang, Haoyang Zhang, Mi Zhang, Min Yang

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本研究首次测量了现实世界远程MCP服务器的认证安全性,发现40.55%的服务器未进行认证,OAuth是主要的授权机制,但存在新的攻击面,识别出9种具体漏洞类型,并通过负责任的披露获得了9个CVE ID。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20646 2026-05-21 cs.SI 67%

DisImpact: Quantifying the Physi-Social Impact of Natural Disasters Through Social Media

DisImpact:通过社交媒体量化自然灾害的生理-社会影响

Ruichen Yao, Tejna Dasari, Xuanyu Meng, Elliot Cao, Zelin Li, Yifan Liu, Yaokun Liu, Lanyu Shang, Dong Wang

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出DisImpact框架,利用多模态大语言模型系统量化自然灾害的生理和社会影响,通过社交媒体内容分类和构建灾害影响指数,实现对灾害影响的统一表示和分析。

Comments Accepted by ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17839 2026-05-20 cs.CL cs.AI cs.LG 67%

How do LLMs Compute Verbal Confidence

LLMs如何计算言语自信

Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Veličković

机构 * Google DeepMind(谷歌DeepMind)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了大型语言模型如何内部生成言语自信评分,通过实验发现自信评分在回答生成后被缓存并用于后续输出,揭示了模型自我评估的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14828 2026-05-20 cs.IR 67%

Toward Robust GraphRAG: Mitigating Retrieval Drift and Hallucination from Imperfect Knowledge Graphs

迈向稳健的GraphRAG:减轻不完美知识图谱中的检索漂移和幻觉

Yizhuo Ma, Jinchuan Xu, Tao Wen, Qizhi Chen, Jiakai Li, Rongzheng Wang, Muquan Li, Shuang Liang, Ke Qin

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本文针对GraphRAG中因知识图谱不完美导致的检索漂移和幻觉问题,提出CS-RAG框架,通过精细化检索和充分性检查来减少不准确的证据延续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17366 2026-05-19 cs.IR 67%

Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation

基于文本引导的视觉表示学习用于鲁棒的多模态电子商务推荐

Yufei Guo, Jing Ma, Tianlu Zhang, Shijie Yang, Yanlong Zang, Weijie Ding, Pinghua Gong, Jungong Han

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本文提出Text-Guided Q-Former框架,通过结构化元数据指导视觉令牌提取,提升多模态检索的鲁棒性,实验表明其在电子商务数据集上显著提升了检索性能。

Comments 12 pages, 5 figures. Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026). Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16806 2026-05-18 cs.LG cs.AI cs.CL 67%

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

超越二元奖励:训练语言模型以对其不确定性进行推理

Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLCR方法,通过联合提升准确性和校准置信度,改进语言模型的推理能力,实验显示其在不同数据集上提升校准效果而不影响准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09946 2026-05-14 cs.GT 67%

Structure from Strategic Interaction & Uncertainty: Risk Sensitive Games for Robust Preference Learning

基于战略互动与不确定性的结构:用于鲁棒偏好学习的风险敏感游戏

Max Horwitz, Jake Gonzales, Eric Mazumdar, Lillian J. Ratliff

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出风险敏感偏好游戏,通过优化凸风险度量来提升鲁棒性,建立稳定算法并控制偏置,实验证明其在不同数据层的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09647 2026-05-12 cs.SI 67%

Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs

对LLMs中隐含冲突监控机制对抗刻板印象的建模

Jingshen Zhang, Bo Wang, Yanlin Fu, Dongming Zhao, Ruifang He, Yuexian Hou, Zifei Yu

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出COCO方法,通过对比因果机制识别高内在一致性且强跨对比差异的神经元,提升模型公平性并对抗对抗性劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07825 2026-05-11 cs.MM cs.CV 67%

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17980 2026-05-08 cs.CV 67%

Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding

感知空间:面向高效准确3D场景理解的自我运动感知视频表示

Shuyao Shi, Kang G. Shin

机构 * Department of Computer Science(计算机科学系) University of Michigan(密歇根大学) University of Michigan Ann Arbor(密歇根大学安阿伯分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出Motion-MLLM框架,结合IMU数据与视觉特征,通过运动-视觉关键帧过滤模块和异构跨模态融合模块,提升3D场景理解与空间推理的效率和准确性。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16994 2026-04-27 cs.LG cs.AI cs.CL 67%

FADE: Why Bad Descriptions Happen to Good Features

FADE:为什么好的特征会遇到糟糕的描述

Bruno Puri, Aakriti Jain, Elena Golimblevskaia, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Sebastian Lapuschkin

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 FADE提出了一种模型无关的框架,用于自动评估特征与描述的一致性,通过四个指标量化特征与描述之间的不一致原因,揭示了生成特征描述的挑战。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17138-17160, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01384 2026-04-22 hep-th 67%

AI usage in string theory, a case study: String Vacua in the Interior of Moduli Space

人工智能在弦论中的应用:弦真空在模空间内部的案例研究

Timm Wrase

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文探讨了在模空间内部的四维N=1Minkowski真空,通过Landau-Ginzburg模型描述,分析了人工智能在弦论中的应用及对弦景观和swampland猜想的贡献。

Comments 8 real pages + AI content; proceedings of the workshop "Recent Progress in Computational String Geometry,'' held at the Chennai Mathematical Institute in India in January 2026; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18168 2026-04-21 cs.CV 67%

Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation

通过判别性文本表示将一类标签的一步图像生成扩展到文本

Chenxi Zhao, Chen Zhu, Xiaokun Feng, Aiming Hao, Jiashu Zhu, Jiachen Lei, Jiahong Wu, Xiangxiang Chu, Jufeng Yang

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本文提出通过判别性文本表示将MeanFlow框架从固定类标签扩展到灵活文本输入,提升生成内容的丰富性,并在扩散模型上验证了方法的有效性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17837 2026-04-21 cs.AI cs.CL cs.LG 67%

Polysemantic Experts, Monosemantic Paths: Routing as Control in MoEs

语义专家,单一语义路径:在混合专家模型中路由作为控制

Charles Ye, Bo Yuan, Lee Sharkey

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种无参数分解方法,将MoE模型的隐藏状态分为控制信号和内容通道,发现专家路径变得单一语义,而控制信号在层间旋转,从而实现组合专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15400 2026-04-20 cs.LG cs.AI cs.CL 67%

Hallucination as Trajectory Commitment: Causal Evidence for Asymmetric Attractor Dynamics in Transformer Generation

幻觉作为轨迹承诺:转换器生成中的非对称吸引子动态的因果证据

G. Aytug Akarlar

机构 * Chimera Research Initiative(Chimera研究计划)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过相同提示分支实验揭示幻觉是受非对称吸引子动态支配的早期轨迹承诺,发现幻觉轨迹在生成第一个词时即与事实轨迹分离,且需要多步干预才能纠正。

Comments 21 pages, 12 figures, 8 tables. Code and data: https://github.com/akarlaraytu/trajectory-commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04567 2026-04-17 cs.CV 67%

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction

所有变化可能都有不变原则:通过设计概念再现改进永动有害迷因检测

Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory Institute of Software Chinese Academy of Sciences(软件研究所信息集成系统技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出RepMD方法,通过设计概念再现检测不断变化的有害迷因,利用攻击树定义设计概念图,并指导多模态大语言模型提高检测准确率。

Comments 19 pages, 11 figures, 9 tables accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10384 2026-04-14 cs.HC 67%

Context-KG: Context-Aware Knowledge Graph Visualization with User Preferences and Ontological Guidance

Context-KG: 基于上下文的面向用户偏好和本体引导的知识图谱可视化

Rumali Perera, Xiaoqi Wang, Han-wei Shen

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出Context-KG框架,通过大语言模型提取用户偏好,结合本体引导布局,提升知识图谱可视化的可解释性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10071 2026-04-14 cs.CV 67%

Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation

聚光与阴影:基于注意力的双锚点反思解码用于MLLM幻觉缓解

Yebo Wu, Han Jin, Zhijiang Guo, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(澳门大学物联网国家重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出双锚点反思解码框架DaID,通过动态校准每个token生成来缓解MLLM幻觉,利用视觉注意力分布指导双锚点选择,提升推理能力。

Comments Accepted for Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09749 2026-04-14 cs.CV 67%

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

看清真相:公平关注提升 groundedness 并减少 hallucination 在视觉语言对齐中

Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋) King Fahd University of Petroleum and Minerals, Dhahran, Saudi Arabia(法赫德国王石油矿产大学,达兰,沙特阿拉伯) Macquarie University, Sydney, Australia(麦考瑞大学,悉尼,澳大利亚) University of Surrey, Guildford, United Kingdom(萨里大学,吉尔福德,英国) University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出DOP-OBC方法,通过公平分配注意力减少视觉语言对齐中的幻觉问题,提升生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07891 2026-04-10 cs.SE 67%

AFGNN: API Misuse Detection using Graph Neural Networks and Clustering

AFGNN:基于图神经网络和聚类的API误用检测

Ponnampalam Pirapuraj, Tamal Mondal, Sharanya Gupta, Akash Lal, Somak Aditya, Jyothi Vedurada

专题命中 知识编辑与模型理解 :language model(abstract);small language model(abstract)

AI总结 本文提出AFGNN框架,利用API流程图捕捉代码中的执行序列、数据和控制流信息,通过自监督预训练和聚类识别不同API使用模式,有效检测Java代码中的API误用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16548 2026-04-09 cs.HC cs.RO 67%

SemanticScanpath: Combining Gaze and Speech for Situated Human-Robot Interaction Using LLMs

语义扫描路径:利用语言模型结合目光和语音实现情境化的人机交互

Elisabeth Menendez, Michael Gienger, Santiago Martínez, Carlos Balaguer, Anna Belardinelli

机构 * Universidad Carlos III de Madrid (UC3M)(马德里卡洛斯三世大学) Honda Research Institute Europe(本田欧洲研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出结合语音和目光的语义扫描路径表示,使语言模型能更准确地理解情境,解决模糊请求。通过文本语义翻译用户扫描路径和语音请求,验证了系统在多个任务和场景中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05978 2026-04-08 cs.RO 67%

Automating Manual Tasks through Intuitive Robot Programming and Cognitive Robotics

通过直观的机器人编程和认知机器人自动化手动任务

Bijan Kavousian, Petar Tesic, Oliver Petrovic, Christian Brecher

机构 * Laboratory for Machine Tools and Production Engineering (WZL) of RWTH Aachen University(亚琛工业大学机床与生产工程实验室(WZL))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于人类自然交互的直观机器人用户编程方法,利用大语言模型和计算机视觉将自然语言和手势转化为机器人程序,并通过澄清问题和视觉反馈确保程序的安全性和透明性。

Comments This submission contains both an English translation and the original German version. The German version was originally published in the Proceedings of the 71st GfA Conference (2025)

Journal ref Proceedings of the 71st GfA Conference, Aachen, Germany, GfA-Press, 2025, pp. 812-817

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27098 2026-04-07 cs.SE 67%

Ensemble-Based Uncertainty Estimation for Code Correctness Estimation

基于集成的代码正确性估计不确定性估计

Yunxiang Wei, Tianlin Li, Yuwei Zheng, Yanni Dong, Aishan Liu, Qiang Hu, Xiaoyu Zhang, Mingfei Cheng, Jian Yang

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出ESE方法,通过评估多模型集成样本的一致性来估计不确定性,实验表明其在代码正确性评估中表现更优,并提出Cas框架提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01569 2026-04-03 cs.CV cs.MM 67%

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21106 2026-04-03 cs.CL cs.AI cs.LG 67%

Semantic Refinement with LLMs for Graph Representations

基于LLM的图表示语义细化

Safal Thapaliya, Zehong Wang, Jiazheng Li, Ziming Li, Yanfang Ye, Chuxu Zhang

机构 * University of Connecticut, USA(康涅狄格大学) University of Notre Dame, USA(圣母大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于图示例引导的语义细化框架,通过图内结构和语义相似节点指导LLM优化节点描述,提升图表示在异构语义下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08018 2026-04-02 cs.CV 67%

Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared

不再缺失:字典引导的跨模态图像融合在红外缺失情况下的应用

Yafei Zhang, Meng Ma, Huafeng Li, Yu Liu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于共享卷积字典的字典引导框架,解决红外缺失时的跨模态图像融合问题,通过联合字典学习、视觉引导红外推断和自适应融合方法提升感知质量和下游检测性能。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28935 2026-04-01 hep-ph hep-ex hep-th 67%

Autonomous Discovery of Particle Physics Theories from Experimental Data

从实验数据自主发现粒子物理理论

Stephon Alexander, Benjamin Bradley, Loukas Gouskos, Cooper Niu

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出Albert框架,通过神经符号AI系统在理论空间中系统导航,利用规则语法生成粒子对称性和相互作用的序列,结合强化学习环境和χ²分析,自主发现标准模型并预测顶夸克质量。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 67%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25711 2026-03-27 cs.CV 67%

Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs

视觉注意:用于抗幻觉的MDLLMs

Vishal Narnaware, Animesh Gupta, Kevin Zhai, Zhenyi Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出VISAGE框架,通过校准解码器目标来减少多模态幻觉,通过空间熵分析提升视觉基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏