arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-09 至 2026-01-09 共收录 38 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2507.11939 2026-01-09 cs.CL cs.AI cs.CV cs.MM 81%

POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering

POLYCHARTQA: 通过多语言图表问答基准评估大视觉-语言模型

Yichen Xu, Liangyu Chen, Liang Zhang, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 PolyChartQA是首个大规模多语言图表问答基准,通过多语言图表生成和评估,揭示英语与其他语言在图表理解上的性能差距,并提供训练集提升多语言模型表现。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04118 2026-01-09 cs.CV 79%

GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning

GeoReason: 通过逻辑一致性强化学习对遥感视觉-语言模型中的思考与回答进行对齐

Wenshuai Li, Xiantai Xiang, Zixiao Wen, Guangyao Zhou, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuxin Hu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 GeoReason通过逻辑一致性强化学习提升遥感视觉-语言模型的推理可靠性与可解释性,实现思考与决策的同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03905 2026-01-09 cs.AI cs.CL cs.LG 73%

Current Agents Fail to Leverage World Model as Tool for Foresight

当前智能体无法利用世界模型作为前瞻性工具

Cheng Qian, Emre Can Acikgoz, Bingxuan Li, Xiusi Chen, Yuji Zhang, Bingxiang He, Qinyu Luo, Dilek Hakkani-Tür, Gokhan Tur, Yunzhu Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) THU(清华大学) JHU(约翰霍普金斯大学) Columbia(哥伦比亚大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了当前智能体能否利用世界模型作为工具提升前瞻性认知,发现其在模拟调用和结果整合方面存在显著不足。

Comments 36 Pages, 13 Figures, 17 Tables (Meta data updated)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19850 2026-01-09 cs.CV 70%

FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs

FALCONEye: 在一小时内视频中寻找答案并定位内容的多模态大语言模型

Carlos Plou, Cesar Borja, Ruben Martinez-Cantin, Ana C. Murillo

机构 * DIIS-I3A, University of Zaragoza(DIIS-I3A,西班牙阿利坎特大学)

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FALCONEye通过多模态大语言模型在小时长视频中高效定位内容并回答问题,超越现有模型性能并显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17722 2026-01-09 cs.CV cs.AI 62%

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2601.04891 2026-01-09 cs.CV cs.LG 81%

Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform

在工业生成式AI平台上扩展视觉语言模型用于制药长格式视频推理

Suyash Mishra, Qiang Li, Srikanth Patil, Satyanarayan Pati, Baddu Narendra

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出工业GenAI框架,解决制药领域长格式视频推理问题,通过多模态架构和实证分析提升效率并揭示现有VLMs的限制。

Comments Submitted to the Industry Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04225 2026-01-09 cs.CY cs.AI 70%

Can Consumer Chatbots Reason? A Student-Led Field Experiment Embedded in an "AI-for-All" Undergraduate Course

消费者聊天机器人能推理吗?一个嵌入

Amarda Shehu, Adonyas Ababu, Asma Akbary, Griffin Allen, Aroush Baig, Tereana Battle, Elias Beall, Christopher Byrom, Matt Dean, Kate Demarco, Ethan Douglass, Luis Granados, Layla Hantush, Andy Hay, Eleanor Hay, Caleb Jackson, Jaewon Jang, Carter Jones, Quanyang Li, Adrian Lopez, Logan Massimo, Garrett McMullin, Ariana Mendoza Maldonado, Eman Mirza, Hadiya Muddasar, Sara Nuwayhid, Brandon Pak, Ashley Petty, Dryden Rancourt, Lily Rodriguez, Corbin Rogers, Jacob Schiek, Taeseo Seok, Aarav Sethi, Giovanni Vitela, Winston Williams, Jagan Yetukuri

机构 * George Mason University(乔治·马歇尔大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 本文通过学生主导的实地实验,评估了消费者聊天机器人在推理任务中的表现,揭示了其在不同推理类型上的性能差异及教学意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22836 2026-01-09 cs.AI 70%

Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes

通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡

Guanyu Yao, Qiucheng Wu, Yang Zhang, Zhaowen Wang, Handong Zhao, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) Adobe Research(Adobe研究院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG 57%

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04706 2026-01-09 cs.CV 57%

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 11 篇

2601.04777 2026-01-09 cs.CV cs.AI 90%

GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models

GeM-VG:迈向通用多图像视觉 grounding 的多模态大语言模型

Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GeM-VG通过引入MG-Data-240K数据集和混合强化微调策略,提升多图像视觉 grounding 和通用多图像理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18693 2026-01-09 cs.CV 79%

MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging

MVT:基于分类对齐的土地覆盖标签的掩码导向视觉-语言模型

Siyi Chen, Kai Wang, Weicong Pang, Ruiming Yang, Ziru Chen, Renjun Gao, Alexis Kai Hon Lau, Dasa Gu, Chenchen Zhang, Cheng Li

机构 * HKUST(香港科技大学) JHU(约翰·霍普金斯大学) CUHKSZ(香港中文大学) NUS(新加坡国立大学) MUST(穆斯林大学)

专题命中 视觉定位与Grounding :vision-language model(title);MLLM(abstract);分类 cs.CV

AI总结 MVT通过三阶段框架结合类无关掩码证据与基于分类的场景解释,提升遥感土地覆盖标签的准确性和信息性。

Comments The project is available at https://charlescsyyy.github.io/MVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04201 2026-01-09 cs.CL cs.AI cs.CY cs.HC 79%

Collective Narrative Grounding: Community-Coordinated Data Contributions to Improve Local AI Systems

集体叙事 grounding:社区协调的数据贡献以改进本地 AI 系统

Zihan Gao, Mohsin Y. K. Yousufi, Jacob Thebault-Spieker

机构 * Information Science University of Wisconsin-Madison(信息科学大学威斯康星大学麦迪逊分校) Digital Media Georgia Tech(数字媒体佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出集体叙事 grounding 协议,通过社区协调的数据贡献,改进本地 AI 系统,解决社区特定查询的问答问题。

Comments 9 pages, 2 figures, Presented at the NeurIPS 2025 ACA Workshop accepted-papers.html" target="_blank" rel="noopener">https://acaworkshop.github.io/accepted-papers.html,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04734 2026-01-09 cs.CV 77%

AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection

AIVD:自适应边缘-云协作用于准确高效的工业视觉检测

Yunqing Hu, Zheming Yang, Chang Zhao, Qi Guo, Meng Gao, Pengcheng Li, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02948 2026-01-09 cs.DB cs.CL 71%

Grounding Natural Language to SQL Translation with Data-Based Self-Explanations

通过数据驱动的自我解释实现自然语言到SQL翻译

Yuankai Fan, Tonghui Ren, Can Huang, Zhenying He, X. Sean Wang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出CycleSQL框架,通过数据驱动的自我解释提升自然语言到SQL翻译的准确性和可解释性。

Comments ICDE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18620 2026-01-09 cs.CV physics.comp-ph 57%

Spontaneous emergence of linguistic statistical laws in images via artificial neural networks

通过人工神经网络在图像中自发涌现语言统计规律

Ping-Rui Tsai, Chi-hsiang Wang, Yu-Cheng Liao, Hong-Yue Huang, Tzay-Ming Hong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 通过人工神经网络在图像中自发涌现语言统计规律,揭示图像处理能自动生成类似语言的统计特性。

Comments 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04715 2026-01-09 cs.CV 57%

On the Holistic Approach for Detecting Human Image Forgery

对人类图像伪造的总体方法

Xiao Guo, Jie Zhu, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。

Comments 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06282 2026-01-09 cs.CV 57%

From Dataset to Real-world: General 3D Object Detection via Generalized Cross-domain Few-shot Learning

从数据集到现实世界:通过通用跨领域少样本学习实现通用3D目标检测

Shuangzhi Li, Junlong Shen, Lei Ma, Xingyu Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出通用跨领域少样本学习方法,通过融合2D语义与3D空间推理,实现对现实世界中常见和新类目标的高效检测。

Comments The latest version refines the few-shot setting on common classes, enforcing a stricter object-level definition

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15490 2026-01-09 cs.CL 50%

Collaborative Problem-Solving in an Optimization Game

优化游戏中的协作问题解决

Isidora Jeknic, Alex Duchnowski, Alexander Koller

机构 * Saarland University(萨尔兰大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种新的对话游戏,通过协作解决双人旅行商问题,结合大语言模型与符号机制,实现了在自我对战中45%的最优解率,并展示了与人类用户协作和泛化能力。

Comments 23 pages, 16 figures

Journal ref Proceedings of the 26th Annual Meeting of the Special Interest Group on Discourse and Dialogue (2025) 780-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04525 2026-01-09 cs.CL 50%

GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence

GRACE:基于上下文证据的强化学习用于 grounded 响应和回避

Yibo Zhao, Jiapeng Zhu, Zichen Ding, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 GRACE通过强化学习框架整合证据基础和可靠回避,解决检索增强生成中的准确性和回避性问题,实现高准确率与低标注成本的平衡。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04196 2026-01-09 cs.CL cs.IR 50%

RAGVUE: A Diagnostic View for Explainable and Automated Evaluation of Retrieval-Augmented Generation

RAGVUE:一种用于可解释和自动评估检索增强生成的诊断视图

Keerthana Murugaraj, Salima Lamsiyah, Martin Theobald

机构 * University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 RAGVUE通过分解RAG行为并提供结构化解释,实现无参考的自动评估,揭示RAG流程中的细粒度失败。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2601.05125 2026-01-09 cs.CV cs.AI 62%

VERSE: Visual Embedding Reduction and Space Exploration. Clustering-Guided Insights for Training Data Enhancement in Visually-Rich Document Understanding

VERSE:视觉嵌入减少与空间探索。用于视觉丰富文档理解的训练数据增强的聚类引导洞察

Ignacio de Rodrigo, Alvaro J. Lopez-Lopez, Jaime Boal

机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究所、ICAI工程学院、科利马斯天主教大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VERSE通过探索视觉嵌入空间,提升视觉丰富文档理解的训练数据增强效果,使本地模型性能达到或超越SaaS解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 57%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04794 2026-01-09 cs.AI 57%

APEX: Academic Poster Editing Agentic Expert

APEX:学术海报编辑智能专家

Chengxin Shi, Qinnan Cai, Zeyuan Chen, Long Zeng, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

AI总结 APEX是首个交互式学术海报编辑框架,通过多级API和审查机制实现细粒度控制,并引入首个系统性基准APEX-Bench评估编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2410.24164 2026-01-09 cs.LG cs.RO 70%

$π_0$: A Vision-Language-Action Flow Model for General Robot Control

π₀:一种面向通用机器人控制的视觉-语言-动作流模型

Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出了一种基于预训练视觉-语言模型的流匹配架构,用于通用机器人控制,通过零样本学习和微调实现多样任务的执行。

Comments See project website for videos: https://physicalintelligence.company/blog/pi0 Published in RSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 57%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 6 篇

2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 79%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04752 2026-01-09 cs.CV 74%

Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition

基于骨架化的对抗扰动在大视觉语言模型数学文本识别中的应用

Masatomo Yoshida, Haruto Namura, Nicola Adami, Masahiro Okuda

机构 * Doshisha University Kyoto, 610-0394 Japan University of Brescia Brescia, 25134 Italy Independent Researcher Tokyo, Japan

专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.CV

AI总结 本文提出基于骨架化的对抗扰动方法,用于评估大视觉语言模型在数学文本识别中的视觉能力和局限性,并通过ChatGPT验证其实际应用价值。

Comments accepted to ITC-CSCC 2025

Journal ref Proc. ITC-CSCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05159 2026-01-09 cs.CV cs.AI 62%

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉

Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Hong Kong University of Science and Technology(香港理工大学) LIGHTSPEED

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VLI通过可解释的双因果引导方法,有效减少大语言模型中的对象幻觉,提升多模态任务的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04199 2026-01-09 cs.LG cs.AI cs.CL 62%

The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs

被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植

Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang

机构 * National University of Defense Technology(国防科技大学) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Multimedia Department, Xiaomi Inc(小米公司多媒体部门) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出参数空间干预方法,通过提取原始模型的安全知识并注入目标模型,提升医疗大语言模型的安全性,同时保持医疗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏