arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-23 至 2026-01-23 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 14 篇

2601.15316 2026-01-23 cs.AI cs.CV 81%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16108 2026-01-23 cs.AI 79%

Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources

多模态气候虚假信息检测:整合视觉-语言模型与外部知识源

Marzieh Adeli Shamsabad, Hamed Ghodrati

机构 * CRIM

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15711 2026-01-23 cs.CV 79%

Zero-Shot Product Attribute Labeling with Vision-Language Models: A Three-Tier Evaluation Framework

基于视觉-语言模型的零样本产品属性标注:一种三级评估框架

Shubham Shukla, Kunal Sonalkar

机构 * Nordstrom(诺德斯特拉姆)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种三级评估框架,评估视觉-语言模型在多属性服装任务中的零样本属性标注性能,发现高效模型在成本较低时能实现接近旗舰级性能,揭示了属性适用性检测是关键瓶颈。

Comments Accepted to WACV 2026 Workshop on Physical Retail AI (PRAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11304 2026-01-23 cs.AI cs.CL cs.CV 79%

Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring

利用实例分割辅助的多模态大语言模型进行智能交通监控

Murat Arda Onsu, Poonam Lohan, Burak Kantarci, Aisha Syed, Matthew Andrews, Sean Kennedy

机构 * University of Ottawa(渥太华大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 视觉定位与Grounding :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文利用多模态大语言模型和实例分割技术,实现高准确率的交通监控系统,提升交通管理效率和安全性。

Comments 6 pages, 7 figures, submitted to 30th IEEE International Symposium on Computers and Communications (ISCC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14490 2026-01-23 cs.CV cs.AI cs.CL cs.LG 75%

GutenOCR: A Grounded Vision-Language Front-End for Documents

GutenOCR:文档的 grounded 视觉-语言前端

Hunter Heidenreich, Ben Elliott, Olivia Dinica, Yosheb Getachew

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GutenOCR 通过微调 Qwen2.5-VL 模型,实现了文档中的 grounded OCR 和检测,提升了 OCR 得分和文本检测召回率,但存在页面线性化和公式布局方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16038 2026-01-23 cs.AI 74%

Grounding Large Language Models in Reaction Knowledge Graphs for Synthesis Retrieval

将反应知识图谱接地于大语言模型以实现合成检索

Olga Bunkova, Lorenzo Di Fruscia, Sophia Rupprecht, Artur M. Schweidtmann, Marcel J. T. Reinders, Jana M. Weber

机构 * Department of Intelligent Systems, Delft University of Technology(智能系统系,代尔夫特理工大学) Department of Chemical Engineering, Delft University of Technology(化学工程系,代尔夫特理工大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本研究通过将反应路径检索转化为图查询生成问题,利用对齐示例的单样本提示提升大语言模型在合成规划中的检索准确性。

Comments Accepted at ML4Molecules 2025 (ELLIS UnConference workshop), Copenhagen, Denmark, December 2, 2025. Workshop page: https://moleculediscovery.github.io/workshop2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15533 2026-01-23 cs.AI 74%

From Generative Engines to Actionable Simulators: The Imperative of Physical Grounding in World Models

从生成引擎到可操作模拟器:世界模型中物理基础的必要性

Zhikang Chen, Tingting Zhu

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文提出将世界模型重新定义为可操作模拟器,强调因果结构和约束意识,以提升医疗决策中的反事实推理和长期预见能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15624 2026-01-23 cs.CV 70%

Explainable Deepfake Detection with RL Enhanced Self-Blended Images

可解释的深度伪造检测与强化学习增强的自混合图像

Ning Jiang, Dingheng Zeng, Yanhong Liu, Haiyang Yi, Shijie Yu, Minghe Weng, Haifeng Shen, Ying Li

机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01910 2026-01-23 cs.AI 70%

MMP-A*: Multimodal Perception Enhanced Incremental Heuristic Search on Path Planning

MMP-A*:多模态感知增强的路径规划增量启发式搜索

Minh Hieu Ha, Khanh Ly Ta, Hung Phan, Tung Doan, Tung Dao, Dao Tran, Huynh Thi Thanh Binh

机构 * Hanoi University of Science and Technology(河内科学技术大学) Vingroup Big Data Research Center(VinGroup大数据研究中心) FPT Software AI Center(FPT软件AI中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 MMP-A*通过融合视觉语言模型的空间感知与自适应衰减机制,提升路径规划的几何精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15652 2026-01-23 cs.AI cs.CR cs.ET 57%

Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models

预测编码与信息瓶颈用于大语言模型中的幻觉检测

Manish Bhatt

机构 * AI Offensive Security Researcher, OWASP(AI攻击防御安全研究员,OWASP)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出了一种结合预测编码和信息瓶颈的轻量级框架,用于高效检测大语言模型中的幻觉,实现了比传统方法更高的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15487 2026-01-23 cs.AI cs.CL cs.MA 57%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15453 2026-01-23 cs.CV 57%

DevPrompt: Deviation-Based Prompt Learning for One-Normal ShotImage Anomaly Detection

DevPrompt: 基于偏差的提示学习用于单正常样本图像异常检测

Morteza Poudineh, Marc Lalonde

机构 * Department of Electrical and Computer Engineering, Concordia University(电气与计算机工程系,康科迪亚大学) Computer Research Institute of Montreal (CRIM)(蒙特利尔计算机研究 institute)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DevPrompt通过结合视觉语言模型的语义能力和基于偏差的评分机制,提升单正常样本图像异常检测的性能和可解释性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15465 2026-01-23 cs.HC 50%

Cloning the Self for Mental Well-Being: A Framework for Designing Safe and Therapeutic Self-Clone Chatbots

为心理健康福祉克隆自我:一种设计安全且治疗性自我克隆聊天机器人的框架

Mehrnoosh Sadat Shirvani, Jackie Crowley, Cher Peng, Jackie Liu, Thomas Chao, Suky Martinez, Laura Brandt, Ig-Jae Kim, Dongwook Yoon

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种设计安全且治疗性自我克隆聊天机器人的框架,旨在通过跨学科方法解决身份混淆和伦理风险,促进心理健康福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15352 2026-01-23 cs.SE 50%

A Prompt-Based Framework for Loop Vulnerability Detection Using Local LLMs

基于提示的本地LLM循环漏洞检测框架

Adeyemi Adeseye, Aisvarya Adeseye

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于本地LLM的循环漏洞检测框架,利用提示技术提高代码分析的准确性和安全性,验证Phi模型在性能上的优势。

Comments Accepted and Waiting to be published ICAI'25: 27th International Conference on Artificial Intelligence https://american-cse.org/csce2025/conferences-ICAI

详情

展开后加载摘要…

URL PDF HTML 收藏