arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-05 至 2026-01-05 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 8 篇

2601.00716 2026-01-05 cs.CV cs.AI 84%

Detecting Performance Degradation under Data Shift in Pathology Vision-Language Model

在病理视觉-语言模型中检测数据偏移下的性能退化

Hao Guan, Li Zhou

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出DomainSAT工具,通过输入数据偏移检测与输出置信度指标结合,提升病理VLM在数据偏移下的性能退化检测可靠性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00730 2026-01-05 cs.CV 83%

Grading Handwritten Engineering Exams with Multimodal Large Language Models

用多模态大语言模型评分手写工程考试

Janez Perš, Jon Muhovič, Andrej Košir, Boštjan Murovec

机构 * University of Ljubljana, Faculty of Electrical Engineering(卢布尔雅那大学电子工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本研究利用多模态大语言模型对斯洛文尼亚语手写工程考试进行自动评分,通过多阶段设计实现高可靠性,达到与人工评分约8分的均方差,验证了结构化提示和参考定位的重要性。

Comments 10 pages, 5 figures, 2 tables. Supplementary material available at https://lmi.fe.uni-lj.si/en/janez-pers-2/supplementary-material/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00168 2026-01-05 physics.hist-ph 78%

From Grounding to Stabilisation: Adequacy as a Criterion for Scientific Explanation

从基础到稳定化:充足性作为科学解释的标准

Jonathon Sendall

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出基于稳定化的科学解释标准,通过可测量不变性测试解决无限倒退问题,统一理论变化、量子测量和数学有效性等核心问题。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00777 2026-01-05 cs.SD cs.CV 70%

Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection

探讨在音频深度伪造检测中使用多模态大语言模型的可行性

Akanksha Chuchra, Shukesh Reddy, Sudeepta Mishra, Abhijit Das, Abhinav Dhall

机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) Monash University, Melbourne, Australia(墨尔本大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。

Comments Accepted at IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00513 2026-01-05 cs.LG 57%

When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents

当小模型适用于错误的原因:信任代理的过程验证

Laksh Advani

机构 * Laksh Advani

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。

Comments Accepted to Trustagent workshop AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00448 2026-01-05 cs.CL cs.AI 57%

Language as Mathematical Structure: Examining Semantic Field Theory Against Language Games

语言作为数学结构:对语义场理论与语言游戏的检验

Dimitris Vartziotis

机构 * TWT Science & Innovation(TWT科学与创新) NIKI - Digital Engineering(NIKI数字工程)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过对比语义场理论与语言游戏,探讨语言的数学结构与社会建构的互补性,提出新的理论指导AI架构的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00156 2026-01-05 cs.CV 57%

Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions

聚焦区域面部:为任意选定的面部区域生成细粒度多属性描述

Kaiwen Zheng, Junchen Fu, Songpei Xu, Yaoqing He, Joemon M. Jose, Han Hu, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Shandong University(山东大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Focal-RegionFace模型,通过多阶段微调实现对任意面部区域的细粒度多属性描述生成,提升面部状态分析的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18961 2026-01-05 cs.CV 57%

AnomalyCLIP: Object-agnostic Prompt Learning for Zero-shot Anomaly Detection

AnomalyCLIP:面向零样本异常检测的对象无关提示学习

Qihang Zhou, Guansong Pang, Yu Tian, Shibo He, Jiming Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡管理学院) Harvard University(哈佛大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 AnomalyCLIP通过学习对象无关的文本提示,实现跨不同领域的零样本异常检测,提升异常识别的泛化能力。

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏