arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-19 至 2026-01-19 共收录 25 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2601.11075 2026-01-19 eess.IV cs.CV physics.med-ph 79%

Visual question answering-based image-finding generation for pulmonary nodules on chest CT from structured annotations

基于视觉问答的肺部结节胸部CT图像查找生成

Maiko Nagao, Kaito Urata, Atsushi Teramoto, Kazuyoshi Imaizumi, Masashi Kondo, Hiroshi Fujita

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本研究提出基于视觉问答的肺部结节胸部CT图像查找生成方法,通过构建VQA数据集实现交互式诊断支持,提升医生对影像发现的精准解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12198 2026-01-19 cs.CV 57%

ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models

ViSTA: 基于多模态适配器的文本到图像扩散模型用于视觉叙事

Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal

机构 * Department of Computer Science, Georgetown University(计算机科学系,乔治城大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 ViSTA通过多模态历史适配器提升文本到图像扩散模型在视觉叙事中的生成一致性与文本对齐能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 2 篇

2601.11322 2026-01-19 cs.CV cs.LO 83%

Enhancing Vision Language Models with Logic Reasoning for Situational Awareness

通过逻辑推理增强视觉语言模型以提升情境感知能力

Pavana Pradeep, Krishna Kant, Suya Yu

机构 * CIS Department, Temple University(Temple大学计算机与信息科学系) ARL(美国陆军研究实验室)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文通过整合逻辑推理与传统计算机视觉方法,提升视觉语言模型在情境感知中的准确性与细粒度事件识别能力。

Comments Accepted for publication in IEEE Transactions on AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00070 2026-01-19 cs.RO cs.AI 57%

Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics

Robot-R1: 通过强化学习提升机器人中的具身推理

Dongyoung Kim, Sumin Park, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学) UC Berkeley(加州大学伯克利分校) RLWRLD

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 Robot-R1通过强化学习提升机器人中的具身推理,优于SFT方法并超越GPT-4o在低级动作控制推理任务中

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 8 篇

2312.03543 2026-01-19 cs.CV cs.AI 81%

GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models

GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型

Haicheng Liao, Huanming Shen, Zhenning Li, Chengyue Wang, Guofa Li, Yiming Bie, Chengzhong Xu

机构 * Univ City(大学城市)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。

Journal ref Communications in Transportation Research 4 (2024) 100116

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06899 2026-01-19 cs.AI 79%

V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking

V2P: 通过背景抑制和中心峰值校准实现GUI定位的视觉注意力校准

Jikai Chen, Long Chen, Dong Wang, Qinglin Su, Zhixuan Chu, Bingguang Hao, Leilei Gan, Chenyi Zhuang, Jinjie Gu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 V2P通过背景抑制和中心峰值校准方法提升GUI元素定位精度,实现更精确的GUI交互。

Comments This work was intended as a replacement of arXiv:2508.13634 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02358 2026-01-19 cs.CV 77%

VINO: A Unified Visual Generator with Interleaved OmniModal Context

VINO:一个具有交错多模态上下文的统一视觉生成器

Junyi Chen, Tong He, Zhoujie Fu, Pengfei Wan, Kun Gai, Weicai Ye

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 VINO通过统一的视觉生成框架实现图像和视频的生成与编辑,利用交错多模态上下文条件处理,提升多任务视觉创作能力。

Comments Project page: https://sotamak1r.github.io/VINO-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06204 2026-01-19 cs.CV cs.MA 74%

Cascading multi-agent anomaly detection in surveillance systems via vision-language models and embedding-based classification

通过视觉-语言模型和基于嵌入的分类实现监视系统中的级联多代理异常检测

Tayyab Rehman, Giovanni De Gasperis, Aly Shmahell

机构 * University of L’Aquila(拉奎拉大学) SPEE S.R.L(SPEE公司)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 本文提出一种级联多代理框架,结合视觉-语言模型和嵌入分类,实现高效且可解释的异常检测,减少延迟并提升监控系统性能。

Comments Author email changed, Acknowlegement changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11514 2026-01-19 cs.CV cs.LG 62%

ShapeR: Robust Conditional 3D Shape Generation from Casual Captures

ShapeR: 从随意捕获序列中生成鲁棒的条件3D形状

Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Henry Howard-Jenkins, Daniel DeTone, Pierre Moulon, Qirui Wu, Zhengqin Li, Julian Straub, Richard Newcombe, Jakob Engel

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 ShapeR通过整合视觉-惯性SLAM、3D检测和视觉-语言模型,从随意捕获的序列中生成鲁棒的条件3D形状,实验显示其在Chamfer距离上优于现有方法2.7倍。

Comments Project Page: http://facebookresearch.github.io/ShapeR Video: https://www.youtube.com/watch?v=EbY30KAA55I

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03585 2026-01-19 cs.CV cs.AI cs.CL 62%

Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation

Causal-SAM-LLM:大型语言模型作为因果推理器用于稳健的医学分割

Tao Tang, Shijie Xu, Jionglong Su, Zhixiang Lu

机构 * City University of Hong Kong, Hong Kong, China(香港城市大学) Xi’an Jiaotong-liverpool University, Suzhou, China(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Causal-SAM-LLM利用大型语言模型作为因果推理器,提升医学图像分割的鲁棒性和泛化能力。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23044 2026-01-19 cs.CV 57%

Video-Browser: Towards Agentic Open-web Video Browsing

Video-Browser: 向具有代理能力的开放网页视频浏览迈进

Zhengyang Liang, Yan Shu, Xiangrui Liu, Minghao Qin, Kaixin Liang, Nicu Sebe, Zheng Liu, Lizi Liao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Video-Browser通过金字塔感知技术,在开放式网络视频浏览中实现37.5%的相对提升,同时减少58.3%的token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22753 2026-01-19 cs.CL 50%

Opportunities and Challenges of LLMs in Education: An NLP Perspective

大语言模型在教育中的机遇与挑战:一种自然语言处理视角

Sowmya Vajjala, Bashar Alhafni, Stefano Bannò, Kaushal Kumar Maurya, Ekaterina Kochmar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文从自然语言处理视角探讨大语言模型在教育中的应用,分析其在教学、学习和评估中的机遇与挑战。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2511.06404 2026-01-19 cs.CV 57%

InfoAffect: Affective Annotations of Infographics in Information Spread

InfoAffect: 信息传播中信息图的情感标注

Zihang Fu, Yunchao Wang, Chenyu Huang, Guodao Sun, Ronghua Liang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 InfoAffect数据集通过多模态大语言模型和递归排名融合算法,实现了信息图情感标注的高准确度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 1 篇

2601.10835 2026-01-19 cs.CV cs.AI 84%

Can Vision-Language Models Understand Construction Workers? An Exploratory Study

视觉-语言模型能理解建筑工人吗?一项探索性研究

Hieu Bui, Nathaniel E. Chodosh, Arash Tavakoli

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Villanova University(维拉诺瓦大学) Department of Computing Sciences(计算科学系) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估了三种视觉-语言模型在识别建筑工人行为和情绪方面的性能,发现GPT-4o表现最佳,但需进一步改进以提高实际应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 2 篇

2510.05611 2026-01-19 cs.CL cs.AI 70%

MADIAVE: Multi-Agent Debate for Implicit Attribute Value Extraction

MADIAVE:多智能体辩论用于隐式属性值提取

Wei-Chieh Huang, Cornelia Caragea

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 MADIAVE通过多智能体辩论框架提升隐式属性值提取的准确性和鲁棒性,适用于多模态电子商务场景。

Comments Accepted by EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10527 2026-01-19 cs.AI cs.CL cs.CV cs.LG 67%

A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告

Xingjun Ma, Yixu Wang, Hengyuan Xu, Yutao Wu, Yifan Ding, Yunhan Zhao, Zilong Wang, Jiabin Hua, Ming Wen, Jianan Liu, Ranjie Duan, Yifeng Gao, Yingshui Tan, Yunhao Chen, Hui Xue, Xin Wang, Wei Cheng, Jingjing Chen, Zuxuan Wu, Bo Li, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation institute(上海创新研究院) Deakin University(德克萨斯大学) UIUC(伊利诺伊大学香槟分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。

Comments 41 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 8 篇

2601.11464 2026-01-19 cs.CV cs.AI cs.CL cs.LG 89%

MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models

MHA2MLA-VLM: 使DeepSeek的经济型多头潜在注意力在视觉-语言模型中生效

Xiaoran Fan, Zhichao Sun, Tao Ji, Lixing Shen, Tao Gui

机构 * DeepSeek

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MHA2MLA-VLM通过参数高效的方法将现有视觉-语言模型转换为多头潜在注意力架构,减少缓存足迹并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17807 2026-01-19 cs.CV 83%

Attention Debiasing for Token Pruning in Vision Language Models

视觉语言模型中用于标记剪枝的注意力去偏

Kai Zhao, Wubang Yuan, Yuchen Lin, Liting Ruan, Xiaofeng Lu, Deng-Ping Fan, Ming-Ming Cheng, Dan Zeng

机构 * School of Communication and Information Engineering, Shanghai University(通信与信息工程学院,上海大学) School of Computer Science and Engineering, Shanghai University(计算机科学与工程学院,上海大学) School of Computer Science and Engineering, Nankai University(计算机科学与工程学院,南开大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出两种轻量有效的注意力去偏技术,用于改进视觉语言模型中基于注意力的标记剪枝,以提升计算效率和模型性能。

Comments https://github.com/intcomp/attention-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05879 2026-01-19 cs.HC 82%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10781 2026-01-19 cs.CV 70%

Future Optical Flow Prediction Improves Robot Control & Video Generation

未来光流预测改进机器人控制与视频生成

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FOFPred通过统一的视觉-语言模型和扩散架构,实现高效的未来光流预测,提升机器人控制与视频生成的性能。

Comments Project Site (Code, Models, Demo): https://fofpred.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11269 2026-01-19 cs.CV cs.AI 62%

X-Distill: Cross-Architecture Vision Distillation for Visuomotor Learning

X-Distill:跨架构视觉蒸馏用于视觉-运动学习

Maanping Shao, Feihong Zhang, Gu Zhang, Baiye Cheng, Zhengrong Xue, Huazhe Xu

机构 * Tsinghua University(清华大学) Institute for Interdisciplinary Information Sciences(交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 X-Distill通过跨架构知识蒸馏结合视觉转换器和紧凑型CNN,实现了在数据有限的机器人操作任务中优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11248 2026-01-19 cs.CV 57%

Language-Agnostic Visual Embeddings for Cross-Script Handwriting Retrieval

跨脚本手写检索的语言无关视觉嵌入

Fangke Chen, Tianhao Dong, Sirry Chen, Guobin Zhang, Yishu Zhang, Yining Chen

机构 * School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) Shanghai Innovation Institute(上海创新研究院) School of Electrical and Electronic Engineering (EEE), Nanyang Technological University(南洋理工大学电子与电气工程学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种轻量级双编码框架,通过学习语言无关的视觉嵌入,实现跨脚本手写检索的高精度与低资源消耗。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11243 2026-01-19 cs.CV 57%

Image-Text Knowledge Modeling for Unsupervised Multi-Scenario Person Re-Identification

图像-文本知识建模用于无监督多场景人物重识别

Zhiqi Pang, Lingling Zhao, Yang Liu, Chunyu Wang, Gaurav Sharma

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出图像-文本知识建模用于无监督多场景人物重识别,通过三阶段框架提升跨场景识别性能。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01720 2026-01-19 cs.CV 57%

FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing

FFP-300K:用于通用视频编辑的可扩展首帧传播

Xijie Huang, Chengming Xu, Donghao Luo, Xiaobin Hu, Peng Tang, Xu Peng, Jiangning Zhang, Chengjie Wang, Yanwei Fu

机构 * FDU(阜新大学) Tencent YouTu Lab(腾讯优图实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 FFP-300K通过构建大规模数据集和改进框架,实现了无指导的首帧传播,提升视频编辑的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 1 篇

2601.10945 2026-01-19 cs.CV cs.AI cs.CL 81%

PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis

PatientVLM 与 DocVLM 相遇:为高效诊断的预咨询对话

K Lokesh, Abhirama Subramanyam Penamakuri, Uday Agarwal, Apoorva Challa, Shreya K Gowda, Somesh Gupta, Anand Mishra

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出预咨询对话框架,通过视觉语言模型模拟医生与患者对话,利用合成症状提升诊断效率。

Comments Accepted at AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏