arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-12 至 2026-01-12 共收录 25 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2601.05874 2026-01-12 cs.CL cs.AI 57%

Continual-learning for Modelling Low-Resource Languages from Large Language Models

连续学习用于从大语言模型中建模低资源语言

Santosh Srinath K, Mudit Somani, Varun Reddy Padala, Prajna Devi Upadhyay, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Sciences, Pilani, India(机器智能组,计算机科学与信息系,比拉理工学院和科学学院,印度帕利尼)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 本文提出利用基于词性的代码切换和重放适配器策略,解决从大语言模型构建小语言模型时的灾难性遗忘问题,并在视觉语言任务中验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2510.16769 2026-01-12 cs.AI cs.CL 79%

See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models

见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解

Shuo Han, Yukun Cao, Zezhong Ding, Zengyi Gao, S Kevin Zhou, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05600 2026-01-12 cs.CV cs.CL cs.LG 79%

SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes

SceneAlign: 在复杂视觉场景中将多模态推理对齐到场景图

Chuhan Wang, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) University of New South Wales(新南威尔士大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 SceneAlign通过利用场景图进行结构干预,提升多模态推理在复杂视觉场景中的准确性和忠实性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05939 2026-01-12 cs.CV 77%

Context-Aware Decoding for Faithful Vision-Language Generation

面向上下文的解码方法用于忠实的视觉-语言生成

Mehrdad Fazli, Bowen Wei, Ziwei Zhu

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的上下文嵌入注入方法,通过利用上下文嵌入信号在解码过程中保持视觉一致性,有效减少视觉-语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21329 2026-01-12 cs.CL 67%

Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks

你的推理基准可能并未测试推理:揭示抽象推理基准中的感知瓶颈

Xinhe Wang, Jin Huang, Xingjian Zhang, Tianhao Wang, Jiaqi W. Ma

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 研究发现抽象推理基准中的性能差距主要源于视觉感知限制,而非推理能力不足,需设计分离感知与推理的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05432 2026-01-12 cs.CV cs.AI cs.CL 62%

Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization

基于地图的思考:用于地理定位的强化并行地图增强智能体

Yuxiang Ji, Yong Wang, Ziyu Ma, Yiming Hu, Hailang Huang, Xuecai Hu, Guanhua Chen, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP) Southern University of Science and Technology(南方科技大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05172 2026-01-12 cs.CV cs.AI 62%

CoV: Chain-of-View Prompting for Spatial Reasoning

CoV:基于视角链的立体推理

Haoyu Zhao, Akide Liu, Zeyu Zhang, Weijie Wang, Feng Chen, Ruihan Zhu, Gholamreza Haffari, Bohan Zhuang

机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) Monash University(墨尔本大学) AIML, Adelaide University(阿德莱德大学AIML)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。

Comments Code link https://github.com/ziplab/CoV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11930 2026-01-12 cs.CV cs.AI 62%

AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning

AtomThink: 多模态慢思考与原子步骤推理

Kun Xiang, Zhili Liu, Terry Jingchen Zhang, Yinya Huang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Hanhui Li, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学) Noah’s Ark Lab(诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 AtomThink通过引入原子步骤推理,提升多模态大语言模型的推理性能和效率。

Comments TPAMI accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05336 2026-01-12 cs.RO 50%

Intent at a Glance: Gaze-Guided Robotic Manipulation via Foundation Models

意图一目了然:通过基础模型实现的注视引导的机器人操作

Tracey Yee Hsin Tay, Xu Yan, Jonathan Ouyang, Daniel Wu, William Jiang, Jonathan Kao, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 GAMMA通过结合基础模型和注视技术,实现无需特定任务训练的机器人操作自主控制,提升人机交互的直观性和可扩展性。

Comments Accepted to 2025 RSS Robot Planning in the Era of Foundation Models (FM4RoboPlan) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 5 篇

2511.21272 2026-01-12 cs.CV 85%

Co-Training Vision Language Models for Remote Sensing Multi-task Learning

联合训练遥感多任务学习的视觉语言模型

Qingyun Li, Shuran Ma, Junwei Luo, Yi Yu, Yue Zhou, Fengxiang Wang, Xudong Lu, Xiaoxing Wang, Xin He, Yushi Chen, Xue Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) East China Normal University(东华大学) Wuhan University(武汉大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 RSCoVLM通过联合训练视觉语言模型,提升遥感多任务学习的性能和灵活性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22533 2026-01-12 cs.CL cs.AI 79%

CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records

CliCARE: 在纵向癌症电子健康记录上基于临床指南 grounding 大型语言模型以支持决策

Dongchen Li, Jitao Liang, Wei Li, Xiaoyu Wang, Longbing Cao, Kun Yu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 CliCARE 通过将纵向癌症 EHRs 转换为时序知识图谱并结合临床指南,为肿瘤科医生提供证据支持的决策支持。

Comments Accepted in AAAI Conference on Artificial Intelligence (AAAI-26, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05266 2026-01-12 cs.IR cs.AI cs.CL cs.LG 62%

Retrieval-Augmented Multi-LLM Ensemble for Industrial Part Specification Extraction

基于检索增强的多LLM集成工业零件规范提取系统

Muzakkiruddin Ahmed Mohammed, John R. Talburt, Leon Claasssens, Adriaan Marais

机构 * ERIQ Research Center University of Arkansas - Little Rock(ERIQ研究所以及阿肯色大学-利文斯顿分校) PiLog Group(PiLog集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于检索增强的多LLM集成框架,通过整合多种先进模型提升工业零件规范提取的准确性和完整性。

Comments The 17th International Conference on Knowledge and Systems Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06021 2026-01-12 cs.CL 50%

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards

证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习

Jiajie Zhang, Xin Lv, Ling Feng, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04160 2026-01-12 cs.CL cs.CE q-fin.CP 50%

All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection

并非所有发光的都是金子:一个无参考信息的反事实金融虚假信息检测基准

Yuechen Jiang, Zhiwei Liu, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 RFC Bench通过对比上下文提升金融虚假信息检测性能,揭示无参考设置下的模型局限性。

Comments 48 pages; 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2601.05688 2026-01-12 cs.CV 77%

SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

SketchVL:通过细粒度信用分配进行政策优化以实现图表理解和更多

Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, China(计算机科学与技术学院,西安交通大学) MOE KLINNS Lab, Xi’an Jiaotong University, China(教育部KLINNS实验室,西安交通大学) Zhongguancun Academy, Beijing, China(中关村学院,北京)

专题命中 文档图表理解 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SketchVL通过细粒度信用分配优化,提升多模态大语言模型在图表理解和多领域推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10055 2026-01-12 cs.CV cs.AI 62%

PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language

PsOCR:用于低资源帕什托语言光学字符识别的大型多模态模型基准测试

Ijazul Haq, Yingjie Zhang, Irfan Ali Khan

机构 * organization= Shien-Ming Wu School of Intelligent Manufacturing, South China University of Technology , city= Guangzhou , postcode= 511442 , country= China organization= Artificial Intelligence Department, Guangdong CAS Angels Biotechnology Co. Ltd. , city= Foshan , country= China organization= Department of Software Engineering, Faculty of Electrical \& Computer Engineering, University of Engineering \& Technology , city= Peshawar , postcode= 25000 , country= Pakistan

专题命中 文档图表理解 :InternVL(abstract);分类 cs.CV、cs.AI

AI总结 PsOCR通过合成数据评估大型多模态模型在低资源帕什托语言OCR中的性能,发现Gemini表现最佳,Qwen-7B在开源模型中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 4 篇

2601.05739 2026-01-12 cs.AI cs.CL cs.CR cs.CV 84%

PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of Visibility

PII-VisBench: 在可见性连续体上评估视觉语言模型中个人可识别信息安全性

G M Shahariar, Zabir Al Nazi, Md Olid Hasan Bhuiyan, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 PII-VisBench 评估视觉语言模型在可见性连续体上对个人可识别信息安全性的保护,通过4000个探测器分析不同可见性水平下的隐私泄露情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01042 2026-01-12 cs.CV cs.CR cs.LG 73%

Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach

视频基于多模态大语言模型中的对抗攻击可迁移性:一种跨模态图像到视频的方法

Linhao Huang, Xue Jiang, Zhiqiang Wang, Wentao Mo, Xi Xiao, Yong-Jie Yin, Bo Han, Feng Zheng

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种跨模态图像到视频的对抗攻击方法,用于研究视频多模态大语言模型的可迁移性,实验表明该方法在多个视频-文本多模态任务中表现出强对抗转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05254 2026-01-12 cs.CV cs.AI cs.LG 67%

Explaining Low Perception Model Competency with High-Competency Counterfactuals

用高能力反事实解释低感知模型能力

Sara Pohland, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出五种生成高能力反事实图像的方法,用于解释模型预测不确定性的原因,并通过实验验证了其在生成语言解释中的有效性。

Journal ref Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2580

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14367 2026-01-12 cs.CV 57%

Hallucination Score: Towards Mitigating Hallucinations in Generative Image Super-Resolution

幻觉分数:朝着减轻生成图像超分辨率中的幻觉

Weiming Ren, Raghav Goyal, Zhiming Hu, Tristan Ty Aumentado-Armstrong, Iqbal Mohomed, Alex Levinshtein

机构 * University of Waterloo(多伦多大学) AI Center – Toronto, Samsung Electronics(三星电子人工智能中心)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出幻觉分数以衡量和减轻生成图像超分辨率中的幻觉问题,通过多模态大语言模型生成 HS 并用于模型微调。

Comments 31 pages, 21 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 5 篇

2506.12409 2026-01-12 cs.CV 74%

Branch, or Layer? Zeroth-Order Optimization for Continual Learning of Vision-Language Models

分支还是层?零阶优化用于视觉-语言模型的持续学习

Ziwei Liu, Borui Kang, Wei Li, Hangjie Yuan, Yanbing Yang, Wenbin Li, Yifan Zhu, Tao Feng, Jun Luo

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本文提出一种基于零阶优化的视觉-语言模型持续学习方法,通过模态感知策略提升模型逃避局部极小值的能力,实验表明在四个基准测试中取得最佳性能。

Comments Published in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05851 2026-01-12 cs.CL cs.AI cs.CV 73%

Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs

Router-Suggest: 动态路由用于视觉 grounded 对话中的多模态自动补全

Sandeep Mishra, Devichand Budagam, Anubhab Mandal, Bishal Santra, Pawan Goyal, Manish Gupta

机构 * IIT Kharagpur(印度IIT卡拉格浦大学) Microsoft(微软公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Router-Suggest 通过动态路由选择文本模型和 VLMs,提升多模态对话中的自动补全效率和用户满意度。

Comments Accepted to EACL 2026 Industry Track, 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03666 2026-01-12 cs.CL cs.AI cs.CV 73%

e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings

e5-omni: 显式跨模态对齐用于多模态嵌入

Haonan Chen, Sicheng Gao, Radu Timofte, Tetsuya Sakai, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of Würzburg(乌尔姆大学) Waseda University(早稻田大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 e5-omni通过显式对齐方法改进多模态嵌入,解决相似性尺度不一致、负样本效果下降和跨模态统计不匹配问题。

Comments https://huggingface.co/Haon-Chen/e5-omni-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23243 2026-01-12 cs.CV 70%

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

遥感图像的多模态解释:动态分辨率输入策略与多尺度视觉-语言对齐机制

Siyu Zhang, Lianlei Shan, Runhe Qiu

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出动态分辨率输入策略与多尺度视觉-语言对齐机制,提升遥感图像多模态解释的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 57%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏