arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-19 至 2026-02-19 共收录 49 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2602.15864 2026-02-19 cs.RO cs.CV 70%

ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation

ReasonNavi: 人类启发的全局地图推理用于零样本具身导航

Yuzhuo Ao, Anbang Wang, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。

Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12707 2026-02-19 cs.LG cs.AI cs.MA 62%

PLAICraft: Large-Scale Time-Aligned Vision-Speech-Action Dataset for Embodied AI

PLAICraft: 大规模时间对齐的视觉-语音-动作数据集用于具身人工智能

Yingchen He, Christian D. Weilbach, Martyna E. Wojciechowska, Yuxuan Zhang, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PLAICraft通过大规模时间对齐的视觉-语音-动作数据集,推动具身人工智能的研究与评估。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15862 2026-02-19 cs.CL cs.AI 57%

Enhancing Action and Ingredient Modeling for Semantically Grounded Recipe Generation

增强语义 grounded 的动作和成分建模以实现语义 grounded 的食谱生成

Guoshan Liu, Bin Zhu, Yian Li, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出语义 grounded 的框架,通过两阶段流程结合监督微调和强化微调,提升食谱生成的语义准确性与成分预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 7 篇

2511.13494 2026-02-19 cs.CV cs.AI 81%

Language-Guided Invariance Probing of Vision-Language Models

语言引导的视觉-语言模型不变性探测

Jae Joong Lee

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LGIP基准,用于评估视觉-语言模型对语言扰动的鲁棒性,发现EVA02-CLIP和OpenCLIP表现优异,而SigLIP存在显著缺陷。

Comments Pattern Recognition Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 80%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15873 2026-02-19 cs.RO cs.AI 74%

Test-Time Adaptation for Tactile-Vision-Language Models

测试时适应用于触觉-视觉-语言模型

Chuyang Ye, Haoxian Jing, Qinting Jiang, Yixi Lin, Qiang Li, Xing Tang, Jingyan Jiang

机构 * Shenzhen Technology University(深圳技术大学) New York University(纽约大学) Shenzhen University(深圳大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

AI总结 本文提出了一种可靠性感知框架,用于提升触觉-视觉-语言模型在测试时的适应能力,通过估计各模态可靠性来过滤不可靠样本并优化融合过程,有效提升了在模态损坏情况下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16019 2026-02-19 cs.CV cs.AI 62%

MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval

MedProbCLIP: 基于概率适应的视觉-语言基础模型用于可靠放射影像-报告检索

Ahmad Elallaf, Yu Zhang, Yuktha Priya Masupalli, Jeong Yang, Young Lee, Zechun Cao, Gongbo Liang

机构 * Texas A&M University-San Antonio(德克萨斯A&M大学-圣安东尼奥分校) Boise State University(博伊州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MedProbCLIP 通过概率适应提升放射影像与报告检索的可靠性,优于现有基线方法。

Comments Accepted to the 2026 Winter Conference on Applications of Computer Vision (WACV) Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15927 2026-02-19 cs.CV cs.LG 62%

Visual Memory Injection Attacks for Multi-Turn Conversations

多轮对话中的视觉记忆注入攻击

Christian Schlarmann, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen, Germany(图宾根人工智能中心,图宾根大学,德国)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种多轮对话中的视觉记忆注入攻击,通过操控用户输入实现隐蔽的信息操控,展示了对大视觉-语言模型的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12907 2026-02-19 cs.LG cs.CL 57%

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

SNAP-UQ:单次传递的不确定性估计用于TinyML中的自监督下一次激活预测

Ismail Lamaakal, Chaymae Yahyati, Khalid El Makkaoui, Ibrahim Ouahbi, Yassine Maleh

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 SNAP-UQ通过单次传递的自监督下一次激活预测,为TinyML提供了一种高效且无需额外状态的不确定性估计方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15859 2026-02-19 cs.CL 50%

From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants

从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估

Krittin Pachtrachai, Petmongkon Pornpichitsuwan, Wachiravit Modecrua, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 6 篇

2411.11706 2026-02-19 cs.CV cs.AI 91%

MC-LLaVA: Multi-Concept Personalized Vision-Language Model

MC-LLaVA:多概念个性化视觉-语言模型

Ruichuan An, Sihan Yang, Renrui Zhang, Ming Lu, Tianyi Jiang, Kai Zeng, Yulin Luo, Jiajun Cao, Hao Liang, Ying Chen, Qi She, Shanghang Zhang, Wentao Zhang

机构 * Peking University(北京大学) Intel Labs, China(英特尔实验室,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 MC-LLaVA通过多概念指令微调和个性化提示提升视觉-语言模型的多概念个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16590 2026-02-19 cs.CV cs.AI cs.LG 67%

A Contrastive Learning Framework Empowered by Attention-based Feature Adaptation for Street-View Image Classification

一种由基于注意力的特征适应增强的对比学习框架用于街景图像分类

Qi You, Yitai Cheng, Zichao Zeng, James Haworth

机构 * SpaceTimeLab(时空实验室) University College London(伦敦大学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CLIP-MHAdapter通过引入基于注意力的特征适应机制,提升街景图像属性分类的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16502 2026-02-19 cs.CV 57%

DressWild: Feed-Forward Pose-Agnostic Garment Sewing Pattern Generation from In-the-Wild Images

DressWild: 从真实场景图像生成无需迭代优化的前馈姿态无关服装缝纫图案

Zeng Tao, Ying Jiang, Yunuo Chen, Tianyi Xie, Huamin Wang, Yingnian Wu, Yin Yang, Abishek Sampath Kumar, Kenji Tashiro, Chenfanfu Jiang

机构 * UCLA and Fudan University(UCLA和复旦大学) University of Utah(犹他大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DressWild通过前馈方法从单张真实图像生成物理一致的2D缝纫图案和3D服装,无需多视角输入或迭代优化,实现高效可扩展的服装模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15903 2026-02-19 cs.CV 57%

Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment

利用多变量软融合和基于CLIP的图像-文本对齐检测深度伪造

Jingwei Li, Jiaxin Tong, Pengfei Wu

机构 * Zhejiang Gongshang University(浙江工商大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MSBA-CLIP框架,通过多变量软融合和CLIP引导的伪造强度估计,提升深度伪造检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 57%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16584 2026-02-19 q-bio.NC 50%

The Representational Alignment Hypothesis: Evidence for and Consequences of Invariant Semantic Structure Across Embedding Modalities

表征对齐假说:跨嵌入模态的不变语义结构的证据及其后果

Akhil Ramidi, Kevin Scharp

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究提出表征对齐假说,探讨跨模态嵌入的不变语义结构,质疑其根本性,并提出新的哲学视角和区分方法。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 3 篇

2602.16006 2026-02-19 cs.CV 57%

BTReport: A Framework for Brain Tumor Radiology Report Generation with Clinically Relevant Features

BTReport: 一种用于脑肿瘤放射学报告生成的框架,结合临床相关特征

Juampablo E. Heras Rivera, Dickson T. Chen, Tianyi Ren, Daniel K. Low, Asma Ben Abacha, Alberto Santamaria-Pang, Mehmet Kurt

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Microsoft Health AI(微软健康人工智能) Johns Hopkins School of Medicine(约翰霍普金斯医学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 BTReport通过确定性特征提取和大语言模型结合,生成可解释的脑肿瘤放射学报告,并提供配套数据集提升临床应用

Comments Accepted to Medical Imaging with Deep Learning (MIDL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15010 2026-02-19 cs.RO cs.LG 57%

BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames

BPP: 通过聚焦关键历史帧实现长上下文机器人模仿学习

Max Sobol Mark, Jacky Liang, Maria Attarian, Chuyuan Fu, Debidatta Dwibedi, Dhruv Shah, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 BPP通过聚焦关键历史帧,提升机器人模仿学习在长上下文任务中的表现,成功率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14172 2026-02-19 cs.SD cs.CL cs.LG 57%

Investigation for Relative Voice Impression Estimation

相对语音印象估计研究

Kenichi Fujita, Yusuke Ijima

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 本研究探讨了相对语音印象估计方法,发现自监督语音模型在捕捉复杂感知差异方面表现更优,而多模态大语言模型在此任务中效果不佳。

Comments 5 pages,3 figures, Accepted to Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏