arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 25 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 25 篇

2608.30550 2026-09-01 cs.AI cs.CV 新提交 81%

GarmentWeaver: Schema-Aware Structured Synthesis for Multimodal Sewing Patterns

GarmentWeaver:面向多模态缝纫图案的模式感知结构化合成

Yinwen Lu, Weihao Luo, Yueqi Zhong

机构 * Donghua University(东华大学) Ningbo University(宁波大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GarmentWeaver是一种模式感知多模态缝纫图案生成框架,通过分层结构化建模与可行性正则化,生成更准确、可执行且仿真兼容的缝纫图案,性能优于基线方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-09-01 cs.CL cs.CV 版本更新 81%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29357 2026-09-01 cs.AI 新提交 79%

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步级DPO实现的小型多模态搜索智能体

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能) Ohio State University(俄亥俄州立大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出LiteSearch-VL方案,通过轨迹蒸馏和合成步级DPO,在单节点预算下将多模态搜索智能体能力迁移至Qwen3-VL-2B等小型模型,使其在多模态视觉问答任务上取得接近4B模型的性能,明确小型多模态智能体的下一瓶颈是答案验证而非搜索深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29088 2026-09-01 cs.AI 新提交 79%

HANIA: Planner-Guided Multimodal Graph Evidence Selection for Grounded Question Answering

HANIA:规划器引导的多模态图证据选择用于基于证据的问答

Zafar Ali, Asad Khan, Nimbeshaho Thierry, Nabila Amir, Adam A. Q. Mohammed, Pavlos Kefalas

机构 * Southeast University(东南大学) Portland Institute(波特兰研究所) Aristotle University of Thessaloniki(亚里士多德大学) Shandong University(山东大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HANIA框架,通过规划器引导的多模态图证据选择处理ScienceQA问答任务,无需目标数据集微调或迭代检索即可实现具竞争力的多模态问答。

Comments 10 pages, 1 figure. Accepted at Graph-enhanced LLMs for trustwOrthy Web data management (GLOW), ISWC 2026 Workshops, Bari, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29681 2026-09-01 cs.CY 新提交 78%

MMMMM: A Unified Taxonomy for Investigating the Mechanisms of Multilingual MultiModal Misinformation

MMMMM:用于研究多语言多模态虚假信息机制的统一分类体系

Nadav Borenstein, Greta Warren, Desmond Elliott, Isabelle Augenstein

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 该研究针对多模态虚假信息研究的分类体系缺失与自动化不足问题,构建了7种语言的数据集与多模态虚假信息分类体系,结合VLM实现自动化标注,为针对性检测提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28696 2026-09-01 cs.CV 新提交 77%

Instruction Distillation: Text Instructions as Visual Examples

指令蒸馏:将文本指令作为视觉示例

Hardik Jindal, Soumyabrata Pal, Sayak Ray Chowdhury

机构 * IIT Kanpur(印度理工学院坎普尔分校) Adobe Research(奥多比研究院)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对视觉上下文学习的高成本问题,提出指令蒸馏方法,为每个训练图像生成结构化指令,在细粒度视觉分类任务中提升性能并降低推理成本,且视觉与文本ICL信号互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-09-01 cs.MM cs.AI cs.CV cs.GR 版本更新 75%

When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Haoyu Wang, Yangchen Zeng, Jiaqi Zhang, Li Jiuxing, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin, Alexander Lim Han Yang, Yusen Wu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) ByteDance(字节跳动) Nankai University(南开大学) JD Research, JD.com, Inc.(京东研究院(京东有限公司)) Zhejiang University(浙江大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) The University of Hong Kong(香港大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28707 2026-09-01 cs.CL cs.CV 新提交 73%

ReVA: A Region-Aware Visual Assistant for Visually Grounded Question Answering

ReVA:面向视觉接地问答的区域感知视觉助手

Anoop Senthil

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 该研究针对多模态大语言模型视觉问答中存在的物体幻觉问题,提出区域感知模型ReVA,通过双桥接结构融合整图与区域特征,在POPE数据集上将平均F1提升至82.85%,有效改善了视觉接地效果。

Comments 11 pages. Code: https://github.com/anoop675/reva

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30646 2026-09-01 cs.CL cs.AI cs.LG 新提交 62%

BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs

BiG-SURE - 用于大语言模型语义不确定性与可靠性估计的二分图

Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 BiG-SURE是一种基于跨温度语义一致性的二分图方法,用于黑盒LLMs/VLMs的语义不确定性与可靠性估计,在多类问答任务上提升了弃权AUROC性能。

Comments 22 pages, 9 figures

Journal ref EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29996 2026-09-01 cs.CV cs.AI cs.LG 新提交 62%

Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

用于移除大型视觉语言模型中虚假关联的感知分区式遗忘

Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan, Rhongho Jang, Dongxiao Zhu, Prashant Khanduri

机构 * Wayne State University(韦恩州立大学) IIIT Delhi(德里印度信息技术学院) Institute for AI and Data Science (AIDaS), Wayne State University(韦恩州立大学人工智能与数据科学研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出PURGE框架,通过结构化数据集构建和感知分区式遗忘,减少大型视觉语言模型的虚假关联诱导错误,同时保持或提升整体性能。

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29974 2026-09-01 cs.CV cs.CL 新提交 62%

SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models

SpanCalib-VLM:视觉语言模型中经过校准的幻觉跨度检测

Amanuel Gizachew Abebe, Yasmin Moslem

机构 * Shaggar Institute of Technology(沙加尔理工学院) Trinity College Dublin(都柏林圣三一学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SpanCalib-VLM混合双系统,结合多模态序列标注器与微调生成式VLM,经联合校准融合策略优化,在SHROOM-Visions任务上实现幻觉跨度的高效校准检测,公开了模型权重与代码。

Comments Shroom-Visions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29313 2026-09-01 cs.CV cs.AI 新提交 62%

Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training

Hyper3-CLIP:层级条件双曲视觉-语言训练

Matin Mahmood, Antonio Rueda-Toicen, Mohamed ElBassat, Seifeldin Elkerdany, Weixing Wang, Gerard de Melo

机构 * hyper 3 labs(超3实验室) Hasso Plattner Institute(哈索·普拉特纳研究所) University of Potsdam(波茨坦大学) Faculty of Computers and Data Science, Alexandria University(亚历山大大学计算机与数据科学学院) Faculty of Computer Science and Engineering, Alamein International University(阿拉曼国际大学计算机科学与工程学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 Hyper3-CLIP结合层级条件与双曲几何,通过文本构建多粒度查询层级训练视觉-语言模型,提升图像-文本检索与多标签分类性能,在层级指标上保持竞争力。

Comments 16 pages, 2 figures, ECCV 2026 Beyond Euclidean Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13426 2026-09-01 cs.LG cs.AI cs.CL 版本更新 62%

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

减少矩阵乘法:面向大语言模型推理的输入自适应矩阵乘积约简方法

Zixuan Lan, Yanhong Li, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对Transformer语言模型推理开销高的问题,提出无需训练的输入自适应RMM方法,通过选择矩阵乘积信息切片减少计算,在多任务多模型上验证其鲁棒性,可提升长序列推理效率,且适用于多模态场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-09-01 cs.CV cs.AI 版本更新 62%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, Jikai Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026. Code is available at https://github.com/MegviiAlgo-Team/CC-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18176 2026-09-01 cs.CV cs.AI 版本更新 62%

CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification

CLIPure:基于CLIP的潜在空间纯化用于对抗鲁棒零样本分类

Mingkun Zhang, Keping Bi, Wei Chen, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出CLIPure,一种基于CLIP多模态潜在空间的对抗鲁棒零样本分类纯化方法,含两个变体,在多个数据集上大幅提升了对抗鲁棒性,其中CLIPure-Cos不依赖生成模型且防御效率更高。

Comments accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29364 2026-09-01 cs.CV 新提交 61%

Sketch2Inspire: Structure-Sensitive Evaluation for Product Retrieval

Sketch2Inspire:面向产品检索的结构敏感型评估

Ge Kong

机构 * Beihang University(北京航空航天大学)

专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV

AI总结 该研究提出Sketch2Inspire资源,基于CLIP系列编码器评估多模态融合等方法,证实结构敏感检索下多模态输入增益更高,为产品检索评估提供诊断资源。

Comments 15 pages, 2 figures. PRICAI 2026 version. The paper presents Sketch2Inspire, a structure-sensitive evaluation resource for multimodal product retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30480 2026-09-01 cs.CV cs.LG 新提交 57%

VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

VisER:用于大视觉语言模型(LVLMs)中物体幻觉检测的视觉证据与依赖关系

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 VisER 是一种无训练双向指标,通过视觉证据与视觉依赖两个互补视角检测 LVLMs 的物体幻觉,在 AUROC、AUPR 指标上优于多个基线方法。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30209 2026-09-01 cs.CV 新提交 57%

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

DICS:探索数据内在一致性用于视觉指令选择

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Token Hub, Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29923 2026-09-01 cs.CV cs.LG 新提交 57%

Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation

面向开放词汇语义分割中视觉-语言模型的持续测试时适应

Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana, Muhammad Salman Siddiqui, Tor Kristian Stevik, Fadi Al Machot, Kristian Hovde Liland, Habib Ullah

机构 * Norwegian University of Life Sciences (NMBU)(挪威生命科学大学) Tulane University(杜兰大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对开放词汇语义分割中视觉-语言模型在持续测试时分布偏移下的对齐脆弱问题,提出DAF框架,在多数据集上实现mIoU显著提升且鲁棒性良好。

Comments under review. code available at https://github.com/chandlerbing65nm/DAF.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29604 2026-09-01 cs.IR cs.CV 新提交 57%

RePair: Turning Retrieval Failures into Counterfactual Hard Pairs

RePair:将检索失败转化为反事实困难对

Siyi Liu, Xiaorong Zhu, Enjun Du, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 RePair基于CLIP双编码器的视觉-语言检索,通过挖掘假阳性并结合LLM引导的反事实编辑生成困难对,提升数据效率,在Flickr30K和COCO30K上性能优于基线。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28701 2026-09-01 cs.CV 新提交 57%

TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models

TopoAgent:基于大型视觉语言模型的感知到推理的结构感知框架,用于图到图拓扑提取

Bangwei Guo, Xujiang Zhao, Yanchi Liu, Wei Cheng, Shengyu Chen, Dongyue Li, Masaharu Morimoto, Takayuki Kuroda, Dimitris Metaxas, Haifeng Chen

机构 * Rutgers University(罗格斯大学) Meta NEC Labs America(美国NEC实验室) University of Electro-Communications(电气通信大学) NEC Corporation(日本电气公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对图到图拓扑提取任务构建了TopoBench-180基准,并提出TopoAgent框架,结合感知、结构先验与推理,在基准上性能优于现有模型,填补了多模态结构化理解的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21659 2026-09-01 cs.CV 版本更新 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-09-01 cs.CV 版本更新 57%

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

Comments Submitted to IEEE Access for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-09-01 cs.CL 版本更新 57%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30836 2026-09-01 eess.SP 新提交 50%

Channel Gains to Captions: Task-Unified Multi-Level RF Sensing with Vision-Language Models

信道增益到描述:面向任务统一的多级射频感知与视觉语言模型

Tianyu Hu, Zhiren Gong, Haowei Cui, Shuai Wang, Samson Lasaulce, Lingxiang Li, Wassim Hamidouche, Zhi Chen, Merouane Debbah

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出基于VLMs的任务统一多级RF感知框架,通过生成式方案将mmWave/THz信道增益映射为环境语义描述,引入LoRA专家实现级别适配,仿真显示其性能优于基线且适配性更广。

详情

展开后加载摘要…

URL PDF HTML 收藏