arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-25 至 2026-08-25 共收录 22 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 22 篇

2608.22724 2026-08-25 cs.CE 新提交 90%

Frontiers in FinTech: Multimodal Foundation Models for Financial Reporting and Decision Science

金融科技前沿:面向财务报告与决策科学的多模态基础模型

Yulu Huang, Niannian Yu, Yaxin Yang, Yong Huang

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title);MLLM(abstract,abstract_cn);cross-modal(abstract)

AI总结 针对异构财务数据对会计信息系统的挑战,本研究提出多模态大语言模型FinVision,经200家上市公司验证可降低19%估值误差,48名专业用户测试缩短51%任务时间,助力审计自动化与财务分析民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21443 2026-08-25 cs.CV 新提交 85%

Text-Guided Visual Dependency Graph Learning with Cross-Modal Attention Priors

基于跨模态注意力先验的文本引导视觉依赖图学习

Fei Wang, Yutong Zhang, Yang Ye, Jinxian Chen, Wang Wenshuai, Xiong Wang

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出CM-GLasso框架,结合文本可视化、交叉注意力蒸馏和联合ADMM,在八个基准上取得最优分类与分割性能,可生成可解释的稀疏条件依赖图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21430 2026-08-25 cs.AI cs.CL cs.CV cs.CY 新提交 85%

Evaluating Multimodal Narrative Understanding of Popular Hollywood Films

评估热门好莱坞电影的多模态叙事理解能力

David Bamman, Kent K. Chang, Allison Cooper, Juishan Hsu, Reina Kushihashi, Madison Mar, Arnav Podichetty, Rachael Samberg, Ipek Nil Sancak, Yuhan Shao

机构 * Bowdoin College(鲍登学院) UC Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究构建了符合票房受欢迎度与公有领域标准的好莱坞电影多模态数据集,建立了相关MCQ基准,发现多数视觉-语言模型表现接近随机,视听模型最高准确率61.1%,均低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22214 2026-08-25 cs.AI cs.MM 新提交 84%

Query-Driven Multimodal Information Extraction from Long Documents

面向长文档的查询驱动多模态信息抽取

Yikai Gao, Ding Xia, Xi Yang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.AI、cs.MM

AI总结 针对现有多模态长文档信息抽取范式的不足,本文提出查询驱动的图像-文本联合抽取任务,构建基准ITJoint并设计多智能体框架Q2IT,实验显示Q2IT性能显著优于独立VLMs但仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-08-25 cs.CL cs.CV 新提交 81%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02592 2026-08-25 cs.CV cs.LG 版本更新 79%

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

H-OPD:置信感知异构多教师多模态在线策略蒸馏

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ByteDance(字节跳动) USTC(中国科学技术大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) Zhongguancun Academy(中关村科学城)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23176 2026-08-25 cs.IR 新提交 78%

Evaluating Modern RAG: Textual, Multimodal, Dense, and Late Interaction Pipelines

评估现代RAG:文本、多模态、密集型与后期交互管道

Emre Kuru, Mehmet Onur Keskin

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 该研究针对传统RAG在含视觉元素文档上的局限,提出数据驱动的RAG管道选择方法,评估了文本、多模态等现代RAG管道的性能与效率权衡,为实际应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16183 2026-08-25 cs.CV 版本更新 77%

Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation

面向真实世界放射学的专家级视觉-语言基础模型及综合评估

Xiaohong Liu, Guoxing Yang, Yulin Luo, Jiaji Mao, Xiang Zhang, Haibo Wang, Zhiyang He, Ming Gao, Shanghang Zhang, Jun Shen, Guangyu Wang

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本研究提出面向放射学的开源VL基础模型RadFound,通过增强视觉编码器与跨模态学习设计,在自主构建的真实世界基准RadVLBench上显著优于其他VL模型,具备专家级放射学多模态处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22996 2026-08-25 cs.CV 新提交 70%

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

ENCORE:面向鲁棒视觉-语言理解的熵引导裁剪与注意力正则化方法

Yuanhao Sun, Huawei Ji, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 ENCORE是一个熵引导的视觉-语言理解框架,通过基于熵的裁剪策略和熵正则化训练,仅微调0.14%参数,在10个VQA基准上实现平均1.43%的准确率提升,达到2B参数VLMs的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21773 2026-08-25 cs.CR eess.SP 新提交 67%

Privacy Preserving Semantic Communications in Wireless Edge Networks with Vision Language Models

基于视觉语言模型的无线边缘网络中隐私保护语义通信

Haoran Chang, Mingzhe Chen, Qianqian Zhang

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 该研究针对无线边缘网络语义通信的隐私泄露问题,提出基于VLM的隐私保护语义通信框架,通过私有区域移除、加密收发器和语义信息瓶颈实现隐私保护,同时保证重构质量并抑制跨设备冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-25 cs.CL cs.AI cs.CV 版本更新 67%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22263 2026-08-25 cs.CV cs.AI 新提交 62%

Training-Free VLM Personalization via Calibrated Residual Decoding

基于校准残差解码的无训练VLM个性化方法

Jiaao Yu, Yujian Ma, Xianming Hu, Pengran Wang, Ang Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练校准残差解码框架,通过构建三类证据条件估计个性化边际贡献,经实验在多数据集上提升了VLM的个性化多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-25 cs.CV cs.AI 版本更新 62%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-08-25 cs.CV cs.AI 版本更新 62%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08884 2026-08-25 cs.CV cs.AI 版本更新 62%

Beyond RGB: Benchmarking and Enhancing MLLMs for Hyperspectral Image Understanding via Training-Free Reasoning Framework

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Xiaoya Fan, Zjin Liao, Haoyuan Liang, Yibin Wen, Yuhang Chen, Chan Tsz Ho, Bi Tianyuan, Ruifeng Su, Zihao Qiang, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23143 2026-08-25 cs.CV 新提交 57%

An end-to-end-trained vision-language model for native-language prostate pathology report generation

用于生成本土语言前列腺病理报告的端到端训练视觉-语言模型

Christian Grashei, Fabian Gülhan, Maximilian Legnar, Fabian Stögbauer, Cleo-Aron Weis, Carolin Mogler, Peter Schüffler

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Munich Center for Machine Learning(慕尼黑机器学习中心) University Hospital Heidelberg(海德堡大学医院) Heidelberg University(海德堡大学) Interdisciplinary Center for Scientific Computing (IWR)(跨学科科学计算中心(IWR))

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 该研究提出语言独立的切片级视觉-语言框架,用自动化流水线生成17344对图像-文本对,实现德语前列腺病理报告生成,恶性肿瘤检测F1达96.2%,可支持机构用自有档案训练本土语言报告模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22485 2026-08-25 cs.CV 新提交 57%

HeatTok: Enhancing Remote Sensing Image Understanding via Thermodiffusion-based Tokenization

HeatTok:基于热扩散分词的遥感图像理解增强方法

Yingying Yan, Jiaqi Tang, Wei Wei, Qianzhou Wang, Jinjian Wu, Botong Geng, Jianmin Chen, Yuyang Xia, Lei Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HeatTok分词器,结合热扩散聚合与G-MRoPE编码,在VRSBench、EarthVQA数据集上实现遥感图像理解的最优性能,保留对象级语义完整性。

Comments 19 pages (10 pages main text + appendix), 10 figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026), Rio de Janeiro, Brazil, November 10--14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22313 2026-08-25 cs.CV 新提交 57%

Adapting Dense Vision-Language Relationships for Multi-label Classification with Partial Label

适配密集视觉-语言关系的部分标签多标签分类方法

Cheng Chen, Yifan Zhao, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对部分标签多标签分类中统计先验导致的过拟合问题,提出语言驱动的密集语义适配器LDSA,结合密集对比适配器与类特定提示调整的交互解码器,在公开基准上取得当前最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22143 2026-08-25 cs.AI 新提交 57%

Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems

小型视觉-语言模型在定性力学问题上的评估

Henry Fordjour Ansah (1), Shreya Banerjee (1), Pranish Ghimire (1) ((1) Louisiana State University of New Orleans)

机构 * Louisiana State University of New Orleans(新奥尔良路易斯安那州立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究评估Gemma-3和Qwen-VL两个多模态模型解读力学问题图像的能力,通过思维链评估其推理过程,对比答案测准确率,为小型视觉-语言模型在定性力学问题上的应用提供评估依据。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21659 2026-08-25 cs.CV 新提交 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27910 2026-08-25 cs.AI 版本更新 57%

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

跨架构视觉语言模型中基于方向的推理时防御措施审计

Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16327 2026-08-25 cs.CV 版本更新 57%

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

用于文本引导医学图像分割的定位注入视觉语言语义融合

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

机构 * Air Force Engineering University(空军工程大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。

Comments 12 pages, 6 figures, 7 tables. v2: revised presentation with updated author affiliations; abstract condensed; Figure 1 redrawn; an average performance column added to Table I; one reference added and three removed; author biographies removed. All datasets, methods and experimental results are unchanged from v1

详情

展开后加载摘要…

URL PDF HTML 收藏