arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 84 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2608.25575 2026-08-27 cs.CV cs.AI 新提交 92%

MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations

MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏

Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony Group Corporation(索尼集团公司)

专题命中 图文多模态 :MLLM(title,title_cn);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 81%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-27 cs.CL 新提交 79%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yawei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25580 2026-08-27 cs.CV cs.AI 新提交 62%

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

V-Rubrics:基于评分规则的强化学习实现视觉忠实性

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) UIUC(伊利诺伊大学厄巴纳-香槟分校) A*STAR(新加坡科技研究局)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉-语言模型回答缺乏视觉依据的问题,提出基于评分规则的强化学习方法V-Rubrics,通过分解响应为原子命题并从三方面评分,训练的模型在相关推理基准上性能优于基线。

Comments Proj page: https://shulin16.github.io/v-rubrics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25037 2026-08-27 cs.AI cs.CL cs.DB cs.IR 新提交 62%

Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs

检索、匹配、升级:基于VLM蒸馏的交叉编码器与智能体VLMs的准确且可扩展的商品链接

Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald

机构 * DoorDash Inc.(DoorDash公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大规模商品链接的成本与精度矛盾,提出“检索-匹配-升级”级联框架,用VLM蒸馏的交叉编码器处理多数简单案例,智能体VLM解决模糊案例,提升了链接覆盖率且降低成本。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16558 2026-08-27 cs.CV cs.MM 版本更新 62%

Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models

基于分割的注意力熵:在大视觉-语言模型中检测和缓解对象幻觉

Jiale Song, Jiaxin Luo, Xue-song Tang, Kuangrong Hao, Mingbo Zhao

机构 * School of Information and Intelligent Science, Donghua University, Shanghai, 201620, China(信息与智能科学学院,东华大学,上海,201620,中国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于分割的注意力熵(SAE),通过语义分割量化视觉注意力不确定性,设计可靠性评分和注意力调整方法,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-08-27 cs.CR cs.AI cs.CV 版本更新 62%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 17 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25707 2026-08-27 cs.LG 新提交 50%

Fairness-Aware Test-Time Prompt Tuning

感知公平性的测试时提示调优

Yoann Launay, Parameswaran Kamalaruban, Tom Kempton, Stuart Burrell, David Sutton

机构 * University of Cambridge(剑桥大学) Visa Inc.(维萨公司) University of Manchester(曼彻斯特大学)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 本文针对分布偏移下视觉-语言模型的公平性问题,提出了感知公平性的情节式测试时自适应方法FairTPT,通过软提示调优联合优化熵,实现公平性提升并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2608.25157 2026-08-27 cs.CV cs.MM cs.SD 新提交 82%

What Do Audio-Visual Synchronization Metrics Actually Measure?

视听同步指标究竟测量什么?

Jai Kumar Sharma, Peeyush Tapadiya

机构 * Virginia Tech(弗吉尼亚理工大学) Accenture(埃森哲公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究审计了AV-Align等4种视听同步指标,发现它们在不同任务上各有优劣且一致性差,建议以含置信区间的指标类别细分形式报告视听同步结果。

Comments Accepted at the ECCV 2026 Workshop on Generative AI for Audio-Visual Content Creation (Gen4AVC), poster presentation; non-archival workshop. 7 pages (4-page main text + references + 2-page appendix), 3 figures, 8 tables. Project page: https://jaishrm07.github.io/avsync-reliability-card/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-08-27 cs.CV 版本更新 74%

HEDGE: A Calibrated Ensemble for A/H Recognition

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24909 2026-08-27 cs.HC cs.CV cs.SD 新提交 57%

Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans

超级明星:面向数字人的流式实时交互智能体

Wentao Jiang, Youchen Xie, Haidi Fan, Yajing Chen, Xin Wang, Ye Shi, Jingya Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文针对交互式数字人提出流式实时同步言语手势生成任务,构建耦合流式语音响应与在线手势生成的框架,经实验验证其在延迟-质量权衡等方面优于现有基线。

Comments Accepted by ACM Multimedia 2026. Project Page: \url{https://super-star-2026.github.io/}

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2608.26067 2026-08-27 cs.CV 新提交 83%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25529 2026-08-27 cs.CV 新提交 79%

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

机构 * TJU(天津大学) Tencent Youtu Lab(腾讯优图实验室) SJTU(上海交通大学) Tencent Hunyuan(腾讯混元) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文推出Video-IFBench基准,构建含四类模板的指令分类体系与半自动数据 pipeline,评估20余种MLLMs的视频指令遵循能力,发现当前模型在复杂指令上仍具挑战,推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-08-27 cs.CV 版本更新 79%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25433 2026-08-27 eess.SP 新提交 78%

BeamGuard: Risk-Aware Multimodal Beam Forecasting and Adaptive Virtual Beamwidth Control for 6G mmWave V2I Links

BeamGuard:面向6G毫米波车联网(V2I)链路的风险感知多模态波束预测与自适应虚拟波束宽度控制

Abidemi Orimogunje, Dejan Vukobratovic, Sunwoo Kim, Igbafe Orikumhi, Vukan Ninkovic, Evariste Twahirwa, Gaspard Gashema

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 BeamGuard是面向6G毫米波V2I链路的多模态感知辅助波束管理框架,通过融合多模态传感与带内观测预测波束分布,实现自适应虚拟波束宽度控制,在DeepSense 6G数据集上较基线方法性能更优,可实现鲁棒的低开销波束管理。

Comments Accepted for Publication in IEEE Open Journal of the Communications Society . 18 pages, 5 figures, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17068 2026-08-27 cs.LG cs.SY eess.SY 版本更新 78%

Spatio-temporal dual-stage hypergraph MARL for human-centric multimodal corridor traffic signal control

时空双阶段超图多智能体强化学习用于以人为中心的多模式走廊交通信号控制

Xiaocai Zhang, Neema Nassir, Milad Haghani

机构 * Department of Infrastructure Engineering, Faculty of Engineering and Information Technology, The University of Melbourne, VIC 3010, Australia(工程与信息技术学院基础设施工程系,墨尔本大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出STDSH-MARL方法,通过时空双阶段超图注意力机制和混合动作空间,提升走廊交通信号对多模式旅行者和公共交通的适应性与优先级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-08-27 cs.CV 版本更新 77%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交 67%

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 视频多模态 :MLLM(abstract_cn);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: https://video-reason.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26094 2026-08-27 cs.CV cs.AI cs.ET cs.HC cs.LG 新提交 62%

MyoMechanix: Biomechanically-Grounded Compositional Skilled Activity Understanding and Coaching

MyoMechanix:基于生物力学的可组合技能活动理解与指导

Hao Yin, Paritosh Parmar, Lijun Gu, Lin Xu, Tianxiao Guo, Xiujin Liu, Tianyou Zheng, Yang Zhang, Weiwei Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) Arexeni Research and Technologies Inc.(Arexeni研究与技术公司) Beijing Sports University(北京体育大学) University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MyoMechanix多模态生态系统,构建FKG与CUBIST,建立三类任务,多模态方法提升AQA性能与可解释性,为物理AI提供生物力学基础的技能理解方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03176 2026-08-27 cs.CV cs.HC 版本更新 57%

Frequency-Decorrelated Temporal Ensembles for EEG--fNIRS Imagined-Handwriting Decoding

用于EEG-fNIRS想象手写解码的频率去相关时间集成

Xiao Fan, Hongbin Guo, Yubo Han, Yi Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究针对EEG-fNIRS想象手写解码难题,提出FRED系统,采用频率去相关时间集成等方法,在多模态脑机接口挑战赛中取得较好成绩,揭示了关键性能来源。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 12 篇

2608.18504 2026-08-27 cs.AI 版本更新 85%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08897 2026-08-27 cs.CV cs.AI cs.CL cs.MM 版本更新 85%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25412 2026-08-27 cs.CV 新提交 83%

AdaptiveEmbed: Sample-Adaptive Multi-Vector Representation for Multimodal Retrieval

AdaptiveEmbed:面向多模态检索的样本自适应多向量表示

Xinze Liu, Lei Yang, Dayan Wu, Hengjie Zhu, Zihao Zhang, Hanqi Wu, Tianzhu Hu, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出样本自适应多向量表示(SAMVR)新设定,构建AdaptiveEmbed框架,通过多组对比学习等技术实现样本级自适应容量分配,在多模态检索基准上验证其性能优于固定容量方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06156 2026-08-27 cs.CV cs.AI cs.CL 版本更新 82%

MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control

MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制

Yuchi Wang, Dingkang Yang, Haiyang Yu, Weikang Bian, Jiefeng Long, Xiao Liang, Chao Feng, Hongsheng Li

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26091 2026-08-27 cs.IR cs.CL cs.CV 新提交 81%

PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Checking for Civil Standard Plans

PlanSightRAG:面向民用标准图纸的自动化问答与合规检查的视觉优先多模态检索增强生成模型

Nabaraj Subedi, Shuvo Dip Datta, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对民用标准图纸的OCR自动化方法会丢失关键几何信息,本文提出视觉优先多模态RAG框架PlanSightRAG,整合多向量检索与智能体架构,构建基准数据集并验证其在检索、合规检查任务上的性能,还实现了自主视觉规则 grounding。

Comments 32 pages, 9 figures, 25 tables. Preprint submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25986 2026-08-27 cs.AI 新提交 79%

Multi-Granularity Context-Enhanced RAG over Multimodal Knowledge Graphs

面向多模态知识图谱的多粒度上下文增强检索增强生成

Zongyu Wu, Yilong Wang, Xiaochen Wang, Minhua Lin, Zhichao Xu, Fenglong Ma, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Utah(犹他大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有多模态知识图谱RAG方法的语义鸿沟问题,本文提出CEMMKG框架,通过多粒度局部与全局上下文增强,有效提升了多模态GraphRAG的性能与适用性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25780 2026-08-27 cs.IR 新提交 78%

PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval

PUMA:用于高效检索的通用多模态嵌入的事后稀疏化

Matteo Attimonelli, Alessandro De Bellis, Franco Maria Nardini, Claudio Pomo, Cosimo Rulli, Rossano Venturini, Tommaso Di Noia

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对通用多模态嵌入的高存储与推理成本问题,提出无需微调主干网络的PUMA稀疏自编码器方案,在五个基准上验证其可实现8-16倍存储压缩与最高25倍检索加速,且多数数据集性能与密集检索相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 78%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25023 2026-08-27 cs.AI cs.CV 新提交 62%

CVE-SAI: Counterfactual Visual Evidence-Guided Selective Attribute Indexing for Risk-Controlled E-commerce Search

CVE-SAI:用于风险可控电商搜索的反事实视觉证据引导的选择性属性索引

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CVE-SAI方法,将电商属性推断与索引准入分离,通过反事实视觉证据控制风险,在5%不安全准入预算下,于Amazon Berkeley Objects数据集上实现了更优的属性补全与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26088 2026-08-27 cs.AI cs.LG 新提交 57%

Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings

行星预测引擎:通过智能数据选择和基础模型嵌入实现自主地理空间预测

Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin, Mandar Sharma, Mimi Sun, Hamed Sadeghi, Dav M. Ebengo, Mbulayi Onesime, Rouslan Solomakhin, John Wamburu, William Ogallo, Aisha Walcott-Bryant, Sanxing Chen, Arbaaz Muslim, Yael Mayer, Ronald Ho, Roy Lee, Ruth Alcantara, Abdoulaye Diack, Monica Bharel, Lambert Rosique, Jeremy Amez-Droz, Christopher Haire, James Manyika, Yossi Matias, Niv Efron, Gautam Prasad, Shravya Shetty

机构 * Google Research(谷歌研究院) Institut National de Recherche Biomédicale(国家生物医学研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出行星预测引擎(PPE),一种自主AI系统,可根据自然语言查询完成地理空间预测的端到端工作流程,在多类任务中优于现有模型,降低了行星规模分析的技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏