arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 220 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 220 篇

2608.02688 2026-08-05 cs.LG cs.AI 新提交 70%

Learning Molecular Representations from Cellular Phenotypes with Structure Preservation

基于结构保留的细胞表型分子表示学习

Xuan Lin, Jingyu Sheng, Tengfei Ma, Li Sun, Dapeng Xiong

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Beijing University of Posts and Telecommunications(北京邮电大学) Southeast University(东南大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出结构保留的PhenMol框架,通过解耦分子与细胞表示实现表型引导对齐,在多类任务上提升性能,为药物发现整合细胞表型与化学知识提供了有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00798 2026-07-02 cs.CV 新提交 70%

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction

ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测

Yaofei Duan, Yuhao Huang, Tianyu Zhang, Yuan Gao, Luyi Han, Xin Wang, Xinyu Xie, Xinglong Liang, Chunyao Lu, Muzhen He, Patrick Pang, Yue Sun, Ning Mao, Tao Tan, Ritse Mann

机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00374 2026-07-02 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交 70%

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

学习组合:重新审视零样本组合图像检索的代理任务设计

Jingjing Zhang, Lei Zhang, Zheren Fu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27307 2026-06-26 cs.CV 新提交 70%

See & Sniff: Learning Visuo-Olfactory Representations

See & Sniff: 学习视觉-嗅觉表征

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。

Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08144 2026-06-09 cs.CV 新提交 70%

IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval

IMAGINE:自适应模式-意象增强组合用于组合视频检索

Jiale Huang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Chunxiao Wang, Yupeng Hu

机构 * Shandong University(山东大学) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对组合视频检索中修改文本隐含语义与显式视觉内容不匹配的问题,提出自适应模式-意象增强组合网络(IMAGINE),通过动态多模态原型捕获隐含概念并调制视觉特征,在三个基准上达到最优性能。

Comments Accepted by ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00551 2026-08-04 cs.IR 新提交 67%

PHA-Net: Prototype-based Hierarchical Alignment Network for Text-Video Retrieval

PHA-Net:用于文本-视频检索的基于原型的分层对齐网络

Xiaolun Jing, Kezhao Yin, Xinxing Yang, Genke Yang, Jian Chu

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract)

AI总结 针对文本-视频检索中跨模态语义不匹配及计算成本高的问题,提出PHA-Net,以模态共享原型为桥梁,结合原型支持的令牌合并模块与原型对比损失,在四个基准数据集上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14115 2026-07-17 cs.AI cs.CL cs.CV 新提交 67%

DialogueVPR: Towards Conversational Visual Place Recognition

DialogueVPR:迈向对话式视觉场所识别

Yukun Song, Changwei Wang, Xingtian Pei, Shibiao Xu, Wenhao Xu, Shunpeng Chen, Yu Zhang, Ke Zhang, Rongtao Xu, Xuxiang Feng, Pengyang Wang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Shandong Computer Science Center, Qilu University of Technology(山东省计算中心(国家超级计算济南中心),齐鲁工业大学) Macquarie University(麦考瑞大学) Spatialtemporal AI(时空人工智能公司) University of Macau(澳门大学) Aerospace Information Research Institute(航天信息研究所)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对语言引导地理定位中现有方法不足,提出DlgPR,将场所识别转为对话驱动推理过程。构建DlgQuest-Cities基准及统一推理框架,用课程训练DQ-pilot,通过特定指标指导学习并实验,该方法显著优于基线。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12295 2026-06-11 cs.CV cs.CL cs.IR 新提交 66%

Findings of the MAGMaR 2026 Shared Task

MAGMaR 2026 共享任务结果

Alexander Martin, Dengjia Zhang, Joel Brogan, Francis Ferraro, Jeremy Gwinnup, Reno Kriz, Teng Long, Kenton Murray, Andrew Yates, Xiang Xiang

机构 * Johns Hopkins University(约翰霍普金斯大学) OpenAI University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Air Force Research Laboratory(空军研究实验室) Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人类语言技术卓越中心) University of Amsterdam(阿姆斯特丹大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 跨模态检索 :multimodal(abstract,comments);分类 cs.CV、cs.CL

AI总结 本文介绍MAGMaR 2026共享任务的结果,包括视频检索和基于检索视频的生成任务,所有提交系统均超越去年基线。

Comments Findings of the 2nd workshop on Multimodal Augmented Generation via Multimodal Retrieval (MAGMaR); Resources at this url: https://github.com/rekriz11/MAGMAR_2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14252 2026-08-17 cs.AI cs.CL 新提交 62%

Grounding Without Corrective Control: Truth-Tracking Profiles for Large Language Models

无校正控制的基础:大语言模型的真值追踪剖面

Brett Reynolds

机构 * Humber Polytechnic(亨伯理工学院) University of Toronto(多伦多大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型中无校正控制的基础问题,提出路径剖面概念以分析真值追踪,指出纯文本模型继承的模式可提供衍生可应答性,不同方法对任务的真值追踪改进可能与表面改进不一致。

Comments 24 pages, 1 figure, 1 table. A six-page methodological supplement, reproducible R script, and constructed data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13939 2026-08-17 cs.CV cs.AI 新提交 62%

CMCNet: Aligning Ultrasound Image Embeddings with Textual TI-RADS Representations for Fine-Grained Thyroid Classification

CMCNet:将超声图像嵌入与文本TI-RADS表示对齐以用于细粒度甲状腺分类

Bingxin Yu, Xueli Wang, Jerry Zhou, Wenyan Wang, Li Wen, Lan Huang, Xin Feng, Fengfeng Zhou, Kewei Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建含600个甲状腺结节的STN数据集,提出CMCNet模型,通过中心间隔对比损失对齐图像与文本嵌入,实现细粒度甲状腺分类,性能优于多类基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12689 2026-08-14 cs.CV cs.AI 新提交 62%

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

Mr3D-VL:面向多参数3D磁共振成像的通用视觉语言基础模型

Zhi Qiao, Xintong Wu, Yichu He, Feng Shi

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对现有3D视觉语言模型无法满足多参数3D MRI跨模态协同推理需求的问题,提出Mr3D-VL模型,通过特定设计实现性能提升,在多项任务上优于同规模的领域及通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12335 2026-08-14 cs.CL cs.MM 新提交 62%

HC-RAG: Evidence-Centric Retrieval-Augmented Generation over Heterogeneous Financial Filings

HC-RAG:面向异构金融文件的以证据为中心的检索增强生成

Siyuan Chen, Huaye Tan, You Li, Jiajun Liang

机构 * Sun Yat-sen University(中山大学) Central South University(中南大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 HC-RAG是面向异构金融文件的以证据为中心的分层跨模态RAG框架,通过构建类型化金融证据图、按意图路由证据,在金融问答基准上较RAPTOR、GraphRAG取得显著性能提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10524 2026-08-12 cs.CV cs.AI 新提交 62%

Rethinking Text-Based Image Retrieval in Specific Domain

重新思考特定领域的基于文本的图像检索

Jingyang Tan, Sheng Yang, Yuanpeng Chen, Jian Wang, Nianjin Ye, Chen Xing, Lanpeng Jia

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对现有TBIR基准的单匹配假设无法适配监控等特定领域的问题,构建了SecMM-TBIR基准,提出SAFT框架解决特定领域TBIR的语义压缩问题,在SecMM-TBIR上平均提升mAP@20达7.8点且优化通用领域性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00361 2026-08-04 cs.CV cs.AI 新提交 62%

Artificial Intelligence for the Characterization of Particles and Fibers by Optical Microscopy

用于光学显微镜下颗粒与纤维表征的人工智能方法

Simiao Sun, Kenneth Ng, Lynn Lee, Astrid Harth, Asami Odate, Aggelos Katsaggelos, Manuel Ballester Matito, Nicholas Eastaugh, Marc Walton

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种带语义锚点的AI蒸馏框架,训练仅视觉输入的学生ViT模型,在颗粒与纤维显微镜表征任务中获80%伪类验证准确率等结果,实现更丰富可解释的表征,适用于相关分析场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00096 2026-08-04 cs.CV cs.AI 新提交 62%

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

基于语义对比学习的表意文字视觉预训练

Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

机构 * Queen Mary University of London(伦敦玛丽女王大学) Jilin University(吉林大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。

Comments ACM MM 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26381 2026-07-30 cs.CV cs.AI 新提交 62%

Zero-Fi: Zero-Shot Wi-Fi-Based Human Activity Recognition via Contrastive Signal-Language Alignment

Zero-Fi:基于对比信号-语言对齐的零样本Wi-Fi人体活动识别

Yitong Shen, Cheng Guo, Peiliang Wang, Jingzhe Zhang, Yi Sheng, Haopeng Zhang, Hongfei Xue, Yili Ren

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Zero-Fi是一种对比信号-语言对齐框架,可在无需新活动类标注Wi-Fi样本或模型适配的情况下,实现基于Wi-Fi的零样本人体活动识别,在大规模公开基准数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24748 2026-07-29 cs.IR cs.AI cs.CL 新提交 62%

VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成

Seonok Kim

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06402 2026-07-08 cs.CV cs.AI cs.LG 新提交 62%

What Images Cannot Say: Language-Guided Olfactory Representation Learning

图像无法表达的:语言引导的嗅觉表征学习

Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等理工学院,IP巴黎,CNRS)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究图像与嗅觉对齐难题,提出SCENT多模态框架,利用视觉语言模型生成场景描述符,训练气味编码器,通过语言引导潜在分解分离特定对象气味与环境贡献,提升跨模态检索性能,产生可解释表征。

Comments ECCV 2026. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_scent_tsonis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04625 2026-07-07 cs.CV cs.AI 新提交 62%

Hierarchical Evidence-Driven Reasoning for Long Document Understanding

用于长文档理解的分层证据驱动推理

Junyu Xiong, Yonghui Wang, Rongjian Gu, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(科大讯飞研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有多模态RAG管道面临的问题,提出分层证据驱动的多模态RAG框架HIEVI-RAG,通过四阶段管道,包括分层问题分解、粗视觉页面检索、细粒度页面验证和内存引导迭代生成,提升长文档理解,效果显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03978 2026-07-07 cs.HC cs.AI cs.CV 新提交 62%

Scalable Semantic Steering of Embedding Projections

嵌入投影的可扩展语义引导

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

机构 * Virginia Tech(弗吉尼亚理工学院) Department of Defense(国防部) Tulane University(路易斯安那州立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。

Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30682 2026-07-01 cs.SD cs.AI eess.AS 新提交 62%

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

ALM2Vec: 利用大型音频语言模型学习通用音频检索的音频嵌入

Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 提出ALM2Vec框架,利用预训练大型音频语言模型学习统一嵌入空间,实现跨域、任务感知的音频检索,支持指令感知检索,在标准基准上表现优异。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27831 2026-06-29 cs.CV cs.AI 新提交 62%

Hippocampus-DETR: An Explicit Memory Object Detection Framework Based on Hippocampus Modeling

Hippocampus-DETR: 基于海马体建模的显式记忆目标检测框架

Zhaoning Shi, Bo Ma, Hao Xu, Zepeng Yang, Bo Liang

机构 * Beijing institute of Technology(北京理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对目标检测模型缺乏显式记忆机制的问题,提出Hippocampus-DETR框架,通过模拟海马体亚区结构实现模式分离与补全,提升检测精度及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26277 2026-06-26 cs.IR cs.AI cs.CE cs.CL cs.LG 新提交 62%

From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations

从点击到意图:基于LLM提炼分类法的跨平台会话嵌入用于金融服务推荐

Dianjing Fan, Yao Li, Kyaw Hpone Myint, Dwipam Katariya, Alexandre G. R. Day, Pranab Mohanty, Giri Iyengar

机构 * Capital One

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对金融服务中网页匿名浏览与移动端登录行为差异导致的意图信号利用不足问题,提出自监督Transformer编码会话嵌入与LLM提炼分类法生成可解释标签的双用途框架,在移动端首页排序和用户转化预测任务上显著提升性能。

Comments Dianjing Fan and Yao Li equally contributed to this work. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12616 2026-06-12 cs.AI cs.CL 新提交 62%

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive: 面向闭环驾驶模拟的人类风格检索增强VLA智能体

Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CL、cs.AI

AI总结 提出PersonaDrive流水线,通过检索风格指令下的人类驾驶演示来调节视觉-语言-动作(VLA)驾驶智能体,实现闭环模拟中多样化的非自车智能体行为,无需针对每种风格重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17906 2026-08-19 cs.AI cs.MA 新提交 57%

AutoResearch: Insight In, Hallucination Out

AutoResearch:输入洞见,输出无幻觉

Yiming Ren, Xiang Liu, Qumeng Sun, Xiao Zhang, Jiahao Li, Haoyang Zhang, Junjie Wang

机构 * EvoMap(伊沃地图)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16417 2026-08-18 cs.CL 新提交 57%

D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

D2-ScaleAgent:面向长文档理解的双维度缩放方法

Hao Zhang, Longrong Yang, Lunhao Duan, Ziyang Wang, Qing-Guo Chen, Shanshan Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15736 2026-08-18 cs.AI 新提交 57%

Toward AI-Friendly Cartography: Understanding How Color Design Influences Foundation Model Spatial Reasoning on Sequential Choropleth Maps

面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理

Yonghe Sun, Zhenjia Liu, Hua Liao, Wenjia Xu, Nai Yang, Weihua Dong, Zhiwei Wei

机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。

Comments 42 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14666 2026-08-18 cs.AI 新提交 57%

Cross-Domain Industrial Fault Detection by Causal Mechanism Monitoring

基于因果机制监测的跨域工业故障检测

Dhiraj Neupane, Mohamed Reda Bouadjenek, Richard Dazeley, Sunil Aryal

机构 * Deakin University(迪肯大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对工业系统的耦合故障检测问题,提出CMR-Mamba方法,通过因果正则化的Mamba编码器与kNN流形评分实现跨域故障检测,在多类耦合故障域上优于基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13495 2026-08-14 cs.CV cs.LG 新提交 57%

TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

TraVEL:面向驾驶视频检索的轨迹引导视频嵌入学习

Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Purdue University(普渡大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出TraVEL框架,将通用多模态嵌入模型适配到驾驶视频检索,结合轨迹监督与Group Relative Policy Optimization,在nuReasoning基准上提升了不同规模模型的运动相关检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11030 2026-08-12 cs.IR cs.CL 新提交 57%

Self-Knowledge Retrieval Augmented Generation Framework for Patent Matching

用于专利匹配的自知识检索增强生成框架

Jian Zhang, Songlin Lei, Zhuohao Yang, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏