arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 16 篇

2608.30255 2026-09-01 cs.IR 新提交 88%

CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval

CAMIE:用于Snap动态产品广告检索的协同交互感知多模态物品嵌入

Xiaodong Liu, Siman Wang, Congfei Zhang, Hsiang-wei Chao, Xiao Bai, Wen Zhang, Jingxiao Ma, Zhe Liu, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract)

AI总结 针对Snap动态产品广告检索的挑战,提出CAMIE框架,基于LLM/MLLM主干与协同交互数据微调,线上部署后显著提升多场景下的CTR与CVR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29607 2026-09-01 cs.CV cs.IR 新提交 83%

SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions

SnapBench:面向移动交互的抓拍提问多模态检索基准测试

Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) Tsinghua University(清华大学) ARC Lab, Tencent(腾讯ARC实验室) The University of Hong Kong(香港大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究推出首个鲁棒抓拍提问多模态检索配对基准SnapBench,评估16种多模态检索器,发现图像损坏严重影响检索,还提出自适应融合方法MOOR,凸显模态校准的必要性。

Comments 37 pages. Yuanbao Technical Report. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26861 2026-09-01 cs.IR cs.CL 版本更新 83%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29084 2026-09-01 cs.CR 新提交 82%

UiAs: User-Independent 3D Facial Anti-Spoofing via Multi-modal Wireless Signals

UiAs:基于多模态无线信号的用户无关三维人脸反欺骗

Zhiwei chen, Lebin Lyu, Yimo Zhang, Dingyu Zhong, Yijie Li, Yichao Chen, Dian Ding, Jiguo Yu, Xiaosong Zhang, Yongzhao Zhang

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 UiAs是基于毫米波与声学的多模态三维人脸反欺骗系统,通过跨模态减法抑制用户相关几何变化,结合皮肤锚定对比学习,对未见过的用户实现93.25%的反欺骗准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14747 2026-09-01 cs.CV cs.AI 版本更新 81%

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

MMLongEmbed: 长上下文场景下的多模态嵌入模型基准测试

Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang

机构 * Soochow University(苏州大学) Ant Group(蚂蚁集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态嵌入模型在长上下文场景中缺乏系统评估的问题,提出首个综合基准MMLongEmbed,涵盖文本、文档和视频模态的检索任务,揭示模型依赖浅层特征匹配、难以捕捉深层语义依赖等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30163 2026-09-01 cs.IR cs.CV 新提交 79%

Doc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented Generation

Doc-REFRAG:重新思考多模态文档检索增强生成

Ruofan Hu, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Ke Lei, Tao Jin, Zhou Zhao

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态RAG模型在多图像场景中准确率有限且计算开销大的问题,提出基于大规模数据集DocLongRAG的问题引导框架Doc-REFRAG,其在六个基准上优于11个基线,实现SOTA准确率且推理延迟更低。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-09-01 cs.CV 版本更新 79%

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-09-01 cs.CV 版本更新 79%

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-09-01 cs.CV 版本更新 79%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-09-01 cs.LG cs.AI 版本更新 74%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00104 2026-09-01 cs.CV cs.AI 版本更新 62%

R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架

Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出R3G框架,通过先制定推理计划指定所需视觉线索,再采用粗检索加细粒度重排序的两阶段策略选择证据图像,在MRAG-Bench上提升六种多模态大语言模型在九个子场景中的准确率,实现整体最优性能。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 8602-8606, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29951 2026-09-01 cs.AI cs.IR 新提交 57%

Spatial Matryoshka Training for Multi-Granularity Visual Document Retrieval

面向多粒度视觉文档检索的空间嵌套训练

Trishan Singha Roy, Arkadeep Acharya, Vishwajeet Kumar, Jaydeep Sen, Sachindra Joshi

机构 * IBM(国际商业机器公司)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 针对视觉文档检索的多模态晚期交互检索器存储成本高、压缩级别固定的问题,提出ColSNAP训练方法,可生成嵌套压缩层级,实现灵活的精度-存储权衡,大幅压缩下仍保持检索性能并可迁移至多类骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28981 2026-09-01 cs.LG eess.AS 新提交 57%

V2TATC: A Joint Voice-Trajectory Embedding Framework and Dataset for Air Traffic Controller Situational Awareness

V2TATC:用于空中交通管制员态势感知的联合语音-轨迹嵌入框架与数据集

Louis Brusset, Mathurin Petit, Jordan Kam, Alexandre Bayen

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 跨模态检索 :cross-modal(abstract);分类 eess.AS

AI总结 V2TATC是联合语音-轨迹嵌入框架,结合多模态技术,在旧金山湾区空域验证有效性,发布配对数据集并开展多类实验,助力空中交通管制员态势感知。

Comments 41 pages, 21 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22850 2026-09-01 cs.CV 版本更新 57%

What is the Right Embedding Space for Contrastive Learning in Referring Expression Counting?

REC中对比学习的合适嵌入空间是什么?

Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(斯通布鲁克大学) EPFL(苏黎世联邦理工学院)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 该研究针对REC任务现有对比学习策略的局限,提出视觉嵌入空间的C-REX框架,作为即插即用模块提升REC及类别无关计数任务性能,在REC上MAE最高提升28%、RMSE提升24.5%。

Comments ECCV 2026 (15 pages, 4 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30337 2026-09-01 cs.LG q-bio.BM 新提交 50%

Coarse composition suffices: tabular in-context learning for multi-activity antimicrobial peptide profiling

粗组合已足够:用于多活性抗菌肽分析的表格式上下文学习

Raunak Kumar, Anuj Pal, Dhruvi Solanki, Parikshit Pareek, Juhi Singh, Jitin Singla

机构 * Indian Institute of Technology Roorkee(印度鲁基工业学院) Indian Institute of Science(印度科学学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究提出一种仅用序列描述符结合TabPFN的简单流程,在ESCAPE数据集上多活性抗菌肽预测性能超越主流复杂模型,且对远程同源物提升显著,推理无需结构预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16318 2026-09-01 cs.LG 版本更新 50%

Semantics at an Angle: When Cosine Similarity Works Until It Doesn't

角度语义:余弦相似度何时有效及失效

Kisung You

机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏